先给结论:自动导出漏掉分页,不能只靠“再导一次”来确认完整性。可行的最小动作是拿导出文件里的分页标识与站点自身可枚举的URL集合做交叉比对,找出缺哪一页、缺的是真分页还是参数噪声,再决定是补导、改规则,还是接受这份数据只用于局部判断。
下面用一个假设情境串起来。假设你负责一个栏目页的SEO巡检,用一款工具自动导出该栏目下的URL清单,导出结果里只出现第1页到第6页,但你在浏览器里手动翻页能看到第7页、第8页。此时要判断的是:这份导出到底漏了多少,漏的部分会不会改变你的结论。
不同工具对分页的表达方式不一样,有的把分页写成独立的URL行,有的把分页作为主URL的附属字段,有的干脆只保留主URL。打开导出文件后,先找三类特征:URL路径里带 page=、/p/、_2 这类分页标记的行;同一路径重复出现但参数不同的行;以及只有主URL、没有任何分页行的栏目。
如果整个文件里一条分页行都没有,先别急着判定“工具漏了”。更合理的解释是导出规则本身只抓主URL,分页被当作重复内容折叠了。这时要去看导出设置里是否有“包含分页”“展开参数URL”之类的选项。具体名称和位置因工具版本而异,需要以你当前使用的界面为准,不要凭记忆下结论。
在缺少完整后台权限的情况下,能做的交叉比对有限,但仍然有几种可执行来源:
把这几处收集到的分页URL去重后,与导出文件做差集。差集里出现的URL就是导出遗漏的候选。这里有一个重要限制:站点地图本身也可能不完整,所以“站点地图里有、导出里没有”只能说明两者不一致,不能直接证明导出错误,也不能证明站点地图正确。
实际操作上,建议先只处理差集中数量最少、路径最规整的那一批。如果差集里全是 ?sort=、?filter= 这类排序筛选参数,它们更可能是参数噪声而非真实分页,优先级可以放低。
同样是“少了第7页”,原因不同,处理方式完全不同:
只有第一种和第二种属于“导出不完整”,第三种属于“页面有问题”。把三者混在一起,会导致你反复补导却始终对不上数。
回到前面的假设:导出只有1到6页,手动能翻到第8页。按上面的顺序走一遍——
第一步,检查导出文件里是否存在任何分页行。假设存在,且都带 page= 参数,说明工具确实在导分页,只是没导全。
第二步,收集手动翻页得到的7、8页URL,与导出做差集,得到两个缺失URL。
第三步,单独访问这两个URL。假设第7页正常,第8页返回跳转回第1页。那么第7页属于真实遗漏,第8页属于页面异常。
第四步,只补导第7页所在的参数范围,重新导出后确认第7页出现。此时导出文件从6页变为7页,第8页仍缺失,但缺失原因已明确,不再影响“该栏目有效分页共7页”这个判断。
这个链条的关键在于:每次动作后都要重新比对,而不是一次性认定“补导就完整了”。补导后仍可能因为规则上限再次截断,所以要看的是差集是否收敛,而不是行数是否增加。
即使差集收敛到零,也只能说明“在你枚举的范围内,导出与手动翻页一致”。它不能证明:
缺少完整数据或权限时,这些结论都超出了证据范围。能安全使用的,只是“在本次枚举范围内,导出遗漏已定位并处理”这一层判断。把这份局部结论直接当成整站数据质量结论,是这类检查里最常见的误用。