先给结论:升级后评分变化,通常不是“站点真的变差或变好”这一个原因,而是评分口径、数据窗口或抓取样本至少有一项发生了改变。要解释差异,最有效的动作是拿同一批页面,在旧口径和新口径下各留一份可核对的记录,再判断变化来自哪里。下面把常见分歧拆成两个解释,并给出能区分它们的证据。
第一种解释是规则本身变了。工具升级后,可能新增了检查项、调整了某项的扣分方式,或者把原来不参与评分的因素纳入计算。这种情况下,同一页面在新旧版本下分数不同,但页面内容、结构和外链都没动。
第二种解释是数据样本变了。工具升级往往伴随抓取频率、抓取深度或数据来源调整。比如原来只抓首页和少量栏目页,现在抓到了更多深层页面;或者原来用的索引数据更新慢,现在更新快。这时分数变化反映的是“这次看到的页面集合不同”,而不是规则改动。
两个解释可以同时成立,但判断顺序建议先看样本,再看规则。因为样本变化会放大或掩盖规则变化,先固定样本才能让规则差异显形。
把分歧转成可核对项目,关键是固定变量。可以按下面三步做:
做完这三步后,判断依据是:如果同一批 URL 的分项得分中,只有新增检查项或某项权重变化导致总分移动,而各分项原始表现没变,那更可能是规则变了。如果同一批 URL 里有些页面旧版根本没被抓到,新版才出现,且这些页面的分项表现明显不同,那更可能是样本变了。
假设某站长工具升级后,同一批 30 个页面平均分从 78 降到 71。团队里有人认为是站点质量下降,有人认为是工具变严。按上面的方法核对后发现:
这个假设例子里,分数下降的主要来源是样本覆盖变广,把原来没被完整评估的页面纳入了平均。规则可能也有微调,但样本变化足以解释大部分差距。这个结论只适用于这个假设,实际项目要用自己的记录核对。
核对完样本和规则,通常会落到三种后续动作:
需要提醒的是,请求量、抓取量或某项统计归零,不能单独证明处理正确。它也可能是抓取延迟、数据源切换或页面被临时排除造成的。解释前后差异时,把“看到了什么”和“因此推断什么”分开写,后续核对才不会互相矛盾。
运营、编辑和技术对同一份评分有不同理解时,争论往往卡在“你说的是哪个版本、哪批页面、哪个时间”。把这三项写进同一份记录,分歧就会变成可核对的项目。具体做法是:每次导出评分时,同时保存 URL 清单、抓取时间、工具版本标识和分项明细;如果工具没有版本标识,就用导出日期加检查项数量代替。
当有人再问“为什么分数变了”,先对照这份记录,而不是直接归因于内容质量或算法。能区分规则变化和样本变化的那份记录,才是下一步动作的依据。