结论先说:能不能交给自动评分,不取决于项目本身重不重要,而取决于判断依据能否被稳定地写成可核对的规则。如果同一份材料换个人看会得出不同结论,或者结论依赖上下文、意图和取舍,就应保留人工判断;自动评分只做分诊和排序,不直接定案。下面用两种条件展开,并给出可落地的动作。
当项目满足三个前提——输入字段固定、判断标准能逐条列出、例外情况有明确的兜底规则——自动评分可以承担第一轮筛选。典型如“页面是否有可访问的标题”“关键内容是否在首屏之前出现”这类事实型检查,答案不因审阅者不同而改变。
实施动作可以这样设计:把自动评分输出分成三档,高档直接通过,低档直接退回,中间档全部转人工。同时每周从高档和低档里各抽一小部分复核,记录自动判断与人工判断不一致的比例。如果这个比例持续偏高,说明规则本身需要调整,而不是继续扩大自动化范围。这一步的结果会直接影响下一步:不一致率高,就先改规则再放量;不一致率低,才考虑提高自动通过的比例。
需要留意的边界是:抽检一致率高,不能单独证明规则正确。样本可能集中在容易判断的页面,也可能因为审阅者已经习惯了自动评分给出的提示而产生趋同。要区分这两种解释,可以在一段时间内让部分样本先人工判断、后看自动结果,对比顺序颠倒后结论是否变化。
另一类项目的判断依据无法穷举。比如“这段内容对目标读者是否真的有用”“这个改法会不会牺牲另一部分用户的体验”,答案取决于站点定位、读者构成和当期目标,不同的人可以给出都站得住脚的结论。
这类项目如果强行套用自动评分,常见后果是分数高的页面被保留,但实际效果并不好;或者分数低的页面被误删,损失无法从分数里看出来。更稳妥的做法是让自动评分只输出“值得优先看”的清单,把排序权交给人工,人工看完后记录判断理由。理由要写到具体层面,例如“保留是因为它覆盖了咨询量最高的问题”,而不是“感觉还行”。
动作上的关键区别是:这一档不设自动通过,所有条目都要有人签字。签字不是形式,而是留下可回溯的依据,便于日后判断是规则出了问题还是执行走了样。如果某类条目连续多次人工结论一致,可以把它降级到条件一的流程里,逐步扩大自动分诊范围。
不必凭直觉决定。可以取一批已经有人工结论的历史样本,让自动评分先跑一遍,然后看两类证据:
这两类证据要分开看。结论稳定但错误代价高,仍应保留人工;结论不稳定但错误代价低,可以先自动试跑并观察。
假设有 200 个页面需要判断“是否值得继续维护”。自动评分给出 150 个高分、50 个低分。先人工复核这 50 个低分页面,如果其中 40 个确实不值得维护,说明规则在这批样本上可用;如果只有 20 个符合,剩下 30 个各有保留理由,说明判断依据里混入了上下文因素,此时不应直接按分数处理,而应把“保留理由”归纳成新规则,再重新验证。这个数字只用于说明比较方法,不代表任何实际项目的结果。
这些动作的共同点是让自动评分承担它擅长的部分,同时让人工判断留下痕迹。具体到你所用的工具,哪些字段可配置、哪些结果可导出、是否支持人工复核记录,需要以实际界面和官方说明为准,不要凭印象假定。
回到标题的问题:防止被替代的关键不是拒绝自动评分,而是先分清哪些判断能被写成规则、哪些必须依赖上下文,再据此决定自动评分停在哪一步。只要人工签字这一环没有被省略,自动评分就只是加速器,不会变成替代者。