把“必须由人判断”的项目写成可核对的分歧记录,再让自动评分只处理能被证据支持的部分,是防止替代的关键。做法不是关掉评分,而是把人工判断的结论变成可追溯的条目:谁提出了什么判断、依据是什么、在什么条件下成立。自动评分一旦无法引用这些条目,就只能作为参考,不能直接替代结论。
多个角色对同一事实有不同理解时,先不要急着让评分工具裁决。事实分歧指的是双方对同一现象的描述不同,例如同一页面在不同时间抓取到的状态不同;判断分歧指的是双方看到相同现象,但对它是否构成问题有不同看法。前者可以通过重新核对来收敛,后者必须保留人的取舍。
把两类分歧分开记录,是防止自动评分越位的第一步。评分工具擅长对可量化项给出统一口径,但无法替你决定“这个差异在当前业务目标下是否可接受”。如果记录里只有分数,没有判断依据,后续复核时人就只能被动接受分数,替代就发生了。
可核对的项目至少要包含三样东西:观察到的具体现象、判断所依赖的条件、以及如果条件变化结论会怎样改变。缺少第三项,项目就只是意见,评分工具很容易用一个统一分值把它覆盖掉。
假设某团队把“标题与正文主题一致性”列为人工判断项。自动评分只能检查标题长度和关键词是否出现,无法判断语义是否匹配。团队把它写成可核对条目后,评分结果仍然保留,但结论栏必须引用人工条目。这样做的结果是:评分变化不会直接改变结论,只会触发对条目的重新核对。
不是所有项目都值得保留人工判断。取舍可以按下面三种前提来分:
一个实际动作是:给每个待判断项标注“最近一次改变结论的原因”。如果连续多次改变结论的原因都相同,说明它可能已经被规则覆盖,可以考虑退出;如果原因每次都不同,说明它依赖具体情境,应继续保留人工判断。
当多个角色对同一事实有不同理解时,争论分数高低通常没有结果,因为分数本身不携带条件。把分歧转成可核对的项目后,讨论对象就从“谁对谁错”变成“哪条依据需要补充或修正”。
操作上可以这样做:每次出现分歧,先记录双方各自引用的现象和条件,再决定是补充核对、改写条目还是暂时保留分歧。这个动作的结果会直接影响下一步——如果分歧能被同一条依据解释,就更新条目;如果不能,就保留两个版本,并注明各自适用的条件。这样自动评分只能作为背景信息,无法单方面替代结论。
人工判断被替代,往往不是因为评分工具太强,而是因为条目太久没有更新。定期检查条目的现象描述是否仍然可复查、条件是否仍然成立、反转条件是否已经出现。检查的结果决定条目是保留、改写还是退出。
如果某项统计归零或抓取量下降,不要直接当作判断正确的证据。它也可能是抓取范围变化、页面结构调整或统计口径改变造成的。先核对条目里的现象描述是否仍然对应同一对象,再决定是否调整判断。这个顺序能避免把相关现象当成因果结论,也能让人工判断保持在可核对的状态。