把人工判断固化成自动评分,通常不是一开始就错,而是小样本阶段确实有效,样本一多就出现例外。要防止替代,关键不是拒绝评分,而是让评分只做筛选、不做结论,并保留可追溯的人工复核入口。
在百度推广查询的日常使用中,一个常见做法是:先人工看几十条结果,总结出几条判断规则,再把这些规则写成评分,用来批量处理。小范围里,这套评分和人工结论高度一致,于是被当成可以独立使用的判断依据。
规模扩大后,问题开始出现。原本被人工判定为“需要进一步核实”的样本,被评分直接归入合格或不合格;一些明显异常的记录反而因为分数接近阈值而被放过。这不是评分突然变坏,而是它从一开始就只覆盖了人工判断的一部分。
第一种解释是规则不完整。人工判断时,人会同时看字段是否齐全、来源是否一致、时间是否合理、表述是否自相矛盾,而评分往往只截取了其中两三个可量化的维度。剩下那些“说不清但看得出”的部分,被规则漏掉了。
第二种解释是样本分布变了。小样本可能集中在某一类查询结果上,规则对这类样本拟合得很好;规模扩大后,出现了新的来源、新的表述方式或新的组合情况,评分没有对应的判断分支,只能按旧规则硬套。
这两种解释对应不同的处理方向。如果是规则不完整,需要补充判断维度;如果是分布变化,需要的是分层抽样复核,而不是继续加规则。
可以做一个假设性的对照:把评分结果按来源或类型分组,分别统计人工复核后的不一致比例。
这些统计只能说明相关性,不能单独证明评分本身有问题。请求量下降、抓取量归零或某类结果突然减少,也可能来自采集范围调整、页面改版或查询条件变化,需要结合具体记录判断。
具体做法是:不再让评分直接输出“通过/不通过”,而是输出“高分优先人工看”“低分抽样人工看”“中间区间全部人工看”。
执行后,下一步取决于复核结果。如果中间区间的人工不一致率持续偏高,说明阈值设置不合理,应调整区间而不是放宽标准;如果低分抽样里频繁出现被误杀的好样本,说明评分缺少某个正向维度,应补充后再观察。这个动作的结果直接影响后续是继续用评分、修改评分,还是回到人工为主。
这套方法适合判断标准相对稳定、但存在大量边缘情况的查询场景。如果判断本身依赖实时上下文、人工经验难以写成稳定规则,或者样本类型每天都在变化,自动评分更适合只做粗筛,不能替代结论。
另外,具体工具的评分字段、阈值设置和复核入口,会随工具版本和账号权限变化,需要以实际界面和说明为准。任何评分都只是辅助,最终判断仍应保留人工确认的环节。