结论先说:当自动评分在少量样本上表现正常、但放量后不断出现例外时,通常不是“再加一个阈值”能解决的,而是要把评分降级为初筛信号,把最终判断权交回人工,并明确哪些项目必须人工过一遍。保留、改写还是退出,取决于例外是否集中在可描述的一类项目上。
放量后例外变多,常见原因有三类:一是样本量小的时候恰好没覆盖到某类页面;二是评分规则依赖的字段本身不稳定,比如内容长度、外链数量这类容易被短期操作影响的指标;三是不同业务目标被压进同一个分数,比如获客页和品牌页用同一套权重。
判断方法很直接:把最近一批被自动评分判为“合格”但人工复核后认为不合格的项目单独拉出来,看它们是否共享某个特征,例如同属一个栏目、同一批模板、同一来源的导入数据。如果例外能归成两三类,说明规则可改写;如果例外杂乱无规律,说明这套评分和你的业务目标已经脱节,继续调参收益很低。
如果人工抽查发现例外占比不高,且纠正成本可以接受,比较务实的做法是保留评分,但改变它的使用位置——从“决定项”降为“排序项”。具体动作:把自动评分只用于给待处理项目排队,人工从高分和低分两端各抽一部分复核,而不是只信分数。
这样做的结果会直接影响下一步:如果两端抽查都稳定,说明评分适合继续做初筛,可以把抽查比例调低;如果低分段频繁出现被误杀的好项目,说明扣分项设计有问题,应优先改扣分逻辑,而不是整体推翻。
改写的前提是例外有明确边界。假设一个场景:某批列表页在自动评分里长期偏低,但人工判断它们承担的是导航和聚合作用,本就不该用内容深度类指标衡量。这时合理的改法是给这类项目单独设一套判断条件,或者直接把它们从自动评分范围里排除,改为人工定期看。
改写时要注意一个取舍:规则越细,维护成本越高,也越容易在业务调整后失效。建议只对反复出问题、且数量占比不低的那一类项目做特殊处理,其余仍走统一规则。改写后要重新跑一遍历史样本,确认原来被误判的项目确实被纠正,同时没有把原本判对的项目带偏。
如果出现下面这些情况,继续维护这套评分的性价比通常很低:例外无法归类,每次都要临时讨论;评分依赖的字段频繁变动,需要不断打补丁;团队实际决策时已经不看分数,只看人工备注。此时更合理的做法是停用自动评分,改为按项目类型分别列出人工检查要点。
退出不等于放弃自动化。可以把原来评分承担的“排优先级”功能,换成更简单的规则,比如按更新时间、按负责人、按业务线分批处理,把省下来的维护精力放到人工复核上。
这套顺序的核心不是追求评分更准,而是让评分只做它擅长的事,把需要理解业务意图的判断留给人工,并在两者之间划出一条可复查的边界。