让几个 AI 给学生作文打分,看似能省下大量人工;但如果它们都偏爱某种写法,多数票也只是把偏差放大。BACON 处理的正是这个问题:AI judge——替人打分、排序或贴标签的模型——只当辅助测量,不当标准答案,再用少量人工评分做校准,也就是测出并修正系统偏差。论文举例称,在超过 2.5 万篇美国学生议论文上,人类评分分布尾部更厚,而部分 AI 评委的分数甚至集中在不同峰值。
具体做法是,先让多个 AI 评委覆盖全部项目,同时收集它们的评分、不确定性信号和内容特征;再抽取一小批项目交给人类,训练一个校准模型,推算其余项目更接近人类判断的分数。它既能给单项排序,也能估计整批数据的平均值、分位数等,并附上置信区间——即结果可能波动的范围。作者自述,这套方法在作文、机器翻译和网页设计三类任务中,相比直接使用 AI 原始评分或只靠有限人工标签,降低了汇总结果的偏差与方差;论文未在所给材料中披露统一的提升幅度。