Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.020 — 2026-07-24
PAPER H 13 约 1 分钟

AI评委偏了,少量人工来校准

BACON用少量人工答案校准多个AI评委,让大规模评分更接近人的判断。

让几个 AI 给学生作文打分,看似能省下大量人工;但如果它们都偏爱某种写法,多数票也只是把偏差放大。BACON 处理的正是这个问题:AI judge——替人打分、排序或贴标签的模型——只当辅助测量,不当标准答案,再用少量人工评分做校准,也就是测出并修正系统偏差。论文举例称,在超过 2.5 万篇美国学生议论文上,人类评分分布尾部更厚,而部分 AI 评委的分数甚至集中在不同峰值。

具体做法是,先让多个 AI 评委覆盖全部项目,同时收集它们的评分、不确定性信号和内容特征;再抽取一小批项目交给人类,训练一个校准模型,推算其余项目更接近人类判断的分数。它既能给单项排序,也能估计整批数据的平均值、分位数等,并附上置信区间——即结果可能波动的范围。作者自述,这套方法在作文、机器翻译和网页设计三类任务中,相比直接使用 AI 原始评分或只靠有限人工标签,降低了汇总结果的偏差与方差;论文未在所给材料中披露统一的提升幅度。


供稿材料 SOURCES — 1

← 返回 2026-07-24 · 数据板块