你拿同一套题反复考学生,他第二次得了高分。问题是:他真的学会了,还是记住了答案?模型榜单也有这层麻烦。公开测试题可能进入训练数据,让高分同时混着能力和“见过题”的优势。训练集又往往不公开,外部观察者很难查证。CleanScore想做的,就是只看模型答题结果,估计公开题面的额外优势,同时诚实说明这个估计能证明什么、不能证明什么。
这里的“基准污染”(benchmark contamination),指测试题或近似版本进入训练数据。论文的全部结果目前只来自作者发布的 arXiv 预印本,尚无独立复现;下文数字都应按这层证据强度理解。
不查训练集,改成给同一道题换衣服
CleanScore是一种“黑箱审计”:不查看模型参数和训练数据,只比较它对精心安排的题目作出的回答。每道公开题都作为一个“母题”,研究者再独立写出两个新版本。新版本保留原来的数字、事实、推理要求和答案,只改变表述。
直觉很简单。如果模型确实擅长解题,那么原题和改写题的表现应该接近;如果它特别熟悉公开措辞,原题成绩可能更高。论文把两者的准确率差称为“公开版本优势”。正值表示模型在公开版本上答得更好。
但改写并不是一面完美的镜子。新题可能稍难、稍别扭,或者恰好更容易。原题领先,不一定来自泄漏;改写题领先,也不能自动洗清嫌疑。因此,CleanScore没有直接宣布“污染”或“干净”,而是报告一个区间:公开题面可能带来的优势,大致落在哪里。
负对照是在测量尺上加一条刻度
为了区分“见过公开题”和“普通措辞差异”,作者另建了从未公开的私有题库。每道私有题同样有一个“公开式”版本和两个改写版本。由于这些题此前没有公开,版本之间的成绩差异可以作为“负对照”(negative control)——理论上不该受到公开题泄漏影响的比较对象。
可以把它理解成测体温前先检查温度计。若温度计对两个本来相同的样本也总有偏差,那么正式读数就不能照单全收。
问题在于,私有题库和真实榜单题不可能完全一样。CleanScore于是引入“transport radius”,即迁移半径:允许负对照里的普通措辞偏差,搬到公开基准时再变化多少。这个半径越大,假设越宽松,最终区间也越宽。
这就是“敏感性边界”:关键假设无法验证时,不硬报一个确定答案,而是展示结论在多大的未观测偏差下仍能成立。它把争议从“你信不信改写题公平”,变成“需要多大的不公平,才会推翻当前判断”。
实测没有亮红灯,但这不是清白证明
作者先做了受控暴露实验:刻意让小模型在训练时见到部分公开题面,再看审计能否发现。SmolLM2-360M的公开题面优势比相关任务对照高0.020,95%置信区间为0.006至0.034,10次训练中9次为正。Qwen2.5-0.5B的点估计方向相同,但区间跨过零;作者将其称为方向一致但统计能力不足。若训练时只给模型看新改写版本,两组模型都没有出现相应信号。
随后,作者审计了5个开放权重模型,从GSM8K和ARC-Challenge各抽取200道题。GSM8K是小学数学文字题基准;ARC-Challenge是科学选择题基准。按预先登记的判断规则,10个“模型—基准”组合都没有出现与公开题面暴露一致的优势。最精确的一项是Phi-3-mini在GSM8K上的公开版本优势为0.018,区间半宽0.035,因此在这套方法、样本和假设下,其表面措辞带来的分数膨胀上界约为5个百分点。
这句话不能扩写成“这些模型的污染都低于5点”。它约束的只是公开原题相对改写题的优势,而且只针对本次抽样、评分方式和敏感性设定。
真正棘手的是:见过题,也可能学会改写题
论文最值得注意的发现,反而来自正对照——作者故意制造污染,看看方法会漏掉多少。
在GSM8K实验中,泄漏公开措辞使模型在原题上的准确率相对未污染对照提高26个百分点;但在模型从未见过的改写题上,准确率也提高了20个百分点。原题与改写题之间只剩约6个百分点差距,而改写审计能直接看到的正是这部分。
作者在4个模型家族上的估计显示,改写审计会漏掉泄漏效应的52%至110%。这是“不可见效应占估计泄漏效应的比例”在不同实验估计中的范围,不是110%的题被泄漏。上界超过100%,可能由估计噪声以及原题、改写题提升幅度的相对关系造成,不能当作普通百分比直读。
ARC的正对照更尖锐。作者称人为植入了49个百分点的优势,但审计观察到的差距却是-0.020;即使重写题干和选项,仍约有20个百分点优势保留下来,而且这一现象跨4个训练随机种子出现。材料没有给出足够细节解释49点与负差距为何方向相反,因此更稳妥的读法是:模型从泄漏中获得的收益可能迁移到新措辞,导致“原题减改写题”接近零,甚至反向。
为什么这套框架值得关注
CleanScore的价值不在于发放“无污染证书”,而在于把一个容易被说得过满的问题拆开:哪些差异可以从输出直接观察,哪些结论依赖改写公平的假设,以及假设放宽后区间会变多宽。
这对无法查看训练集的模型尤其实际。审计者只需要评分结果,不需要模型内部状态、词元概率、可信的干净参照模型,也不必在基准发布前埋标记。它还把结论写成区间,而不是一个看似干脆的污染标签。
更重要的是,论文给自己的方法划出了边界:改写审计主要测“surface-form inflation”,也就是精确题面带来的额外分数。若模型见过一道题后,连改写版本也一起学会了,原题和新题都会变强,两者之差反而很小。此时零结果只能说明没有明显的措辞专属优势,不能说明模型从未见题。
局限与未知
- 全部证据来自同一篇预印本。文中的“registered”表示分析或实验方案预先登记,不等于已经获得独立验证。
- 真实基准审计只覆盖5个开放模型,以及两个基准各200道题,不能外推到所有模型和榜单。
- 负对照库只有40至60个母题,导致敏感性区间较宽。作者也指出,控制库过小会让严格区间接近失去实用性。
所以,CleanScore带来的不是一句“榜单可信”或“榜单失真”。它提供的是一种更克制的问法:高分里有多少优势只属于公开题面?现有数据能把它限制到什么范围?至于模型究竟有没有见过题,改写题本身也可能已经替它保守了秘密。