一场考试里,如果考生能写出标准答案的原句,你很难只凭考生一句“我没见过题”判断成绩是否可信。SWE-bench Verified 就遇到了类似麻烦:它让 AI 修复真实 GitHub 项目的软件缺陷。据作者披露,OpenAI 在 2 月停止报告该基准,并建议其他实验室也停用;其测试的每个前沿模型,都能在部分任务中复现人工编写的参考补丁,或逐字说出题目细节。过去半年,成绩进步也只有 6 个百分点,剩余分数究竟有多少来自真实能力,已说不清。
常见补救是“去污染报告”——开发者搜索训练数据,声明没找到评测题或答案。问题在于,外界拿不到训练语料,无法复查;公开完整语料又可能带来版权诉讼风险;改写文本、论坛教程、GitHub 解法和由题目生成的合成数据,也未必能被字面匹配抓到。作者因此主张把证明责任交给评测方:不向参赛者提供答案标签,断网运行评测,由评测方从指定代码版本自行构建并复现成绩,最好在提交冻结后再生成测试数据。这个方案仍不能证明基准本身优秀或绝无泄露,但至少不再把“实验室自查”当成成绩可信的充分证据。