你让一个人玩没有说明书的小游戏,他会试几步、记住反馈,再慢慢猜出规则。可如果每走一步就让他忘掉刚才的判断,再聪明也很难过关。ARC-AGI-3测的正是后一类难题:AI要在陌生环境中不断行动,从反馈里摸清目标,而且不能靠低效乱试刷分。最近,一张Kaggle排行榜截图引发关注:最高分据称在30天内从7%升至56%。但这组“八倍增长”目前只有一篇Reddit帖子及截图支持,截图还被作者称为“有点过时”,因此更适合看作社区观察,而非已经核实的官方纪录。
它测的不只是答对
ARC Prize将ARC-AGI-3定义为交互式推理基准。所谓交互式,是指系统面对的不是一道静态题,而是一个没有自然语言规则说明的环境。Agent——能观察环境并自主采取行动的AI系统——必须边试边学,建立一套可以随反馈修改的“世界模型”,再完成长期规划和多步操作。
分数也不只看最后有没有通关,还看行动效率。按ARC Prize的说明,100%意味着Agent能以不逊于人类的效率通过全部游戏。因此,56%若成立,当然是显著进展;但它仍不能直接翻译成“AI已有56%的人类智能”。
暴涨的可能是“外接大脑”
这次最值得追查的,不是模型忽然学会了多少,而是Harness变好了多少。Harness是包在模型外面的运行框架,负责保存笔记、整理上下文、调用工具和选择下一步行动。它像玩家的草稿纸和操作台:底层模型没有变化,草稿纸设计得更好,也可能让成绩大幅上升。
OpenAI披露过一个很直观的例子。2026年7月,GPT-5.6 Sol在ARC-AGI-3上只有7.8%。团队后来发现,官方Harness每走一步都会丢弃模型的内部推理;历史过长时,还会裁掉早期行动。改成保留推理、同时用摘要压缩长历史后,公开集得分从13.3%升至38.3%,输出量反而降到原来的六分之一。换句话说,一部分“能力突破”来自不再让模型反复失忆。
Tufa Labs则把无说明书的小游戏重新包装成模型更熟悉的编程任务。其Duck Harness允许模型在Python REPL——可即时运行代码并查看结果的交互环境——里检查棋盘变量、调用辅助函数和执行行动,还会自动淘汰旧消息,节省有限的上下文空间。按Tufa Labs公开的信息,这套方案用一张GPU可运行的小型Qwen模型取得了阶段性里程碑。代码和逐局诊断随后公开,也让后来者能迅速吸收并改进策略。
为什么这件事值得看
它提醒我们,Agent榜单测到的是一整套系统,而不只是“裸模型”。ARC Prize也明确把Kaggle Systems称为受比赛算力约束、为赛事构建的专用系统。小型本地模型能取得高分,可能说明模型本身更会推理,也可能说明参赛者更会保存记忆、组织工具和把环境翻译成模型擅长的问题。现实中的AI产品同样依赖这些外层设计,所以Harness进步并非旁门左道;只是归因时必须分清层次。
局限与未知
- 7%到56%的历史变化尚无ARC Prize或Kaggle官方页面交叉印证,具体起止时间、当前最高分及成绩有效性仍待核实。
- “超过人类平均水平”没有公开的人类基线数值、测试条件和可比口径,暂不能坐实。
- Kaggle注明,公开榜只使用约50%的测试数据,最终名次由另一半决定。公开分数说明方法正在快速进步,却不等于最终结果。