玩数织时,你得让每一行和每一列同时对上数字提示,漏掉一个格子,整张图都可能错。Nonobench 正是用这种谜题检查大模型能否维持全局一致的空间推理:49 款模型只看一次题目,就要提交完整网格,不能调用工具,也没有反馈和重试机会。
作者公开的结果显示,按各模型的最佳推理强度计算,解题率随网格扩大明显下降:5×5 为 85%,10×10 为 46%,15×15 只剩 20%。GPT-6 Astra 解出了标准模式全部 30 题;在由十道唯一解 20×20 题组成的困难模式中,Claude Opus 5.5 解出 8 题,而参测的 15 款模型中有 11 款一题未解。
一个细节尤其值得注意:让模型用一条 400 字符长串输出答案时,多数模型还没遇到真正困难的逻辑,就先数乱了格子;改成由 20 个行字符串组成的数组,才减少这种格式干扰。换句话说,这套开放基准不只测推理,也提醒人们区分“不会解题”和“答案没写整齐”。不过每题仅尝试一次,单次结果会有波动,作者因此同时给出了 95% 区间。