你可以把这次发布想成一场特殊的考试:AI在很短时间内交来几百组答案,其中一些还配了机器检查记录。问题不只是答案对不对,而是老师根本来不及批完。一个月前,OpenAI还因一项千禧年难题相关成果引发争议;如今,它又公开了覆盖数百个开放问题的研究材料。这里的“开放问题”,只是尚无公认解答的问题,难度差异很大,并不都等于黎曼猜想这样的世纪难题。
OpenAI官方称,这些结果来自一个尚未发布的内部前沿模型,研究细节和部分Lean形式化证明已经上传GitHub。Lean是一种编程语言兼证明助手:研究者把定义和每一步推导写成机器可读的形式,它便能检查推理是否遵守既定规则。但机器检查通过,不等于数学界已经接受这项成果。
先别急着数“破解了多少题”
不同来源采用了不同统计口径。《华尔街日报》称,OpenAI发布了超过300个问题的研究结果;量子位根据OpenAI目录报道了372组结果、722篇手稿。问题、结果组和手稿不是一回事,不能把这些数字混成“解决了722道难题”。
据量子位转述OpenAI材料,模型此前尝试了约4000个研究问题,平均每项结果耗费的算力,约相当于ChatGPT Pro思考3小时。绝大多数结果由同一个内部模型按固定流程生成。不过,黎曼ζ函数的无零点区域,以及复乘阿贝尔簇上的霍奇猜想相关结果,没有完全遵循这套流程;其中一份手稿还经过人工编辑。
最吸引眼球的几组结果,都碰到了数学界最著名的问题,但“碰到”不等于完整解决。
黎曼猜想要求相关零点落在实部为的直线上。手稿声称,黎曼ζ函数以及所有狄利克雷L函数在实部大于的区域没有零点;另一份证明给出大于的范围,并声称排除“西格尔零点”。这缩小了零点可能出现的区域,却没有证明黎曼猜想本身。
BSD猜想相关手稿,声称在Selmer余秩为0或1等条件下得到完整公式,并可覆盖绝大多数二次扭曲。霍奇猜想相关手稿则处理具有复乘结构的阿贝尔簇和K3曲面的乘积,前者声称覆盖所有维度和余维,但并非一般情形下的霍奇猜想。
目录中还有更直接的主张:有理数域上的希尔伯特第十问题不存在通用判定算法;的无理性指数恰好为2;卡塔兰常数是无理数;完整版唯一游戏猜想成立,并可推出最大割、顶点覆盖等问题的近似难度结论。这些目前首先是手稿中的“声称”,不是已经完成同行验证的定论。
Lean能验算,却不能替数学界盖章
形式化证明像一份极其严格的逐行验算稿。它能排除许多跳步和逻辑错误,但仍有两个问题要由人判断:机器检查的命题,是否准确对应原来的数学问题;即使证明成立,它是否新颖、重要,能否被其他研究继续使用。
因此,“模型给出手稿”“Lean通过检查”“专家确认命题与证明无误”“成果经过同行评议”,是四层不同的认可。OpenAI这次只为部分成果提供了Lean材料,而且各份手稿的核验进度并不一致。由九位学者组成的独立数学与AI顾问组也表示,参与咨询不代表认可这些结果,更不代表认可OpenAI生产成果的过程。
稀缺的可能不再是证明,而是审稿时间
这批材料值得关注,不只是因为题目难,也因为它展示了一种可能的新研究流程:模型批量寻找结果,证明助手承担部分逻辑检查,人类再判断问题表述、方法价值和学术位置。如果结果经得起审查,数学研究的产出速度可能明显加快。
但速度也制造了新的瓶颈。据WIRED报道,OpenAI发布前曾向数学家征求意见;部分与会者担心数百项结果同时出现会冲垮同行评审,并称曾得到不会一次性全部发布的保证。OpenAI发言人则表示,公司不知道有过这项保证。据Nature报道,数学家Levent Alpöge还担心,博士生或研究者经营多年的课题,可能突然被夹在数百份预印本中抢先公开。
说白了,过去大家担心“谁能证明”,现在还要担心“谁有时间检查”。这也解释了为什么“横扫数学难题”是一个醒目的标题,却不是稳妥的结论。
局限与未知
- 722篇手稿、372组结果和约4000次尝试等具体数字,目前只有单一转述来源支持,且统计单位不同。
- 许多具体结论来自OpenAI目录或手稿自身,尚不能视为独立同行验证;部分结果也没有Lean形式化证明。
- 最终哪些证明成立、哪些具有研究价值,以及这种批量发布方式会怎样改变成果归属和同行评审,仍需各领域专家逐项判断。
OpenAI已经把答卷摊在桌上。真正决定这是不是数学突破的,不是手稿数量,而是这些证明能否被读懂、复核,并最终进入数学共同体的知识体系。