你面对一个只能反复试算、不能告诉你“往哪边走”的黑箱,怎样用尽量少的尝试找到好答案?这正是零阶优化研究的问题:算法只能查询函数值,拿不到梯度。新预印本声称缩小了这个问题延续近30年的理论差距;更受关注的是,作者称主要证明论证由GPT-5.6 Sol在一次会话中产出。
补上的是什么缺口?
凸优化处理一类没有“局部最优陷阱”的问题,常见于资源分配、机器学习和工程设计。这里争论的不是某次计算快了多少,而是算法至少要查询黑箱多少次,才能达到指定精度。这个指标叫Oracle complexity,也就是“黑箱查询复杂度”。上下界越接近,人们就越清楚理论上的速度极限。
据arXiv上的预印本,Phillip Kerger仅假设算法能获得精确函数值,给出了接近二次量级的查询复杂度下界,把1996年以来的上下界差距缩小到多对数因子以内。论文还把结果扩展到同时包含连续变量和离散变量的混合整数凸优化。
因此,“补上30年缺口”更准确的说法,是显著收窄一组上下界之间的距离,而不是笼统地解决整个凸优化领域。
模型究竟做了什么?
据Kerger个人文章,他仿照另一项数学证明工作的提示方法,向GPT-5.6 Sol提供了约10页提示。模型在一次约2.5小时的会话中产出了主要证明论证。这个描述很亮眼,但现有材料没有交代提示如何形成、过程中是否调用工具、候选答案如何筛选,以及人工做了多少修改。
Kerger还称,相关论证已经过Lean形式化验证。Lean是一套让计算机逐步核对证明的系统,能检查推导是否符合编码后的逻辑规则。它能回答“这套形式化推导是否成立”,却不能单独判断定理是否重要、假设是否恰当,或研究是否真正新颖。
为什么值得关注?
这件事把“AI会不会做数学”拆成了三个不同问题:模型是否生成了有效证明,是否找到了人类此前没有的论证,以及这项结果能否经受学界审查。现有信息较能支持第一项,第二项还需更完整的过程记录,第三项则尚未完成。
局限与未知
- 结果仍是预印本,Kerger明确表示尚未经过同行评议。
- “一次提示”可能遮蔽此前的人工设计、迭代和筛选,现有材料不足以划清模型与作者的贡献。
- Reddit标题提到OpenAI此前的“CDC proof announcement”,但没有说明CDC全称及公告内容,不能据此推断GPT-5.6的发布状态或普遍数学能力。