想象你请一位助手改进一套机器学习程序。它先写方案,运行后看结果,再修错、比较,继续尝试。普通 AI 往往只交一次答案;真正的研发却要经历很多轮试错。Frontis 团队想做的,是把这段过程交给 AI,并让每次修改都接受程序运行的检验。
这正是“AI 改进 AI”较务实的一种形态:先不谈一个系统能否全面升级自己,而是看它能不能改进制造下一版 AI 所需的代码、数据和实验流程。论文把机器学习工程(Machine Learning Engineering,MLE——把模型训练、测试等工作真正跑起来的工程流程)当作试验场,因为程序可以执行,成绩也可以核验。
Frontis 团队将这项工作定位为“走向递归自我改进”。递归自我改进(Recursive Self-Improvement,RSI)指 AI 参与改进下一版 AI,而改进后的系统又继续参与下一轮。关键词不是“改过一次”,而是能否形成反复运转、持续验证收益的闭环。就目前披露的证据看,Frontis-MA1展示的是朝这个方向搭建工程系统,还不是通用 RSI 已经实现。
本文数字与结论均来自 Frontis 团队于 2026 年 7 月 30 日提交的论文,尚无第三方复现或独立基准确认。
把研发试错拆成四个动作
这项工作的主体叫 OpenMLE,是一套面向机器学习工程的开放全栈系统。它分为三层:OpenMLE-Gym 提供带程序执行反馈、结果可核验的任务环境;OpenMLE-RL 负责学习操作;OpenMLE-Evo 负责长程搜索——连续提出修改、运行实验、比较结果,再决定下一步,而不是一次猜中最佳方案。
在这套系统上,团队后训练了 Frontis-MA1。它有 350 亿参数,是一个 MLE“元进化智能体”:它不只生成某段代码,还参与组织多个候选程序的演变。后训练(Post-training)可以理解为基础模型完成通识学习后再接受岗位训练,让它更擅长特定工作。
论文把程序演变拆成四种基本操作:Draft(起草)、Improve(改进)、Debug(调试)和 Crossover(交叉)。训练和实际搜索都围绕这四种操作展开。模型先通过带程序执行依据的监督微调(SFT——用示范答案教模型模仿)和强化学习(RL——根据行动结果提供反馈)学习这些动作,再由 OpenMLE-Evo 把动作串成长程搜索。
这里最值得看的不是四个英文名称,而是训练与使用方式对齐了。模型练习的是“起草、修改、调试、交叉”,实际工作时仍以这些动作为基本单位,不必从一次性答题突然切换到多轮研发。团队还称,SFT 和 RL 数据已经与全部评测基准去重,意在降低训练数据直接包含考题的风险。
成绩来自模型,也来自搜索系统
在 MLE-Bench Lite 上,论文给每项任务 12 小时,使用一张 RTX 4090,并把显存限制在 12 GB。以 Medal Average 为指标,基础模型的成绩是 39.39%;Frontis-MA1 配合 OpenMLE-Evo 后达到 60.61%。这是论文最能支撑其核心主张的一组数字:专项后训练与多轮程序搜索结合,优于基础模型起点。
更高配置 OpenMLE-Evo-Max 达到 71.21%。但这个数字不能写成“Frontis-MA1 单模型从 39.39% 升到 71.21%”。论文明确说,Evo-Max 还加入了与基准无关的经验先验和异步搜索,测到的是模型与搜索框架组合后的系统成绩。
论文称,71.21% 超过 GPT-5.5 + Codex,并接近 GPT-5.6 Sol 和 2.8T Kimi K3。不过材料没有给出这些对照系统的具体分数,也没有证明各方使用了相同的硬件、时间预算、搜索方式和经验先验。因此,这一横向比较目前更接近团队自己的定位,不宜当作已经坐实的排名。
团队还在留出的 NatureBench Lite 上测试迁移能力。固定搜索框架,只把模型换成训练后的版本,Match-SOTA 从 50% 升至 70%;固定模型,只换用 OpenMLE-Evo,则从 20% 升至 50%。按论文的解释,这说明模型训练和搜索框架各自都贡献了收益,而不只是某一个部件包办全部提升。
为什么现在值得看
很多“AI 改进 AI”的讨论容易停在抽象层面:系统似乎变聪明了,却很难说明它改了什么,也难检查收益来自哪里。OpenMLE选择机器学习工程,是因为候选程序可以运行,结果可以比较,失败还能进入下一轮调试。这让“自我改进”第一次至少拥有了较清楚的工程对象、操作单元和验收方式。
它也把关注点从单次回答移向持续搜索。现实中的模型研发很少靠一次灵感完成。更常见的过程是提出方案、做实验、发现问题、再修改。Frontis-MA1的意义,在于尝试让模型学会这套循环,并把学习得到的操作放回搜索系统中组合使用。
团队已公开 Frontis-MA1 模型权重、OpenMLE 代码栈,以及相关任务和训练数据制品。这为后续检查提供了入口。但“公开”不等于全部实验已经能一键复现:模型权重、任务制品、外部基准环境、服务凭证和私有基础设施配置仍可能分开存在。
离真正闭环还有多远?
- 算力口径仍有疑点。 论文摘要把 71.21% 与单张 RTX 4090、12 GB 显存的设置放在一起,仓库却把 Evo-Max 描述为异步多 GPU 搜索配置。完整实验中的硬件与预算边界需要进一步核对。
- 证据仍由团队单独提供。 NatureBench Lite 的样本规模、方差和重复运行情况没有在现有材料中披露,50% 到 70%、20% 到 50% 不能直接外推为整体科研能力提升。
- 目前展示的是受控任务中的循环,不是通用自我升级。 系统能在给定任务、指标和搜索框架内反复改程序,但材料尚未证明改进后的系统会进一步改造自身训练机制,并稳定开启下一轮收益。真正的递归闭环,还需要这种连续性得到独立验证。