你请一个人解难题,第一次没想明白,通常不会立刻换十个人各看一眼,而会让合适的人再检查几轮。大语言模型却常走另一条路:把许多不同的计算层依次堆起来,不管问题简单还是困难,都走过近似固定的流程。Loopie想探索的是,能否让同一组计算模块循环工作,并把更多算力留给真正困难的问题。
这条路线值得关注,因为它挑战了一个长期存在的现实:过去,与其让较小的模型重复计算,直接扩大模型参数往往效果更好。Loopie把循环计算与混合专家模型结合,试图改变这笔账。不过,目前提供的“全文”材料实际只包含论文摘要。以下性能结论均来自研究团队自己的表述,尚缺具体分数和独立验证。
不再只靠堆层数
Transformer是现代大语言模型常用的基本架构。它会结合一句话中不同位置的信息,判断每个词应该怎样理解。常规做法像一条固定的流水线:信息依次经过不同的计算层,每层只走一次。
循环计算(looped computation)换了一个角度。它让模型反复使用共享的计算模块,逐步更新内部结果。可以把它想成同一个解题小组多轮审稿:第一轮形成初步答案,第二轮检查漏洞,后续轮次继续修正,而不是每一轮都换一批从未见过前文的人。
这种设计的吸引力很直观。同一套能力可以重复调用,模型也有机会按问题难度投入不同计算量。简单题少想几轮,难题多想几轮。相比一味增加固定层数,这更接近“计算随任务变化”的方向。
问题在于,直觉好不等于训练效率高。论文摘要指出,传统循环Transformer面临一个顽固差距:如果把预训练计算量增加到原来的 倍,那么把参数量扩大到 倍,通常比让原模型循环 次表现更好。也就是说,过去的循环方案往往没能把重复计算真正转化为同等价值的能力提升。
MoE让循环不必全员上场
Loopie的另一个关键组件是Mixture-of-Experts,简称MoE,即“混合专家模型”。它像一个拥有许多专科小组的团队,但处理一次输入时,只调用其中少数合适的小组。因此,模型可以拥有很大的总参数量,却不必每次把所有参数都运行一遍。
这里需要区分总参数与活跃参数。参数是模型从训练中学到的可调数字;活跃参数则是处理某次输入时真正参与计算的部分,它更直接反映单次运行的计算负担。
论文摘要披露了两个Loopie模型:较大版本拥有200亿总参数,每次计算启用20亿参数;较小版本拥有60亿总参数,每次启用6亿参数。换句话说,两者单次只动用约十分之一的参数。这个数字描述的是参数调度,不能简单理解成运行成本必然只有同规模稠密模型的十分之一;摘要没有提供足够信息支持这种推断。
把MoE与循环计算放在一起,思路是让“谁来算”和“算几轮”都变得更灵活。许多专家提供容量,稀疏激活控制每轮负担,共享模块则允许模型继续推敲。这也是Loopie比单纯增加层数更值得留意的地方:它讨论的不只是模型能有多大,还讨论算力应该怎样被调用。
它真的胜过了直接做大吗?
研究团队称,他们进行了广泛的消融实验。消融实验是把设计中的某些部件移除或替换,再观察结果如何,用来判断提升究竟来自哪里。比较对象包括一个“30B-A3B”的普通Transformer:总参数300亿,活跃参数30亿。
按照摘要说法,在相同预训练计算预算下,Loopie“显著优于”普通Transformer基线。这个比较正面回应了循环模型过去的弱点:如果投入同样多的训练计算,循环使用模块是否终于能比单纯扩大模型更划算。
但摘要没有给出具体评测集、分数、提升幅度、训练token数量、计算预算口径或误差范围。因此,目前能确认的是研究团队报告了这一结果,不能进一步判断优势有多大、是否覆盖不同任务,也无法核对20B-A2B、6B-A0.6B与30B-A3B之间怎样实现严格公平的比较。
论文还称,Loopie采用了一套新的后训练流程来增强推理能力。后训练指模型完成大规模预训练后,再通过额外训练调整行为与能力。摘要没有说明这套流程包含哪些步骤,所以不能把最终推理表现全部归因于循环结构或MoE;后训练本身可能贡献了多少,仍需完整实验拆解。
“奥赛金牌水平”该怎样理解
最醒目的结果是:研究团队称Loopie在不使用工具的情况下,在2025年国际数学奥林匹克竞赛(IMO)和国际物理奥林匹克竞赛(IPhO)上达到金牌水平。
这句话不等于模型以正式选手身份参赛并获得金牌。更准确的理解是,研究团队按照某种题目集合与评分方式,把模型成绩换算到了金牌门槛。摘要没有交代采用了哪些题目、评分由谁完成、是否允许多次生成、是否挑选最佳答案,也没有说明“不使用工具”是否排除了外部验证器或特殊的推理计算预算。因此,这一结果适合看作值得核验的能力信号,而不是已经完成独立认证的竞赛成绩。
为什么这条路线值得继续看
Loopie真正重要的地方,不是又出现了一个更大的参数数字,而是它试图重新安排模型的计算方式。固定堆层数意味着每个问题大致经过同样长的流水线;循环计算则允许同一模块被再次调用,MoE再决定每次由哪些专家参与。两者结合,指向一种更有弹性的模型:能力容量可以很大,实际投入则有机会随问题调整。
如果完整论文能够证明,在严格相同的预训练预算下,这种设计稳定胜过普通Transformer,那么它就回应了循环模型最核心的效率质疑。它也会让“模型应该多大”之外,多出一个更实际的问题:面对不同难度的任务,模型应该思考多久、调用多少内部能力。
局限与未知
- 当前材料只有摘要,没有具体基准、分数、训练token、计算预算定义和误差范围,“显著优于”尚无法量化。
- “2025年IMO和IPhO金牌水平”缺少题目集合、评分规则、采样次数、答案筛选和推理预算等关键信息。
- “迄今最强的循环Transformer”是研究团队的自我评价,摘要没有给出统一评测范围或判定标准;循环结构、MoE与后训练各自贡献多少也未披露。