Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.019 — 2026-07-23
NEWS 2 信源 约 4 分钟

小模型学会循环思考

Nanbeige4.2-3B让同一组网络层循环工作,用更多“思考轮次”换取小模型的越级能力。

IMAGE — r/LocalLLaMA 日榜

你让一个小模型独立订行程、查资料、调用工具,它常在任务变长后顾此失彼。通常的解决办法是把模型做大,但更大的模型也更占内存。Nanbeige4.2-3B尝试了另一条路:不一味增加参数,而是让同一组网络层循环工作,用更多计算轮次换取更深的处理过程。

这款模型已由Nanbeige发布在Hugging Face。以下架构、训练和成绩均来自官方模型卡,尚未看到独立复现。

让同一套积木多搭几遍

Nanbeige4.2-3B基于Nanbeige4.2-3B-Base构建,定位是紧凑型Agentic model——不只负责生成文字,还要为多步任务规划行动、调用工具并判断下一步做什么。

它的关键是Looped Transformer。Transformer是现代语言模型常用的计算架构,通常由多层网络逐步处理上下文。常规做法像不断添新楼层,每层都有自己的参数;循环架构则让同一组楼层反复运行。换句话说,它增加了计算深度,却不按循环次数复制权重。这是一种“多算几轮、少存一些参数”的交换,并不等于免费提升:参数没有随循环增加,运行时的计算仍可能增加。

官方把它称为3B模型,但这个数字特指约30亿个非嵌入参数。嵌入参数负责把词元转换成模型可处理的数值表示;若把它们也算进去,官方表格列出的总参数量是4B。因此,不能简单说它的全部参数恰好只有30亿。

小模型真的越级了吗?

官方给出的对比很亮眼。在通用Agent测试GDPval rubrics上,Nanbeige4.2-3B得分74.3,高于Qwen3.5-9B的61.9和Gemma4-12B的68.5。在检验模型解决真实软件问题能力的SWE-Bench Verified上,它得到63.6,对比两者的53.1和44.2。数学、编码与科学推理测试中,它也在多项指标领先,例如GPQA-Diamond为87.4,高于Qwen3.5-9B的81.7和Gemma4-12B的78.8。

这说明至少在官方采用的评测设置里,较少参数配合循环计算,确实可能胜过更大的对手。不过,Reddit标题所称“超过参数规模四倍的模型”缺少明确的比较对象、评测条件和计算口径,现有材料不足以支持这个概括。

训练也不只依赖架构。官方称,监督微调(SFT——用示范答案教模型如何完成任务)加入了真实环境和大规模合成环境,并在完整行动轨迹与单轮步骤两个层面过滤数据。强化学习(RL——根据任务反馈继续调整模型)则同时使用结果奖励和过程奖励,以提高紧凑模型的训练稳定性。现有信息无法拆分:成绩究竟有多少来自循环架构,又有多少来自数据和训练方法。

为什么值得关注

对希望在有限显存或本地设备上部署Agent的开发者,这条路线提供了一个不同的尺度选择:模型权重可以保持紧凑,再用更多计算轮次换能力。Nanbeige4.2-3B也已给出Transformers、vLLM、SGLang和Docker Model Runner的加载或部署方式,说明它并非只停留在架构展示。

更重要的是,它把“小模型”问题从“还能压缩多少参数”改写成“有限参数能否被反复利用”。如果这条思路经得住独立测试,小型Agent未必只能靠继续堆参数追赶。

局限与未知

  • 当前成绩来自官方模型卡,材料没有提供独立复现。
  • 现有片段未披露具体循环次数、额外计算开销及完整评测条件,无法判断速度和资源代价。
  • 官方代码还提到LoopSplit、mHC with depth attention和拼接式n-gram embeddings等改进,但材料没有解释各自贡献,不能把提升单独归因于循环复用层。

供稿材料 SOURCES — 2

← 返回 2026-07-23 · 开源板块