你让 AI 在终端里修一个复杂故障:先读文件,再跑测试,接着修改代码、安装依赖、重新构建。做到第几十步时,它可能忘记最初目标,也可能直到最后才发现第一步就走错了。T1 想解决的正是这种“长跑”问题:让终端Agent——能在命令行中读取文件、运行程序和调用工具的 AI——持续执行几十乃至数百步任务,并从真实执行结果中学习。
论文作者将一个总参数量约 122B 的 Mixture-of-Experts(MoE,混合专家)模型用于这项实验。MoE 不会让每个输入都调用全部参数,而是由“路由器”挑选少数专家参与计算。T1 通过强化学习训练:模型反复尝试任务,再依据自动检查结果调整策略。作者报告,它能在云端沙箱的真实 shell 中完成单任务最多 300+ 轮工具调用。本文所有效果数字均来自这篇论文,尚无独立信源复核。
长任务为什么难教
短问答答错了,反馈来得很快。长程终端任务不同。模型可能要检查数百次代码提交,定位缺陷,完成修补,再构建指定目标。早期错误往往要过很久才暴露,而一次完整尝试又会消耗大量沙箱时间。
最直接的奖励只有“成功”或“失败”。论文团队先在 TMax-15k 上尝试二元奖励:模型从 43.8% 提升到 47.2%,但没有达到监督微调检查点的 49.4%。作者据此认为,完整成功过于稀少,大量已经取得部分进展的轨迹仍被统一记为零,学习信号太弱。
T1 改用 dense process reward,即更密集的过程奖励。每项任务都带有 verifier——自动检查要求是否满足的程序。它不只给出最终成败,还分别记录通过了多少条检查。模型完成一部分要求,也能得到相应反馈。
这里有个关键选择:奖励看通过检查的绝对数量,而不是通过比例。通过 20 项中的 10 项,与通过 4 项中的 2 项,比例都是一半;但前者可能意味着完成了更多实际工作。作者因此把每多通过一项检查视为一份进展,并采用固定的全局尺度,让不同训练批次的奖励保持可比。不过,论文也承认,不同检查所需工作量大致相当只是一项设计原则,并非严格保证。
奖励仍在轨迹结束时统一发放。至于哪一步值得表扬、哪一步应当负责,则交给 critic——一个预测当前行动最终价值的模型——向前分配信用。团队还先用一个训练阶段给 critic“热身”,再开始主要的策略更新,希望它不必边学评分、边指导 actor,也就是实际采取行动的模型。
还得保证“练习”和“复盘”是同一件事
T1 面对的另一类问题更隐蔽。生成轨迹和更新模型由两套系统完成。终端Agent每调用一次工具,系统都可能把历史消息解析、转成文本,再重新编码成 token——模型处理文字时使用的数字编号。一个空格或边界处理发生变化,训练器看到的序列就可能不再是模型当时真正生成的序列。
论文提出 TITO(token-in, token-out):训练直接使用采样器产生的 token 编号,并在多轮对话边界修复偏移。作者对 1,402 个样本审计后称,真正参与损失计算的区域实现了 zero token drift,也就是训练序列与生成序列没有 token 错位。
MoE 还有第二层错位。它的路由器每层从 256 个专家中选择 8 个;生成端和训练端即使只有很小的数值差异,也可能选中不同专家。这样一来,负责学习的参数并不是当初产生行动的那组参数。
R3(rollout routing replay,轨迹路由重放)的做法很直接:生成时记下每个 token 在各层选择了哪些专家,训练时原样重放这些选择。路由概率仍由当前模型计算,因此梯度路径保留,但接收梯度的专家与生成轨迹时一致。TITO 和 R3 合用后,论文报告训练与推理之间的平均 log-probability difference——同一输出在两套系统中所得概率差异的内部指标——从 0.021 降到 0.013。这个数字说明记账更一致,不能直接等同于任务能力提高。
成绩说明了什么
在包含 89 项任务的 Terminal-Bench 2.1 上,作者报告基础模型的 resolved rate 为 43.8%;监督微调检查点为 49.4%;经过三轮 PPO 强化学习后,T1 达到 64.0%。PPO 是一种限制每次策略更新幅度的强化学习方法。按论文口径,仅从监督微调检查点到 T1,相对提升为 28.5%。
在更强调长程操作、包含 46 项任务的 Long-Horizon Terminal Bench 上,T1 得分为 27.9%。作者还称其超过 GPT-5.4 和 GLM-5.1。不过,供稿没有同时给出这两个对照模型的具体成绩;正文其他位置对比较对象的表述也不完全一致,因此这项“超过”更适合作为作者主张,而不是已经独立确认的排名结论。
值得注意的是,训练允许单任务达到 300+ 轮工具调用,但三项正式评测采用统一配置,最多只有 60 轮,并非所有成绩都在 300 多轮预算下取得。训练集由隔离种子和合成任务组成,作者称与 Terminal-Bench 2.1 不重叠。这降低了直接针对测试题训练的可能,但“数据不重叠”本身还不足以完全排除污染,也不能单独证明真正的能力迁移。
为什么值得关注
T1 的意义不只在一个榜单数字。它把长程Agent训练拆成两个更实际的问题:第一,如何让执行到一半的进展也能产生反馈;第二,如何保证模型复盘的确实是自己刚才走过的路线。前者缓解长任务奖励过稀,后者处理多轮工具调用与稀疏模型带来的训练错位。
这仍然不是“可以独立接管复杂系统”的证明。但它展示了一套较完整的训练思路:让Agent在真实 shell 中行动,用任务自己的检查程序评分,再把数百步执行中的数据准确送回训练系统。终端Agent若要从几轮演示走向持续工作,这些不显眼的稳定性问题,可能和模型规模一样重要。
局限与未知
- 全部结果来自同一篇论文,尚缺少独立复现;64.0%和27.9%的方差等统计信息未在供稿中完整披露。
- 绝对检查数量能提供更细反馈,也可能偏爱检查项目更多的任务;论文通过数据筛选和监控轨迹长度降低奖励投机风险,但不能由此认定风险已消失。
- 300+轮的准确上限并不明确,正式评测又限制为60轮,因此模型在更长实际运行中的稳定性仍待验证。