Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.032 — 2026-08-05
NEWS 约 7 分钟

Orchard:小模型也能训练智能体

微软开源 Orchard,把环境、训练和评测接到一起,让约 30 亿激活参数的模型也能练智能体。

IMAGE — Microsoft Research Blog

你让一个 AI 帮忙修软件漏洞,它不只要“会写代码”,还得打开代码库、运行工具、检查报错,并在失败后继续尝试。真正麻烦的是,每支团队往往都要先搭一套隔离环境、数据管线和评测系统,模型还可能在简化环境里训练,部署时却换到另一套工具外壳。微软研究院发布的开源框架 Orchard,想把这些重复工程合并成一套可复用的基础设施,让研究者把更多精力放在训练智能体本身,也让较小的开放权重模型有机会参与竞争。

需要先说明:目前材料仅来自 Microsoft Research 官方博客。框架能力、开放状态和实验数字尚无论文或第三方评测交叉验证,以下结果应视为项目方报告。

先把“练习场”独立出来

Orchard 的核心不是一个新模型,而是 Orchard Env。它是一项基于 Kubernetes 的轻量级环境服务。Kubernetes 是管理大量计算任务的系统;在这里,它负责创建、管理和移除彼此隔离的运行组件,而且可以并行处理数千个组件。

所谓智能体训练环境,可以理解为一间可反复布置的练习室:模型在里面观察任务、执行操作,再根据结果获得反馈。过去,这间练习室常被写死在某一种训练框架里。换任务或换训练方法,团队可能就得重新装修。

Orchard 把环境单独做成服务。训练数据收集、强化学习 rollout 和评测都可以调用它。强化学习 rollout,就是让智能体完整尝试一次任务,并记录沿途的决策和结果。按照微软的介绍,同一套基础设施可以服务软件工程、网页导航和个人助理任务,也能用于数据蒸馏——让模型学习较强模型产生的示范。

这套统一训练与评测框架的价值很朴素:不同任务共用环境接口、数据管线和运行规则,研究者不必每次从头搭系统,实验之间也更容易比较。项目同时给出了三套领域方案:面向软件工程的 Orchard-SWE、面向图形界面任务的 Orchard-GUI,以及 Orchard-Claw,并称一并发布了训练数据和评估方法。

在真正使用的外壳里训练

模型通常不能凭空操作网页或代码库。它需要 harness——把模型接入工具、任务状态、权限和运行循环的执行外壳。Codex、OpenClaw、ZeroClaw 都属于这类系统。harness 还可能负责多轮推理、工具调用以及与外部系统连接。

问题在于,开放训练工具未必能处理这种有状态、多进程的外壳。研究者于是可能先在简化替身里训练,再把模型放进真实系统。就像只在空教室里练驾驶,考试时才第一次上路,训练与部署之间会出现落差。

Orchard 的做法是,在 harness 与模型之间放入轻量代理,记录 harness 发出的模型调用,将其变成训练数据;每次 rollout 则在独立容器里运行。这样,智能体可以直接在未来部署所用的 harness 中接受端到端训练,也可以跨多种 harness 训练。这里的“容器”,可以理解为相互隔离的小型运行空间,避免不同任务彼此干扰。

小模型的成绩从哪里来?

微软用 Orchard-SWE 展示了软件工程方向的训练流程。它基于 Mini-SWE-Agent,在 SWE-bench Verified 上评测。这个基准要求智能体进入真实代码库,定位问题并提交修复,用来检验它能否完成一整套软件维护工作,而不只是补全一段代码。

项目团队先从 MiniMax-M2.5 和 Qwen3.5-397B 两个较强的开放权重模型中蒸馏了 10.7 万条智能体交互,覆盖多种 GitHub Issues。这里的蒸馏,是让较小模型学习较强模型留下的任务轨迹。

训练没有把失败尝试全部扔掉。团队使用“信用分配监督微调”:即使一次尝试最终没修好问题,也挑出其中有效的步骤供模型学习。随后进入强化学习阶段。由于软件修复常常只有“隐藏测试通过或失败”这一项最终反馈,奖励信号很稀疏,Orchard-SWE 先使用 Balanced Adaptive Rollout 来提高这些少量成功信号的利用率,再加入两种更密集的指导。

第一种是 on-policy distillation,由更强的教师模型逐步评价智能体当下的决策。第二种是 process reward model,也就是过程奖励模型:AI 裁判会检查解题过程是否扎实,例如有没有编写测试复现漏洞、验证修复,以及确认原有功能仍然正常。

69.7%意味着什么?

据 Microsoft Research 披露,Orchard-SWE 使用约 30 亿个 active parameters,在 SWE-bench Verified 上取得 69.7%;加入 value-model reranking 后达到 73.0%。后者是让价值模型从多个候选结果中重新排序,因此不能与基础成绩混为同一种设置。

“激活参数”指模型处理一次输入时实际参与计算的参数,并不必然等于模型的总参数量。微软称这一结果接近使用大十倍以上模型的前沿系统,但没有说明比较对象,也没有统一总参数与激活参数的口径。因此,更稳妥的结论是:官方结果显示,小模型在这套训练流程下可以取得较高的软件修复分数;它是否真的以更低成本逼近前沿系统,目前还不能确认。

为什么值得关注

Orchard 瞄准的是智能体研究中不太显眼、却很耗资源的一层:工具链。它没有只发布一张排行榜成绩,而是试图把任务环境、训练、数据收集、真实 harness 和评测接成一条可复用管线。如果这套框架确实容易部署,它可能降低研究团队重复建设基础设施的成本,也让不同模型和训练方法更容易在相近条件下比较。

小模型的意义也在这里。智能体能力不只取决于模型大小,还取决于它在哪里练习、得到什么反馈,以及训练时使用的外壳是否与部署一致。Orchard 提供的是一套改善这些条件的工程方案,而不是证明“小模型普遍胜过大模型”。

局限与未知

  • 69.7%和73.0%的评测版本、推理预算、采样次数,以及 reranking 的候选数量均未披露,暂时难以做严格横向比较。
  • “约30亿激活参数”不能直接与其他系统的总参数量相比;所谓“大十倍以上”的对手也未被明确列出。
  • 官方称代码、训练数据和评估方法已经发布,但现有材料没有提供仓库、许可证及实际可下载状态的独立证据。

供稿材料 SOURCES — 1

← 返回 2026-08-05 · 科技板块