Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.089 — 2026-10-01
PAPER HF 30 约 7 分钟

机器人蒸馏开始递归调用专家

强 Agent 把纠错经验写成行动手册,再根据轻 Agent 实操反复修订,让机器人不改参数也更会应变。

机器人蒸馏开始递归调用专家

你让机器人把胡萝卜放进盘子。它看懂了指令,也朝胡萝卜伸手,却在抓偏之后继续搬运,仿佛东西已经拿稳。此时,缺的不是“知道任务是什么”,而是发现失败、判断原因,再把动作拉回正轨的能力。

Recursive Harness Distillation(RHD,递归脚手架蒸馏)换了一个角度:先让强 Agent——能观察、判断并干预机器人执行的智能体——积累纠错经验,写成一份 playbook,也就是行动手册;再交给成本较低的轻量 Agent 使用。强 Agent随后查看它的实操记录,继续修订手册。论文报告,这套方法在模拟环境和实体机器人上都提高了成功率。不过,相关结果来自作者的一组实验,仍需结合任务范围和评测规模来看。

蒸馏的不是模型,而是师傅的手册

这里的机器人底座是视觉—语言—动作模型(VLA):它把摄像头画面和文字指令直接转成动作,像是同时负责看、听懂和动手。问题在于,会做多种任务,不等于遇到场景变化或动作走偏时也会补救。

RHD在VLA外面加了一套 Agent harness,也就是执行脚手架。它允许 Agent观察执行、检查候选动作,并在三个位置介入:改写给VLA的指令;调整模型对画面特定区域的注意;或者直接修正末端执行器和夹爪动作。底层VLA、强 Agent和轻量 Agent的模型参数都保持不变。

这与常见的知识蒸馏不同。通常,蒸馏是让较小模型通过训练模仿较强教师;这里被迁移的不是参数,而是强 Agent干预机器人后总结出的经验。所谓“递归”,也不是机器人在每次推理时反复呼叫专家,而是“师傅写手册—徒弟实操—师傅看反馈—再改手册”的循环。

关键点在于,手册不能只记录强 Agent自己怎么做。轻量 Agent即使读到同一句建议,也可能选择不同的干预方式,继而遇到完全不同的后续局面。因此,修订必须围绕接收者真正经历的轨迹展开:它在哪里误解了规则,什么时候用了错误的干预,以及环境随后发生了什么。

论文的更新流程也相当谨慎。强 Agent先与VLA交互,形成初版手册;轻量 Agent拿着它执行开发任务;强 Agent再依据完整记录提出修订。每个候选版本先固定下来,然后在同一批开发实例上测试。达到设定目标的首个版本才会被接受;若没有版本达标,就继续根据反馈提出候选。作者明确指出,这条接受规则并不保证一定会结束。

一份坏手册,真的会帮倒忙

实验使用GPT-6 Astra作为强 Agent,GPT-5.6 Luna作为轻量 Agent,底层策略为参数冻结的GR00T。在SimplerEnv Bridge模拟环境中,任务包括把勺子放到毛巾上、把胡萝卜放到盘子上、堆叠方块,以及把茄子放进篮子。

结果最能说明“递归修订”为何重要。单独使用GR00T的成功率是41.7%;加入没有手册的Luna,只升到43.8%。而强 Agent最初写出的手册反而把Luna的成功率降到31.3%。经过轻量 Agent实操反馈和多轮修订后,成功率才升至66.7%,比无手册的Luna高22.9个百分点。

换句话说,把专家经验写下来并不自动等于可用知识。真正产生增益的是根据使用者的错误继续改写。对照实验进一步显示,由Luna自己担任教师并递归修订时,最终成功率只有22.9%,不仅远低于Astra教师得到的66.7%,也低于Luna无手册时的43.8%。至少在这组设置里,教师能力本身仍然重要。

同一份修订后手册也能交还给强 Agent使用:Astra在Bridge上达到79.2%。论文还称,带手册的Luna优于不带手册的Astra,但没有给出后者的具体成功率,因此无法计算差值。

手册里写的,是怎么把失败拉回来

这份playbook不是泛泛提醒“认真检查”,而是把观察、干预和结果连起来。例如,Luna曾在遮挡后把机器人部件误认成勺子,手册于是加入依据外观和场景位置重新识别物体的规则。另一次,机器人提起茄子的幅度很小,但夹爪仍闭合,说明物体可能还在手里;手册建议先做一次幅度受限的抬升确认,而不是立即松爪重抓。

它也记录VLA一些不直观的反应。即使指令写着“打开夹爪”,模型仍可能生成闭合动作,所以Agent必须检查输出,必要时直接修正。释放方块前,则要确认方块与目标的几何关系,并在夹爪撤离时观察支撑是否稳定。

消融实验——逐项拿掉某种能力,看性能掉多少——显示,移除指令改写造成的下降最大。不过,论文同时指出,直接动作修正也参与了整体增益。这说明有效的脚手架不是只替机器人重说一遍任务,而是在合适时机选择不同层次的干预。

实体机器人也有效,但不是直接照搬

实体实验使用7自由度Franka Panda机械臂,测试把橙色方块放入托盘、把橙色方块叠到绿色方块上,以及按下红色急停按钮。每项任务收集50次人类遥操作示范来微调底层策略,随后固定该策略。评测共75次,每项25次,并在每次试验前随机调整物体位置。

单独使用底层策略的总体成功率为37.3%;Luna只有干预工具、没有手册时为0%;使用修订后的手册后达到64.0%。分任务看,成功次数分别为18/25、13/25和17/25。

但这里并非把模拟环境手册原封不动搬到真机。Astra先根据实体任务和微调后的策略做了适配,再让Luna使用。论文观察到,无手册的Luna难以补偿目标位置与实际动作之间反复出现的空间偏差,单靠改指令或调注意力也不能稳定解决。

为什么值得现在看

这项工作的价值,不只是又给VLA叠了一层更强模型。它尝试把多Agent执行过程中昂贵的试错,沉淀成可复用、可继续修订的外部资产。模型参数不用更新,同一份经验还能跨能力不同的Agent复用。

成本结果也解释了这种安排的动机。在同一Bridge测试集和同一修订后手册下,作者按记录的token用量及API价格估算:Luna全套测试花费30.03美元,平均每个任务回合0.63美元;Astra为164.61美元,平均3.43美元,约贵5.5倍。先让强 Agent承担探索和整理,再让轻量 Agent反复执行,可能比让专家始终在线更经济。

更重要的是,它为机器人泛化提供了不同于单纯扩充训练数据的路线:先保留现有VLA,再把“何时判断失败、怎样介入、如何确认修复有效”逐步写进外部手册。这里积累的是执行知识,而不只是更多示范。

局限与未知

  • Bridge评测包含4项任务,开发集和评测集各48个实例;实体评测只有3项任务、共75次试验。结果说明这条路线在这些设置中可行,但不能据此认定它已经具备普遍、稳定的跨任务泛化能力。
  • 实体手册经过Astra针对物理任务和微调策略的适配,因此37.3%到64.0%的提升不能直接解读为一份手册可无调整迁移到任意机器人。
  • 初版手册会让表现从43.8%降到31.3%,Luna自我蒸馏更降至22.9%。这既凸显反馈修订和强教师的作用,也说明错误经验可能被系统化地放大。

供稿材料 SOURCES — 1

← 返回 2026-10-01 · 学术板块