Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.023 — 2026-07-27
PAPER H 1 约 1 分钟

机器人技能会在MoE里自己组合

VLA不靠人工拆任务,也能在MoE中长出抓取、搬运等可复用技能。

教机器人“拿起书再放好”,通常要先由人把任务拆成抓取、搬运、放下。这项工作追问:如果只给专家演示,机器人能不能自己学会拆分?作者在 VLA——把视觉、语言指令直接变成机器人动作的模型——中加入 MoE。它像一支专家小队,由路由器根据当前画面、指令和机械臂状态,选择此刻该调用谁。

关键设计是:每次生成一段动作时只路由一次,并让同一选择贯穿整个动作模块。这样,“专家”更可能形成完整的小技能,而不是零散计算分工。作者在 LIBERO-10 任务中观察到,有的专家负责靠近并抓住细柄,有的负责搬运已抓住的物体,还有的负责松手后撤;同一专家会跨炉灶、抽屉和微波炉等不同场景复用。16 个专家中有 6 个基本未被使用,说明模型没有简单地把容量全摊开。

更有说服力的是人工改派实验:把一个原本不会被选中的“抓取专家”强行派到新任务,它仍做出抓取动作,甚至能补救一次抓取失败。这说明技能差异不只是路由器贴出的标签。不过作者也承认,自动路由尚未实现这种组合式泛化;目前证据主要是行为观察,而 MoE 的任务表现仅与普通单体基线相当。


供稿材料 SOURCES — 1
01
Emergent Compositional Skills in Mixture-of-Experts VLAs arXiv (cs.AI+cs.LG+cs.CL+cs.CV+stat.ML) · PAPER
原文 ↗

← 返回 2026-07-27 · 学术板块