深度专题 FEATURES — 3
T1:把终端Agent练成长跑选手
T1用强化学习训练122B MoE终端Agent,探索如何让AI连续操作数百步而不跑偏。
HuRo:把人类视频改造成机器人教材
HuRo把人类第一视角视频“换成机器人来做”,为VLA预训练寻找更便宜的大规模教材。
压缩、编译、调度要一起算账
把压缩、编译和调度放在一张账单上:单项跑分快,不等于真实部署快。
速览 BRIEFS — 9
PAPER
世界模型开始套娃探索
WiW让冻结的视频世界模型换个视角“走进”已有视频,并尽量保持事件与场景一致。
PAPER
量化为何有效,有了机制解释
预训练模型会主动抵消量化误差,输出层还会优先护住最可信的预测。
PAPER
全模态模型也要压KV缓存
OmniKVQuant用2比特压缩全模态模型的“临时记忆”,兼顾音视频与文本差异。
PAPER
MoE更怕重复数据
语料循环使用时,MoE比稠密模型更早过拟合,模型越稀疏越明显。
PAPER
回答太长,也能靠低秩后训练治
LOCUS用低秩后训练压缩回答长度,在尽量保住效用的同时降低输出成本。
PAPER
Agent沙箱开始共享内存
AgentZip让并发沙箱共享“相似部分”,最高将内存压缩至原来的约1/8.7。
PAPER
机器人动作生成压到一步
IMLE-VLA把机器人动作从多轮采样压到一步,瞄准闭环控制中的等待与卡顿。
PAPER
硬约束直接接入机器人策略
ActSafeGuard把硬约束嵌进动作生成路径,让机器人从训练到执行都守住物理边界。
PAPER
数学推理与Lean验证闭环了
Magenta让自然语言解题接受Lean逐步验算,并把报错反馈给模型继续修正。