深度专题 FEATURES — 3
WorldPlay2:可交互世界再跑远一点
WorldPlay2 把按键与语义指令装进同一世界模型,并用压缩记忆和稳定蒸馏兼顾实时响应与长时一致。
QwenGyre:百万Token任务如何训练
QwenGyre让GPU边等超长Agent边训练,并把分叉轨迹压成可控样本。
机器人蒸馏开始递归调用专家
强 Agent 把纠错经验写成行动手册,再根据轻 Agent 实操反复修订,让机器人不改参数也更会应变。
速览 BRIEFS — 8
PAPER
无动作视频也能教世界模型控制
Action Forcing从普通视频反推动作,让世界模型少依赖昂贵的同步控制标注。
PAPER
同一条动作,物理规律要一致
OneWorld要求不同动作分支共享同一套物理规律,让世界模型不只会生成,还能更可靠地规划。
PAPER
多模态服务要拆成三个阶段
EAServe把多模态推理拆成编码、预填充、解码三段,并从入口协调GPU负载。
PAPER
投机解码给草稿模型配了导师
让快速草稿在大模型约束下适度“越界”,以更小质量代价换取更多提速空间。
PAPER
多个专家蒸馏,先消除领域偏科
把多位专家教给同一模型前,先校准反馈尺度,避免强势领域带偏训练。
PAPER
多模态模型能否告别视觉编码器
研究发现:模型和算力足够大时,多模态 AI 或可不再依赖预训练视觉编码器。
PAPER
挖掘机控制也开始用在线世界模型
11.5吨挖掘机边干边学,40分钟后实现厘米级路径控制
PAPER
Agent的KV缓存开始看行动价值
ActKV按“是否影响下一步行动”整理缓存,以更少显存保住Agent决策能力。