深度专题 FEATURES — 3
随机注意力为何更会省KV缓存
把问题原文留下,其余记忆随机删:这个极简策略竟追平复杂算法,还省掉了打分开销。
ZimaBlue:先看视频再学机器人动作
ZimaBlue先从12万小时视频学物理变化,再把经验对齐成机器人动作,探索跨场景泛化。
代码Agent开始批量制造训练环境
它把代码 Agent 的旧操作录像还原成训练场,让一份轨迹可以反复出题、执行和验收。
速览 BRIEFS — 8
PAPER
WorldReward给世界模型当裁判
WorldReward把长视频拆成动作片段,让同一个“裁判”同时检查镜头听不听话、画面稳不稳定。
PAPER
物理视频测试不再死磕绝对数值
Principia不量绝对速度,改查物体间关系,揭开视频模型“逼真但不守物理”的落差。
PAPER
混合大模型的4比特生存指南
把循环记忆也压到4比特,误差没有越积越多,反而会被后续写入逐步擦除。
PAPER
FP4预训练开始争夺稳定性
UE5M3扩大块级缩放量程,让FP4预训练用更简单的配方保持稳定。
PAPER
人形机器人学会判断能否急停
机器人急停前先判断当前姿态能否安全刹住;若不能,就转入缓冲倒地。
PAPER
Agent任务越长,能力会怎样腐烂
实测显示,Agent每步的小失误会连乘,长任务最终近乎必然崩塌。
PAPER
自然语言函数可以编译成小模型
把反复调用远端大模型的文字任务,编译成可复用的本地小模型
PAPER
世界动作模型先检查未来再行动
机器人先比较多个“想象中的未来”,再选更可信的方案行动。