深度专题 FEATURES — 2
World Agent:生成的世界能活多久
它不再只问生成世界像不像,而是追问:门打开之后,这个世界还能否记住原因并继续运转。
快注意力为何没那么容易
快注意力并非普遍可得:新论文为线性、稀疏注意力的最坏情形承诺划出理论边界。
速览 BRIEFS — 9
PAPER
循环与稀疏,谁更会扩展模型
让模型多想几轮,也多备几位专家:新扩展律给出算力与容量的搭配方法。
PAPER
Devol-ONE把策略与世界模型合成一个模型
Devol-ONE把机器人行动与未来预演合进同一个自回归模型。
PAPER
世界模型终于开始“听见”环境
HelixWorld让可实时操控的世界模型同时生成画面与空间声,声音会随视角一起转动。
PAPER
FP8训练补上注意力最后一道裂缝
Delta-Matching校准注意力的前反向误差,补上原生FP8训练的关键缺口。
PAPER
KV压缩策略也可以按上下文现学
KV-Kaizen让模型看过当前文本后,再逐层决定怎样压缩KV缓存。
PAPER
LLM流水线会在接口处丢掉40分
同一模型和提示,任务一拆多步,接口漏信息就可能让准确率骤降40.5个百分点。
PAPER
电脑操作Agent有了可复制的RL沙箱
CUA-Sandbox共享软件底座、隔离每次尝试的状态,显著压低电脑Agent强化学习成本。
PAPER
人形机器人用反事实视频扩充经验
PRISM把4段真人示范扩成256段反事实视频,让人形机器人练习搬运更多物体。
PAPER
MoE推理开始为Prefill和Decode分别剪枝
SlimWise让MoE预填充保留完整模型、解码单独剪枝,用分阶段取舍换取更高吞吐。