深度专题 FEATURES — 3
Oneira:生成世界迈向真正交互
Oneira 给生成世界加上可扩展状态表,让新对象能操作、旧变化能留下。
视频助手开始学会何时开口
OneStreamer边看边做笔记,还学习何时开口,让视频模型从被动问答走向实时助手。
世界运动模型:先学会生成三维轨迹
WMM 不先画视频,而先生成物体的三维运动轨迹,让预测、规划与控制共用一种语言。
速览 BRIEFS — 8
PAPER
代码Agent把历史记录变成加速草稿
AgSpec把代码、日志和旧尝试变成现成草稿,最高将生成吞吐量提至4.76倍。
PAPER
强化学习后,模型的语言会悄悄漂移
RLVR提升推理成绩时,也可能让模型逐渐形成难懂且各自不同的表达习惯。
PAPER
世界模型也要学会忽略无关背景
CF-JEPA把可控对象与背景干扰分开表示,让世界模型更专注于行动真正能改变的部分。
PAPER
机器人动作生成压到一步完成
K-MF把机器人动作生成从多轮修正压到一次计算,直指实时控制的延迟瓶颈。
PAPER
推理答案已稳定,模型就该停了
Settle从答案是否定型学习何时收笔,减少模型答对后仍反复推理的算力浪费。
PAPER
稀疏注意力有了专用推理引擎
SparseEngine统一调度15种稀疏方法,让长上下文的理论节省更接近真实吞吐收益。
PAPER
小模型在笔记本上也能办成事
Mingbird重做本地Agent脚手架,让2B小模型的真实任务成绩大幅提升。
PAPER
视频生成的物理盲区有了诊断镜
PhysicsLENS用成对场景检验视频模型:画面像真的,不等于理解了物理。