深度专题 FEATURES — 3
Zing-0.5:世界模型进入可玩时代
一个5B世界模型,让你边用键盘探索,边用文字改变正在生成的世界。
工具还没回来,系统先读懂进度
工具没跑完,AI先读进度:实时调度KV缓存,减少等待请求白占显存。
机器人也能现场看例子学新任务
GPT-Policy让机器人现场看示范、边做边学,新任务不必重新训练。
速览 BRIEFS — 8
PAPER
结构化描述给视频模型补物理课
用结构化物理描述和机器人动作训练视频模型,让它更懂物体如何交互,而不只会生成画面。
PAPER
VLA强化学习要跟上真实时间
让大模型先规划、轻量策略随时纠偏,机器人强化学习终于追上现场变化。
PAPER
动作Token不该再一刀切
ActionPiece不只压低动作误差,还尽量保住细微动作之间的远近关系。
PAPER
PPO的价值网络为何越学越平
PPO的价值网络为何越学越平?研究指出,过密监督反而会磨钝判断力。
PAPER
无限参数模型从实时数据长出权重
让模型把实时数据编译成临时权重,边使用边适应,而非只靠固定参数。
PAPER
奖励作弊会在模型内部留下痕迹
简单探针能从模型内部表征识别奖励作弊,甚至预警下一步动作。
PAPER
35B MoE从SSD边读边跑
Edge0预判下一步要用的专家,把35B MoE权重从SSD边读边算。
PAPER
世界变化后,旧经验何时该忘
机器人遇上新身体,旧经验并非越多越好:该忘多少,取决于变化大小与是否会重现。