一段机器人视频看着顺眼,不等于里面的动作真能做出来:夹爪可能悄悄漂移,物体也可能凭空换位。KineBench要解决的,正是具身世界模型“画得像,却未必守物理”的问题。具身世界模型相当于机器人的内部模拟器,根据动作预演环境接下来会怎样变化。
以往的闭环评测常靠逆动力学模型(IDM)从视频前后状态反推动作。但二维画面转成三维动作本就容易出错;执行失败时,很难分清是世界模型失真,还是IDM猜错。KineBench绕开这一步:它逐帧提取机器人末端执行器的6D位姿——三维位置加三维朝向——再把整条轨迹放进物理模拟器执行,直接检查动作是否可行。它还用轨迹平滑度和机械臂可操作性补充诊断。
作者在ManiSkill3的20项操作任务上评测,并称模型扩大数据与算力后的收益会随任务变难而减弱。不过,这套流程仍依赖分割、深度估计和位姿追踪模块,因而减少了归因歧义,却没有彻底消除测量误差。