人端起杯子时,眼睛看见杯子,手指感到压力,杯子的位置随之变化,还可能发出碰撞声。现有数据往往只记下其中一部分,AI很难学到完整的“看见—行动—环境变化”。ACE-Data-0想补上这块缺口:它把日常空间变成采集场地,按同一时间轴记录第一视角、多路第三视角、全身与手部动作、物体运动、声音和触觉。
团队设计了桌面与房间两套配置,分别捕捉精细手部操作和跨房间的全身活动。论文称,数据覆盖50名参与者、2个环境和200类任务,共150小时、7.5万个交互片段;参与者只接收目标,不照固定脚本行动,因此会保留停顿、规划和临场调整。每段活动由超过8个视角同时观察,并配有身体、手和物体状态。关键不只是数据种类多,而是经过空间标定——先把不同设备的“地图”对准——让一次接触、随后产生的声音及物体位移真正对应起来。作者还用它测试了30多种方法;具体价值仍需后续研究检验,但这种同步记录完整活动的思路,正面回应了具身智能缺少连贯训练数据的问题。