机器人抓杯子时,摄像头能看见杯子有没有移动,却未必知道手指是否夹紧、杯身是否正要打滑。ME-Dex 1.0想补上这层“手感”:它把触觉加入世界动作模型——一种先在内部预演动作后果、再决定怎么做的模型,而且不局限于某一种触觉硬件。
最关键的一步,是用仿人手的“标准手模型”充当翻译层:不同夹爪、灵巧手和传感器虽然形状、测量方式各异,数据都先映射到同一空间,再由统一触觉自动编码器压缩成模型可共同学习的表示。随后,三个相互交换信息的模块分别预测未来画面、未来触觉和动作,让触觉不只是额外提示,而成为模型预演物理互动的一部分。作者称,ME-Dex在RoboTwin、DexJoCo和ManiFeel上取得更高的平均操作成功率,并在两种实体机器人平台完成任务;现有材料未给出具体提升幅度。