机器人看得见杯子,却未必知道它正从指间滑走。摄像头难以直接捕捉接触面的形变、摩擦和受力,触觉基础模型因此想做一套通用底座:先从大量物体、动作和传感器记录中学习接触规律,再适配抓取、装配等任务,而不是每项任务单独训练。
一篇领域综述把难点归结为两件事:触觉必须靠真实接触主动采集,成本远高于收集网页图片;不同传感器又像说着不同方言,信号很难直接合并。与之呼应,NeoteAI Team 和 Fudan TEAI Team 提出的 -Foundation,把硬件、数据、模型和评测放进同一套方案。其 NeoData 据作者披露包含超过 3 万小时同步视觉—触觉演示,覆盖 6 种机器人形态和 450 项任务,并开放其中 5000 小时;NeoForce 模型则尝试跨不同传感器学习可迁移的触觉表示。作者称,实验显示策略真正利用的是物理接触状态,而非某款设备特有的信号外观。值得关注的不是单个榜单成绩,而是触觉研究开始复制视觉领域“统一接口、扩大数据、预训练通用模型”的规模化路线;不过跨设备、跨任务的普适能力仍待系统验证。