让机器人连续按五次按钮,难点不只是“看见按钮”,还得记住已经按了几次。许多机器人模型只顾眼前画面,长任务做到一半就容易“失忆”。面壁智能开源的 MiniCPM-RobotManip,试图用仅 1.5B、即约 15 亿参数的模型补上这块短板。它是一款 VLA(Vision-Language-Action)模型,负责把机器人看到的画面和收到的语言指令,转成实际动作。
据量子位报道,MiniCPM-RobotManip会同时参考历史画面和此前动作。在专门测试上下文记忆的 RMBench 中,它获得约 53 分,而对比模型 π0.5 约为 10 分;在 LIBERO、Calvin、RoboTwin2 等评测中,其整体表现也进入第一梯队。报道还称,在 H100 显卡、bf16 精度下,它的单次决策延迟约 120 毫秒,π0.5 约为 234 毫秒。小模型通常更容易装进机器人本地设备,减少对云端和网络的依赖。不过,这些效果目前来自发布方展示及媒体报道,材料未提供独立复现实验。