你对机械臂说“把杯子放到桌角”,它不能只认出杯子、复述指令,还得把眼前画面变成一连串可以执行的动作。另一边,一台移动设备要持续跟住现实中的目标,也不能看一帧、忘一帧。OpenBMB 开源的 MiniCPM-Robot,瞄准的正是这两类任务:让较小的模型从屏幕里的问答走向现实中的操控与追踪。
需要先澄清标题里的“2B”。这不是一个参数量为 2B 的单模型,而是两个不同模型:1.5B 的 MiniCPM-RobotManip 和 0.5B 的 MiniCPM-RobotTrack。参数量相加虽为 2B,却不能把它们当成一颗合并后的“大脑”。目前信息主要来自 OpenBMB 官方模型页及项目方宣发,尚缺少独立验证。
一套系列,分做两件事
据 OpenBMB 官方 Hugging Face 页面,MiniCPM-RobotManip 是一个 1.5B 的视觉—语言—动作模型,也就是 VLA。它把摄像头画面、文字指令和机器人动作放进同一套模型里,目标是让机器人看懂场景后直接决定怎么动。
这和普通的看图问答不同。普通模型看到杯子,可能回答“桌上有一个杯子”;VLA 则要继续完成下一步:把理解转换成动作。机器人操控通常包括抓取、移动和放置,难点不只是“认对东西”,还要给出连续、可执行的控制结果。
官方示例展示了这条输入链路。程序接收一张或多张图像,再加入文字指令和机器人当前状态。图像统一缩放到 ;状态用 80 个数表示,输入形状最终整理为 。模型随后返回一个形状为 的动作块。可以把它理解成:模型不是只说“往左移动”,而是一次给出一小段由多步组成的动作数据。材料没有进一步解释这 80 个状态或动作维度分别代表什么,因此不能据此判断它支持哪些机器人本体。
系列中的另一款 MiniCPM-RobotTrack 参数量为 0.5B,项目方将它定位为现实世界目标追踪模型。目标追踪指的是让系统在连续画面中持续找到同一个对象,而不只是对单张图片做识别。现有材料没有披露它如何保存目标信息、处理遮挡,或在目标快速移动时维持追踪。
项目还同时给出 PhyAI。项目方称它是面向具身模型的高性能推理框架。推理就是模型实际接收输入并算出结果的过程;如果这一过程在机器人本机完成,就叫端侧推理。端侧运行可以减少网络等待和数据外传,但也会受到算力、内存和功耗限制。遗憾的是,材料没有提供 PhyAI 的速度、资源占用或硬件测试数据,“高性能”目前仍是项目方定位,而不是有对照实验支撑的结论。
小模型为什么值得看
MiniCPM-Robot 的看点不在于两个参数数字可以凑成 2B,而在于它把操控和追踪分别压进 1.5B 与 0.5B 的模型中,并以系列形式开源。对具身智能来说,模型的终点不再是一段文字答案,而是机器人接下来要执行的动作,或摄像头下一帧仍需锁定的目标。
这也解释了为什么“小”很重要。机器人若要在本机运行模型,就必须面对有限的计算和内存条件。较小的模型至少提供了一条面向端侧部署的路线。不过,“更小”不自动等于“足够快”,更不等于“操控可靠”。官方使用了“更聪明、更快”“实用”等措辞,但没有公布基准测试,现阶段更适合把 MiniCPM-Robot 看作一套开放的工程起点,而非已经验证成熟的机器人方案。
局限与未知
- 目前只有一个可稳妥确认的独立信源体系,材料未提供操作成功率、追踪精度、推理速度、硬件占用、许可证或与其他模型的对比。
- MiniCPM-RobotManip 示例要求
transformers==5.7.0,但现有材料未说明这一版本要求是否准确、是否可直接获取,使用前需要复核。 - 项目方称系列能让机器人“理解、记忆与行动”,但材料没有说明“记忆”的具体机制或评测,因此本文不把它当作已经证实的能力。