Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.018 — 2026-07-22
REPO 2 信源 约 4 分钟

MiniCPM-Robot:2B小模型走进现实

OpenBMB 开源两款轻量具身模型,让机器人用小模型处理操控与目标追踪。

IMAGE — HF Trending Models(模型榜单)

你对机械臂说“把杯子放到桌角”,它不能只认出杯子、复述指令,还得把眼前画面变成一连串可以执行的动作。另一边,一台移动设备要持续跟住现实中的目标,也不能看一帧、忘一帧。OpenBMB 开源的 MiniCPM-Robot,瞄准的正是这两类任务:让较小的模型从屏幕里的问答走向现实中的操控与追踪。

需要先澄清标题里的“2B”。这不是一个参数量为 2B 的单模型,而是两个不同模型:1.5B 的 MiniCPM-RobotManip 和 0.5B 的 MiniCPM-RobotTrack。参数量相加虽为 2B,却不能把它们当成一颗合并后的“大脑”。目前信息主要来自 OpenBMB 官方模型页及项目方宣发,尚缺少独立验证。

一套系列,分做两件事

据 OpenBMB 官方 Hugging Face 页面,MiniCPM-RobotManip 是一个 1.5B 的视觉—语言—动作模型,也就是 VLA。它把摄像头画面、文字指令和机器人动作放进同一套模型里,目标是让机器人看懂场景后直接决定怎么动。

这和普通的看图问答不同。普通模型看到杯子,可能回答“桌上有一个杯子”;VLA 则要继续完成下一步:把理解转换成动作。机器人操控通常包括抓取、移动和放置,难点不只是“认对东西”,还要给出连续、可执行的控制结果。

官方示例展示了这条输入链路。程序接收一张或多张图像,再加入文字指令和机器人当前状态。图像统一缩放到 448×448;状态用 80 个数表示,输入形状最终整理为 (1,1,80)。模型随后返回一个形状为 (30,80) 的动作块。可以把它理解成:模型不是只说“往左移动”,而是一次给出一小段由多步组成的动作数据。材料没有进一步解释这 80 个状态或动作维度分别代表什么,因此不能据此判断它支持哪些机器人本体。

系列中的另一款 MiniCPM-RobotTrack 参数量为 0.5B,项目方将它定位为现实世界目标追踪模型。目标追踪指的是让系统在连续画面中持续找到同一个对象,而不只是对单张图片做识别。现有材料没有披露它如何保存目标信息、处理遮挡,或在目标快速移动时维持追踪。

项目还同时给出 PhyAI。项目方称它是面向具身模型的高性能推理框架。推理就是模型实际接收输入并算出结果的过程;如果这一过程在机器人本机完成,就叫端侧推理。端侧运行可以减少网络等待和数据外传,但也会受到算力、内存和功耗限制。遗憾的是,材料没有提供 PhyAI 的速度、资源占用或硬件测试数据,“高性能”目前仍是项目方定位,而不是有对照实验支撑的结论。

小模型为什么值得看

MiniCPM-Robot 的看点不在于两个参数数字可以凑成 2B,而在于它把操控和追踪分别压进 1.5B 与 0.5B 的模型中,并以系列形式开源。对具身智能来说,模型的终点不再是一段文字答案,而是机器人接下来要执行的动作,或摄像头下一帧仍需锁定的目标。

这也解释了为什么“小”很重要。机器人若要在本机运行模型,就必须面对有限的计算和内存条件。较小的模型至少提供了一条面向端侧部署的路线。不过,“更小”不自动等于“足够快”,更不等于“操控可靠”。官方使用了“更聪明、更快”“实用”等措辞,但没有公布基准测试,现阶段更适合把 MiniCPM-Robot 看作一套开放的工程起点,而非已经验证成熟的机器人方案。

局限与未知

  • 目前只有一个可稳妥确认的独立信源体系,材料未提供操作成功率、追踪精度、推理速度、硬件占用、许可证或与其他模型的对比。
  • MiniCPM-RobotManip 示例要求 transformers==5.7.0,但现有材料未说明这一版本要求是否准确、是否可直接获取,使用前需要复核。
  • 项目方称系列能让机器人“理解、记忆与行动”,但材料没有说明“记忆”的具体机制或评测,因此本文不把它当作已经证实的能力。

供稿材料 SOURCES — 2

← 返回 2026-07-22 · 开源板块