Python · 项目报告

OpenBMB/MiniCPM-Robot

A Smarter and Faster On-Device AI Brain for Robots

已完成 打开 GitHub
O
242星标
15Fork
3Issue
Apache-2.0许可证

分析结果

项目分析

OpenBMB/MiniCPM-Robot 是 MiniCPM 面向真实机器人场景的具身智能模型家族,核心目标是在端侧设备上实现更快、更小、更强的机器人“AI 大脑”。当前包含两个主要方向:MiniCPM-RobotManip,一个 1.5B 视觉-语言-动作模型,用于机器人操作与抓取等通用操控任务;MiniCPM-RobotTrack,一个 0.9B 端侧目标跟踪模型,用于四足机器人等平台的自然语言目标跟随。项目采用 Apache-2.0 许可证,主要语言为 Python,适合具身智能、机器人控制、多模态大模型和端侧部署方向的开发者研究与二次开发。

适用领域 具身智能 / 机器人操作 / 机器人目标跟踪 / 视觉-语言-动作模型 / 多模态大模型 / 端侧 AI 推理 / 四足机器人 / 机器人感知与控制 / 模仿学习与强化数据闭环 / VLA 模型部署
配置难度 中高。对于熟悉 Python、Conda、PyTorch 和多模态模型推理的开发者,跑通离线样例难度中等;但要在真实机械臂或 Unitree Go2 等机器人上稳定部署,需要理解相机输入、机器人状态、动作空间、控制频率、安全机制和硬件接口,工程难度较高。
商业价值 该项目对机器人公司、智能制造、仓储物流、服务机器人和科研平台具有较高潜在价值。它提供了小参数量、端侧化、自然语言驱动的机器人操控与跟踪能力,可帮助团队降低从感知到决策再到控制的系统集成复杂度。Apache-2.0 许可证有利于商业评估和产品化探索。不过,真正商业落地仍需要针对具体硬件、任务场景和安全要求进行大量数据采集、微调、验证和工程加固。
01

技术亮点

  • 模型参数量较小:Manip 为 1.5B,Track 为 0.9B,更适合端侧和低延迟部署
  • MiniCPM-RobotManip 是通用型 VLA 模型,单套权重覆盖多个下游操控任务
  • 在 LIBERO、Calvin、RoboTwin2、RMBench 等代表性评测中展示出与更大模型竞争甚至领先的结果
  • 支持流式上下文,将历史观察纳入模型上下文,显著降低长历史帧重算成本
  • README 声称 60 帧历史下传统重算需要 125 TFLOPs,而流式推理仅需 3.3 TFLOPs
  • 继承 MiniCPM-V 4.6 的视觉 token 压缩能力,将每帧视觉 token 从 256 压缩到 64
  • MiniCPM-RobotTrack 强调完全端侧运行,在 Unitree Go2 EDU 上实现 5+ FPS 和约 180 ms 延迟
  • 支持自然语言目标跟踪,降低传统机器人感知、规划、控制栈的搭建成本
  • 包含 Go2 Edu 一键部署和启动工作流文档,利于真实机器人落地
  • Apache-2.0 许可证对商业使用和二次开发较友好
  • 提供 Hugging Face、ModelScope 模型集合入口,方便国内外开发者获取模型
02

目标用户

  • 具身智能和机器人方向的研究人员
  • 从事机械臂抓取、操作任务的算法工程师
  • 使用 Unitree Go2 等四足机器人进行二次开发的开发者
  • 希望在端侧设备部署多模态模型的 AI 工程师
  • 关注小模型高效推理、流式上下文、多帧视觉记忆的模型工程师
  • 高校实验室、机器人创业团队、智能制造和服务机器人研发团队
  • 希望复现 LIBERO、Calvin、RoboTwin2、EVT-Bench 等评测的研究者
03

配置要求

  • 推荐 Python 3.10
  • 推荐 PyTorch 2.6.0
  • 推荐 CUDA 12.4,尤其是进行 GPU 推理或开发时
  • 需要 Conda 用于复现官方环境
  • 需要下载 MiniCPM-RobotManip 或 MiniCPM-RobotTrack 的模型权重
  • MiniCPM-RobotManip 推理至少需要一张图像和一条自然语言指令
  • MiniCPM-RobotManip 可选输入 robot state,若未提供则默认使用全零状态
  • MiniCPM-RobotManip 输出动作块形状为 (30, 80)
  • 多视角操控任务需要准备多个摄像头视角图像
  • 真实机器人部署需要匹配具体机器人平台的控制接口、相机输入、坐标系、动作空间和安全约束
  • MiniCPM-RobotTrack 的 Go2 端侧部署需要 Unitree Go2 Edu 及其本地计算、摄像头和运动控制环境
  • 如果追求更高吞吐,可关注 README 中提到的 PhyAI、CUDA Graph 和 Triton fused kernels 优化方案
04

适用场景

  • 机械臂根据图像和自然语言指令执行抓取、放置、移动等操作任务
  • 机器人基于多视角图像输入和语言指令生成动作序列
  • 四足机器人根据自然语言描述在本地完成目标人物或物体跟踪
  • 在仿真环境和真实机器人环境中评估通用 VLA 策略
  • 构建无需传统感知、规划、控制模块拆分的端到端机器人行为模型
  • 研究长时视觉上下文记忆对机器人决策的提升
  • 基于 MiniCPM-RobotManip 或 MiniCPM-RobotTrack 进行领域微调或任务适配
  • 在边缘计算设备上验证多模态模型的低延迟推理能力
05

部署与配置

  • 克隆仓库:git clone https://github.com/OpenBMB/MiniCPM-Robot.git
  • 进入仓库目录:cd MiniCPM-Robot
  • 如需使用 MiniCPM-RobotManip,进入子目录:cd MiniCPM-RobotManip
  • 安装并初始化 Conda 环境,推荐使用 README 中测试过的 Python 3.10、PyTorch 2.6.0、CUDA 12.4 环境
  • 创建环境:conda env create -f environment.yml
  • 激活环境:conda activate MiniCPM-RobotManip
  • 下载对应模型权重,可从 Hugging Face 或 ModelScope 的 OpenBMB/MiniCPM-Robot 模型集合获取
  • 将权重放置到本地 checkpoint 目录或在命令行中通过 --checkpoint 指定
  • 运行单样本推理示例:python vla_infer.py --image frame.jpg --text "Pick up the red block." --checkpoint ./checkpoint --state-file state.npy --embodiment-id 0 --output action.npy
  • 如需多视角输入,可重复传入 --image 参数,例如 --image cam_front.jpg --image cam_wrist.jpg
  • 如需使用 MiniCPM-RobotTrack,进入 MiniCPM-RobotTrack 目录,并参考其 GO2_DEPLOYMENT.md 完成 Unitree Go2 Edu 本地部署、模型加载、摄像头输入、文本指令和机器人控制配置
06

风险与注意事项

  • 项目发布时间较新,生态、issue 经验和社区案例可能还不充分
  • 真实机器人部署存在安全风险,模型输出动作可能导致碰撞、跌倒、夹伤或设备损坏,必须增加安全保护和人工急停机制
  • README 中的 benchmark 和延迟结果需要在自身硬件、任务和机器人平台上重新验证
  • MiniCPM-RobotManip 虽然参数较小,但真实部署仍需要 GPU 或较强边缘计算资源
  • 不同机器人本体的动作空间、关节定义、传感器布局和控制频率差异较大,迁移成本不可低估
  • 端到端 VLA 模型可解释性较弱,排查失败原因比传统模块化系统更困难
  • 模型权重较大,下载、存储和加载可能对网络和磁盘有要求
  • Go2 相关部署主要面向特定硬件平台,其他四足机器人或移动机器人需要额外适配
  • 自然语言跟踪在复杂光照、遮挡、多目标交叉、动态障碍物等场景仍可能出现鲁棒性问题
  • 项目依赖 CUDA、PyTorch、机器人 SDK 等环境,版本不匹配可能导致安装和运行问题

历史记录

热榜历史快照

2026-07-25 第27名 新收录 · github_search