LingBot-VLA 2.0 是一个面向真实机器人应用的视觉-语言-动作(Vision-Language-Action, VLA)基础模型项目,目标是将大规模预训练能力落地到双臂操作、移动操作、仿人机器人、灵巧手等多种机器人形态中。项目提供了预训练权重、训练/后训练代码、RoboTwin 示例、开放环评估、仿真部署和真实机器人推理入口。其核心特点包括 55 维统一动作表示、跨机器人形态的 MoE Action Expert、结合 LingBot-Depth 与 DINO-Video 的当前/未来感知蒸馏,以及约 6 万小时机器人与第一视角视频数据训练背景。整体更偏研究与机器人算法工程项目,而不是开箱即用的普通应用库。
适用领域
机器人学习 / 具身智能 / VLA 模型 / 视觉语言动作模型 / 机器人操作 / 双臂操作 / 移动操作 / 仿人机器人 / 模仿学习 / 机器人策略学习 / 多模态大模型 / 深度学习训练与部署
配置难度
高。该项目涉及多模态大模型、机器人数据格式、动作空间映射、MoE 训练、GPU/CUDA 环境、仿真评估和真实机器人部署。仅运行推理或复现 RoboTwin 示例需要中高级 Python/深度学习工程能力;若要适配自有机器人,则需要机器人控制、数据采集、标定、安全部署和模型微调经验。
商业价值
商业价值较高,尤其适用于具身智能、服务机器人、双臂协作机器人、移动操作机器人和工业/家庭操作场景的研发团队。它可以作为企业构建通用机器人策略模型的技术参考或预训练起点,减少从零训练 VLA 模型的成本。Apache-2.0 许可证也降低了商业探索门槛。但短期落地仍需要大量工程投入,包括机器人数据闭环、真实机安全策略、任务评测体系、推理延迟优化和硬件适配,因此更适合有机器人平台和算法团队的公司或实验室,而不适合普通应用开发者直接集成。
01
技术亮点
- Apache-2.0 许可证,对研究和商业使用较友好
- 提供 Hugging Face 和 ModelScope 权重入口,国内开发者可优先使用 ModelScope
- 面向真实机器人应用,而不仅是论文原型
- 支持 55 维统一动作/状态表示,覆盖手臂、末端执行器、夹爪、灵巧手、腰部、头部、移动底盘等控制信号
- 跨任务、跨机器人构型泛化能力是主要设计目标
- 采用 MoE Action Expert,有助于在统一模型中兼容通用先验与特定机器人/任务模式
- 引入未来预测、DINO-Video 语义时间先验和 LingBot-Depth 几何线索,用于增强动态理解
- README 提供了后训练、开放环评估、RoboTwin 部署和真实机器人部署命令
- 包含 RoboTwin 2.0 50 任务示例,适合复现实验和做二次研究
- 在 GM-100 双臂操作和长时程移动操作指标上展示了相对 π0.5、LingBot-VLA 1.0 等基线的性能提升
02
目标用户
- 机器人算法研究员
- 具身智能方向研究生和博士生
- 机器人创业公司研发团队
- 双臂/移动操作机器人开发者
- 希望在自有机器人数据上微调 VLA 模型的工程师
- 使用 RoboTwin、LeRobot 等数据格式进行机器人训练的开发者
- 关注 Qwen-VL、MoE、视频蒸馏、深度估计与机器人控制结合的多模态模型研究者
03
配置要求
- Python 3.12
- PyTorch 2.8.0
- Conda 环境
- flash-attn==2.8.3,可能需要与 CUDA、PyTorch、Python ABI 匹配
- 高性能 NVIDIA GPU,真实推理示例中 RTX 4090D 约 130ms/次,训练通常需要更高显存和多卡资源
- 预训练/后训练需要 LingBot-VLA 2.0 6B 权重
- 训练需要 Qwen3-VL-4B-Instruct 权重路径
- 训练需要 MoGe-2-vitb-normal、LingBot-Depth、DINO-VIDEO teacher checkpoint/config
- 自定义数据需要 LeRobot v2.1 或 v3.0 数据集目录
- 需要配置 configs/robot_configs/<data_name>.yaml,将原始状态、动作、图像映射到统一特征空间
- 需要 assets/norm_stats/<name>.json 形式的归一化统计文件
- RoboTwin 部署需要将 RoboTwin 仿真依赖与模型推理依赖整合到同一个环境
- 真实机器人部署需要设置 QWEN3VL_PATH、模型 checkpoint 路径和推理端口
04
适用场景
- 在 RoboTwin 2.0 等仿真环境中进行多任务机器人操作策略训练与评估
- 基于自有 LeRobot v2.1/v3.0 数据集对 LingBot-VLA 2.0 进行后训练
- 构建支持双臂、单臂、移动底盘、头部、腰部、灵巧手等多种控制信号的统一机器人策略
- 研究跨 embodiment 泛化能力,即同一模型适配不同机器人构型
- 进行真实机器人部署,提供策略推理服务接口
- 评估 VLA 模型在长时程移动操作任务中的表现
- 研究 MoE 路由、动作专家、未来动态预测、深度/视频蒸馏对机器人策略学习的影响
- 作为企业内部具身智能基础模型训练或微调的参考代码库
05
部署与配置
- 安装 Miniconda 或 Anaconda,并确保 shell 中 conda activate 可用
- 准备 Python 3.12 环境和支持 PyTorch 2.8.0 的 CUDA/GPU 环境
- 克隆仓库:git clone https://github.com/Robbyant/lingbot-vla-v2.git
- 进入项目目录:cd lingbot-vla-v2
- 运行环境创建脚本:bash tools/create_train_env.sh
- 如需使用本地 flash-attn wheel,可执行:bash tools/create_train_env.sh --flash-attn-wheel /path/to/flash_attn.whl
- 如需指定环境名或重建环境,可执行:bash tools/create_train_env.sh --env-name lingbotvla --recreate
- 下载 LingBot-VLA 2.0 权重:python3 scripts/download_hf_model.py --repo_id robbyant/lingbot-vla-v2-6b --local_dir lingbot-vla
- 如需训练,还需要下载 Qwen3-VL-4B-Instruct、MoGe-2-vitb-normal、LingBot-Depth、DINO-VIDEO 等相关权重或配置
- 准备 LeRobot 格式数据、机器人配置 YAML、归一化统计文件后,可通过 train.sh 启动后训练
06
风险与注意事项
- 项目发布时间和论文年份显示为 2026,当前可复现性需要进一步验证,可能存在文档、代码或权重尚未完全稳定的问题
- 模型规模较大,训练和部署对 GPU 显存、CUDA 环境、flash-attn 编译兼容性要求较高
- 依赖 Qwen3-VL-4B-Instruct、MoGe、LingBot-Depth、DINO-VIDEO 等多个外部模型,下载、授权和路径配置较复杂
- 真实机器人部署存在安全风险,模型输出动作需要经过限幅、碰撞检测、急停和硬件安全策略验证
- README 主要描述高层流程,真正适配自有机器人仍需要理解机器人状态空间、动作空间、数据采集和归一化细节
- RoboTwin 仿真依赖与模型推理依赖可能存在包版本冲突,需要较强环境排障能力
- 预训练数据本身未完整开源,仅提供权重和训练框架时,外部团队难以完全复现基础模型训练
- 跨 embodiment 泛化虽是亮点,但迁移到全新硬件仍可能需要大量后训练数据和真实机调参
- stars 较高但 forks 较少,说明社区二次使用和工程成熟度可能还在早期阶段
2026-07-14
第9名
新收录 · github_search
2026-07-13
第14名
新收录 · github_search
2026-07-12
第16名
新收录 · github_search
2026-07-11
第19名
新收录 · github_search
2026-07-10
第28名
新收录 · github_search