Python · 项目报告

Robbyant/lingbot-vla-v2

From Foundation to Application

已完成 打开 GitHub
R
512星标
34Fork
3Issue
Apache-2.0许可证

分析结果

项目分析

LingBot-VLA 2.0 是一个面向真实机器人应用的视觉-语言-动作(Vision-Language-Action, VLA)基础模型项目,目标是将大规模预训练能力落地到双臂操作、移动操作、仿人机器人、灵巧手等多种机器人形态中。项目提供了预训练权重、训练/后训练代码、RoboTwin 示例、开放环评估、仿真部署和真实机器人推理入口。其核心特点包括 55 维统一动作表示、跨机器人形态的 MoE Action Expert、结合 LingBot-Depth 与 DINO-Video 的当前/未来感知蒸馏,以及约 6 万小时机器人与第一视角视频数据训练背景。整体更偏研究与机器人算法工程项目,而不是开箱即用的普通应用库。

适用领域 机器人学习 / 具身智能 / VLA 模型 / 视觉语言动作模型 / 机器人操作 / 双臂操作 / 移动操作 / 仿人机器人 / 模仿学习 / 机器人策略学习 / 多模态大模型 / 深度学习训练与部署
配置难度 高。该项目涉及多模态大模型、机器人数据格式、动作空间映射、MoE 训练、GPU/CUDA 环境、仿真评估和真实机器人部署。仅运行推理或复现 RoboTwin 示例需要中高级 Python/深度学习工程能力;若要适配自有机器人,则需要机器人控制、数据采集、标定、安全部署和模型微调经验。
商业价值 商业价值较高,尤其适用于具身智能、服务机器人、双臂协作机器人、移动操作机器人和工业/家庭操作场景的研发团队。它可以作为企业构建通用机器人策略模型的技术参考或预训练起点,减少从零训练 VLA 模型的成本。Apache-2.0 许可证也降低了商业探索门槛。但短期落地仍需要大量工程投入,包括机器人数据闭环、真实机安全策略、任务评测体系、推理延迟优化和硬件适配,因此更适合有机器人平台和算法团队的公司或实验室,而不适合普通应用开发者直接集成。
01

技术亮点

  • Apache-2.0 许可证,对研究和商业使用较友好
  • 提供 Hugging Face 和 ModelScope 权重入口,国内开发者可优先使用 ModelScope
  • 面向真实机器人应用,而不仅是论文原型
  • 支持 55 维统一动作/状态表示,覆盖手臂、末端执行器、夹爪、灵巧手、腰部、头部、移动底盘等控制信号
  • 跨任务、跨机器人构型泛化能力是主要设计目标
  • 采用 MoE Action Expert,有助于在统一模型中兼容通用先验与特定机器人/任务模式
  • 引入未来预测、DINO-Video 语义时间先验和 LingBot-Depth 几何线索,用于增强动态理解
  • README 提供了后训练、开放环评估、RoboTwin 部署和真实机器人部署命令
  • 包含 RoboTwin 2.0 50 任务示例,适合复现实验和做二次研究
  • 在 GM-100 双臂操作和长时程移动操作指标上展示了相对 π0.5、LingBot-VLA 1.0 等基线的性能提升
02

目标用户

  • 机器人算法研究员
  • 具身智能方向研究生和博士生
  • 机器人创业公司研发团队
  • 双臂/移动操作机器人开发者
  • 希望在自有机器人数据上微调 VLA 模型的工程师
  • 使用 RoboTwin、LeRobot 等数据格式进行机器人训练的开发者
  • 关注 Qwen-VL、MoE、视频蒸馏、深度估计与机器人控制结合的多模态模型研究者
03

配置要求

  • Python 3.12
  • PyTorch 2.8.0
  • Conda 环境
  • flash-attn==2.8.3,可能需要与 CUDA、PyTorch、Python ABI 匹配
  • 高性能 NVIDIA GPU,真实推理示例中 RTX 4090D 约 130ms/次,训练通常需要更高显存和多卡资源
  • 预训练/后训练需要 LingBot-VLA 2.0 6B 权重
  • 训练需要 Qwen3-VL-4B-Instruct 权重路径
  • 训练需要 MoGe-2-vitb-normal、LingBot-Depth、DINO-VIDEO teacher checkpoint/config
  • 自定义数据需要 LeRobot v2.1 或 v3.0 数据集目录
  • 需要配置 configs/robot_configs/<data_name>.yaml,将原始状态、动作、图像映射到统一特征空间
  • 需要 assets/norm_stats/<name>.json 形式的归一化统计文件
  • RoboTwin 部署需要将 RoboTwin 仿真依赖与模型推理依赖整合到同一个环境
  • 真实机器人部署需要设置 QWEN3VL_PATH、模型 checkpoint 路径和推理端口
04

适用场景

  • 在 RoboTwin 2.0 等仿真环境中进行多任务机器人操作策略训练与评估
  • 基于自有 LeRobot v2.1/v3.0 数据集对 LingBot-VLA 2.0 进行后训练
  • 构建支持双臂、单臂、移动底盘、头部、腰部、灵巧手等多种控制信号的统一机器人策略
  • 研究跨 embodiment 泛化能力,即同一模型适配不同机器人构型
  • 进行真实机器人部署,提供策略推理服务接口
  • 评估 VLA 模型在长时程移动操作任务中的表现
  • 研究 MoE 路由、动作专家、未来动态预测、深度/视频蒸馏对机器人策略学习的影响
  • 作为企业内部具身智能基础模型训练或微调的参考代码库
05

部署与配置

  • 安装 Miniconda 或 Anaconda,并确保 shell 中 conda activate 可用
  • 准备 Python 3.12 环境和支持 PyTorch 2.8.0 的 CUDA/GPU 环境
  • 克隆仓库:git clone https://github.com/Robbyant/lingbot-vla-v2.git
  • 进入项目目录:cd lingbot-vla-v2
  • 运行环境创建脚本:bash tools/create_train_env.sh
  • 如需使用本地 flash-attn wheel,可执行:bash tools/create_train_env.sh --flash-attn-wheel /path/to/flash_attn.whl
  • 如需指定环境名或重建环境,可执行:bash tools/create_train_env.sh --env-name lingbotvla --recreate
  • 下载 LingBot-VLA 2.0 权重:python3 scripts/download_hf_model.py --repo_id robbyant/lingbot-vla-v2-6b --local_dir lingbot-vla
  • 如需训练,还需要下载 Qwen3-VL-4B-Instruct、MoGe-2-vitb-normal、LingBot-Depth、DINO-VIDEO 等相关权重或配置
  • 准备 LeRobot 格式数据、机器人配置 YAML、归一化统计文件后,可通过 train.sh 启动后训练
06

风险与注意事项

  • 项目发布时间和论文年份显示为 2026,当前可复现性需要进一步验证,可能存在文档、代码或权重尚未完全稳定的问题
  • 模型规模较大,训练和部署对 GPU 显存、CUDA 环境、flash-attn 编译兼容性要求较高
  • 依赖 Qwen3-VL-4B-Instruct、MoGe、LingBot-Depth、DINO-VIDEO 等多个外部模型,下载、授权和路径配置较复杂
  • 真实机器人部署存在安全风险,模型输出动作需要经过限幅、碰撞检测、急停和硬件安全策略验证
  • README 主要描述高层流程,真正适配自有机器人仍需要理解机器人状态空间、动作空间、数据采集和归一化细节
  • RoboTwin 仿真依赖与模型推理依赖可能存在包版本冲突,需要较强环境排障能力
  • 预训练数据本身未完整开源,仅提供权重和训练框架时,外部团队难以完全复现基础模型训练
  • 跨 embodiment 泛化虽是亮点,但迁移到全新硬件仍可能需要大量后训练数据和真实机调参
  • stars 较高但 forks 较少,说明社区二次使用和工程成熟度可能还在早期阶段

历史记录

热榜历史快照

2026-07-14 第9名 新收录 · github_search
2026-07-13 第14名 新收录 · github_search
2026-07-12 第16名 新收录 · github_search
2026-07-11 第19名 新收录 · github_search
2026-07-10 第28名 新收录 · github_search