OpenWAM 是一个面向机器人通用策略与世界-动作模型(World-Action Model, WAM)预训练的开源研究框架。它提供模块化基础设施、受控实验配置、预训练/微调模型与多种机器人基准评测支持,目标是系统化研究视频世界模型、动作建模、VLM 理解模块和机器人策略学习之间的耦合方式。仓库使用 Python,Apache-2.0 协议,已发布 Hugging Face 模型与数据,适合机器人学习、具身智能和多模态世界模型方向的研究团队使用。
适用领域
机器人学习 / 具身智能 / 世界模型 / 动作模型预训练 / 通用机器人策略 / 视频生成/视频预测模型 / 模仿学习 / 多模态大模型 / 机器人基准评测 / 强化学习与策略部署
配置难度
高。该项目属于前沿机器人基础模型研究框架,安装环境、资产准备、分布式训练、模型配置和 benchmark 评测都比较复杂。适合具备 PyTorch、CUDA、多 GPU 训练、机器人仿真环境和多模态模型经验的开发者或研究团队;不适合作为入门级机器人项目。
商业价值
对从事具身智能、机器人基础模型和通用机器人策略研发的团队具有较高研究与战略价值。它可以作为评估世界-动作模型架构、复现前沿论文、构建内部机器人策略预训练平台的基础。但短期商业落地价值取决于团队是否拥有足够算力、数据、仿真/真实机器人平台和工程化能力。对于云机器人、工业机器人、家庭机器人和通用操作策略公司,该项目可作为技术验证和模型架构参考;对于普通应用开发者,直接商业价值较低。
01
技术亮点
- 提供开放的 World-Action Model 研究栈,不只是单个模型,而是包含架构、训练、推理、部署和评测的完整框架。
- 支持 single_system、dual_system、tri_system 等多种 WAM 架构,便于进行系统性对比实验。
- 支持多种视频 backbone,包括 Wan2.2、Wan2.1、Cosmos-Predict2.5、Cosmos3-Edge 等。
- 提供 OpenWAM-Alpha 预训练模型,训练规模达到 518.5M 帧,约 6400 小时人类和机器人第一视角数据。
- 支持多个主流机器人基准,包括 RoboTwin、LIBERO、LIBERO-plus、RoboCasa365、RoboCasa GR1、VLABench、EBench 和 RoboDojo。
- 使用 Hydra 配置系统,实验组合灵活,适合研究不同模型组件与训练策略。
- 提供资产下载脚本,可自动下载模型、数据、视觉编码器并更新对应 YAML 路径。
- 支持 checkpoint 直接部署,可通过 scripts/deploy.sh 启动策略服务。
- Apache-2.0 开源协议,商业和研究使用限制较少。
- 与 XPolicyLab 集成,有利于进一步进行策略评测和机器人实验。
02
目标用户
- 机器人学习研究员
- 具身智能方向博士生/硕士生
- 研究型 AI 实验室
- 机器人基础模型团队
- 多模态世界模型研究团队
- 希望复现实验或扩展 WAM 架构的开发者
- 需要在 LIBERO、RoboTwin、RoboCasa、VLABench 等基准上训练/评测策略的团队
- 具备多 GPU 训练资源的企业研发团队
03
配置要求
- Python >= 3.10。
- 推荐 PyTorch 2.7.1 + CUDA 12.8。
- 需要 NVIDIA GPU;README 推荐训练配置为 8 张 80GB 显存 GPU。
- 需要 gcc 编译器,用于安装 deepspeed。
- 如使用 Cosmos-Predict2.5,需要 CUDA toolkit 和 nvcc,并会编译 transformer-engine。
- 需要较大磁盘空间存放视频 backbone、benchmark 数据、视觉编码器和 OpenWAM checkpoints。
- 需要配置 Hydra YAML 文件,包括 configs/model、configs/dataloader、configs/train.yaml 和部署相关配置。
- 不同实验需要下载对应 assets,例如 video_backbone_ckpt、benchmark_data、vlm_backbone_ckpt、visual_encoder_ckpt、openwam_ckpt。
- 训练或微调时需要设置 dataloader、model、video_backbone、architecture.variant、attention_mask_mode 等参数。
- 微调官方 checkpoint 时,需要设置 training.finetune_ckpt_path 指向下载后的 checkpoint 目录。
04
适用场景
- 基于预训练 OpenWAM-Alpha 进行机器人任务微调
- 从零训练 World-Action Model 并研究不同架构设计
- 比较 single_system、dual_system、tri_system 等不同 WAM 架构
- 评估视频 backbone、动作 backbone、VLM backbone 对机器人策略性能的影响
- 在 LIBERO、RoboTwin、RoboCasa365、VLABench、EBench 等基准上进行统一评测
- 研究世界知识继承、动作学习和视频模型耦合机制
- 构建面向真实机器人或仿真环境的策略服务与推理部署
- 复现论文 OpenWAM: An Open, Modular Exploration Towards Systematic World–Action Model Pretraining 的实验结果
05
部署与配置
- 确保系统安装 Python >= 3.10、Git、CUDA 环境和可用的 NVIDIA GPU。
- 创建 Conda 环境:conda create -n openwam python=3.10 && conda activate openwam。
- 或使用 venv:python3 -m venv .venv && source .venv/bin/activate。
- 安装推荐版本 PyTorch:pip install torch==2.7.1 torchvision==0.22.1 torchaudio==2.7.1 --index-url https://download.pytorch.org/whl/cu128。
- 在仓库根目录执行可编辑安装:pip install -e .。
- 确保 gcc 在 PATH 中,因为 deepspeed 会在安装过程中进行源码编译。
- 如需使用 Cosmos-Predict2.5 backbone,初始化子模块:git submodule update --init third_party/cosmos-predict2.5,然后执行 bash scripts/install_cosmos_predict25.sh。
- 下载视频 backbone:python scripts/download_assets/download_video_backbone.py。
- 下载 benchmark 数据:python scripts/download_assets/download_benchmark_data.py。
- 如使用 tri_system,下载 VLM backbone:python scripts/download_assets/download_vlm_backbone.py。
- 如使用外部视觉编码器,下载 visual encoder:python scripts/download_assets/download_visual_encoder.py。
- 如需直接使用官方模型,下载 OpenWAM checkpoints:python scripts/download_assets/download_openwam_checkpoints.py。
- 部署已下载 checkpoint:bash scripts/deploy.sh <ckpt_dir_path>。
- 启动快速训练调试示例:bash scripts/train.sh dataloader=libero model=dual_system model/video_backbone=wan22_ti2v_5b model.architecture.variant=joint_self_attn model.architecture.attention_mask_mode=mutual training.debug=true。
06
风险与注意事项
- 硬件门槛很高,推荐训练资源为 8 张 80GB GPU,个人开发者难以完整训练。
- 项目面向前沿研究,工程复杂度高,对机器人学习、世界模型、视频模型和分布式训练都有较高要求。
- README 中大量仓库结构和支持状态内容被注释,实际可用性需要进一步检查代码和 issue。
- 发布时间较新,生态成熟度、社区反馈和长期维护情况仍需观察。
- 多个依赖涉及大模型、CUDA、deepspeed、transformer-engine,安装和环境兼容风险较高。
- 模型和 benchmark 数据体积可能很大,对网络、存储和下载稳定性要求高。
- 部分 benchmark 标记为 planned 或 external,可能需要额外环境或第三方工具才能完整运行。
- 真实机器人部署仍需适配具体硬件、传感器、动作空间和安全机制,不能直接用于生产环境。
- 论文 arXiv 链接日期显示为 2026,仓库信息可能包含未来时间线,建议核实项目真实性与版本状态。
2026-09-10
第24名
新收录 · github_search