Python · 项目报告

mira-wm/mira

Code for MIRA: Multiplayer Interactive World Models with Representation Autoencoders

已完成 打开 GitHub
M
355星标
17Fork
1Issue
Apache-2.0许可证

分析结果

项目分析

MIRA 是一个面向《Rocket League》2v2 多人交互场景的实时世界模型项目。它使用约 5B 参数的潜空间扩散模型,根据四名玩家的动作逐帧生成游戏视频,可在单张 NVIDIA GPU 上以约 20 FPS 运行完整 2v2 对局。仓库提供官方代码、数据集加载工具、训练脚本、评估脚本和交互式数据探索工具,适合研究多人交互世界模型、视频生成、游戏 AI、表示自编码器和实时仿真。

适用领域 世界模型 / 视频生成 / 扩散模型 / 多智能体系统 / 游戏 AI / 强化学习环境建模 / 表示学习 / Representation Autoencoder / 计算机视觉 / 交互式仿真 / 生成式 AI
配置难度 高。该项目涉及大规模视频扩散模型、表示自编码器、多玩家同步数据、Hydra 配置、多 GPU 训练和 GPU 性能优化。对于熟悉 PyTorch 和深度学习训练的开发者可以运行基础数据加载与测试,但完整训练或复现 5B 参数世界模型需要较强的机器学习工程能力和充足算力。
商业价值 中到高。短期更适合科研展示、游戏 AI 原型、交互式仿真验证和生成式世界模型技术储备;直接商业落地存在硬件成本、领域迁移和稳定性挑战。长期来看,该项目代表了实时可交互游戏世界模型方向,可用于游戏内容生成、AI 训练环境、可学习仿真器、玩家行为模拟和虚拟测试平台,具备较高战略价值。
01

技术亮点

  • 官方代码发布,背后有 General Intuition、Kyutai 和 Epic Games 参与
  • Apache-2.0 许可证,商业和研究使用相对友好
  • 支持实时交互式世界模型演示,项目提供 mira-wm.com 在线体验
  • 可基于四名玩家动作生成多人同步游戏视频
  • 支持完整 2v2 对局在模型内部运行,目标性能约 20 FPS 单 GPU
  • 提供 Rocket Science 数据集,包含四个玩家同步视角、键盘动作、游戏物理状态和事件
  • 包含数据探索工具,可查看四玩家网格、键盘叠加和俯视状态
  • 提供 codec、单玩家世界模型、4 玩家世界模型的训练入口
  • 技术方向前沿,适合研究多智能体世界模型和交互式视频生成
02

目标用户

  • 从事世界模型或生成式视频模型研究的 AI 研究员
  • 研究多智能体交互建模的开发者
  • 游戏 AI 与仿真平台开发者
  • 希望复现 MIRA 技术报告的研究团队
  • 对 Rocket League 数据集建模感兴趣的机器学习工程师
  • 具备 GPU 训练资源的高校实验室或企业研发团队
03

配置要求

  • 需要 NVIDIA GPU,README 明确说明安装和运行依赖 GPU
  • 需要 pixi 作为环境管理和运行工具
  • 依赖 PyTorch >= 2.8,安装流程会自动处理
  • 训练脚本基于 Hydra 配置系统,可通过 key=value 覆盖配置
  • 多 GPU 训练通过 torchrun 执行,单 GPU 也可运行
  • 数据集位于 HuggingFace Hub:kyutai/rocket-science
  • 训练 codec 需要 Meta gated 的 DINOv3-L/16 权重
  • 需要从 DINOv3 页面下载 dinov3_vitl16_pretrain_lvd1689m-8aa4cbdd.pth
  • 训练 codec 时需要设置环境变量 RS_DINO_WEIGHTS_DIR=/path/to/weights
  • 世界模型训练和推理不需要 DINOv3 权重
  • 需要准备 dataset.train_index 和 dataset.test_index 路径
  • 大模型训练预计需要较高显存、存储和数据 IO 能力
04

适用场景

  • 训练或微调 Rocket League 场景下的多人交互世界模型
  • 研究基于玩家动作条件控制的视频预测与生成
  • 探索 4 名玩家同步视角的数据集和游戏状态数据
  • 构建游戏 AI 的可学习仿真环境
  • 评估世界模型在多智能体决策和实时交互中的能力
  • 复现实验:训练 codec、单玩家世界模型、多玩家世界模型
  • 用于论文研究、技术验证或生成式仿真原型开发
05

部署与配置

  • 安装 pixi:https://pixi.sh
  • 准备支持 CUDA 的 NVIDIA GPU 环境
  • 克隆仓库:git clone https://github.com/mira-wm/mira.git
  • 进入项目目录:cd mira
  • 运行初始化命令:pixi run setup
  • 运行测试:pixi run test
  • 可选:运行数据集探索工具:pixi run explore
  • 可选:从 HuggingFace 下载 kyutai/rocket-science 数据集或通过代码自动加载测试 split
  • 训练 codec:python scripts/train_codec.py dataset.train_index=/path/to/train dataset.test_index=/path/to/test
  • 训练单玩家世界模型:python scripts/train_world_model.py model.architecture.config.codec_checkpoint=/path/to/codec_ckpt dataset.train_index=/path/to/train dataset.test_index=/path/to/test
  • 训练 4 玩家世界模型:python scripts/train_world_model.py model=multi_wrapper_world_model dataset.n_players=4 model.architecture.config.wm_config.codec_checkpoint=/path/to/codec_ckpt run.finetune_from=/path/to/single_player_ckpt dataset.train_index=/path/to/train dataset.test_index=/path/to/test
  • 离线评估模型:python scripts/eval_world_model_offline.py /path/to/checkpoint-1000/checkpoint.pth
06

风险与注意事项

  • 模型规模约 5B 参数,训练和推理硬件成本较高
  • README 中未明确提供预训练权重下载方式,实际复现可能需要自行训练或寻找发布 checkpoint
  • codec 训练依赖 Meta DINOv3-L/16 gated 权重,获取流程可能受权限限制
  • 数据集可能体积较大,下载、存储和加载成本较高
  • 项目偏研究性质,生产级稳定性、API 完整性和长期维护节奏需要进一步评估
  • 应用场景高度绑定 Rocket League 数据和环境,迁移到其他游戏或真实世界场景需要大量改造
  • 多 GPU 训练、Hydra 配置和大规模视频模型训练对工程经验要求较高
  • 实时运行虽然声称可在单 GPU 上实现,但具体 GPU 型号、显存需求和性能边界 README 未详细说明

历史记录

热榜历史快照

2026-07-12 第21名 新收录 · github_search
2026-07-11 第29名 新收录 · github_search
2026-07-10 第29名 新收录 · github_search