MAGI-2 Preview 是 SandAI 开源的 114B 参数统一音频-视频生成模型推理代码库,支持文本生成视频(T2V)和图像生成视频(I2V),可同时生成音频并通过 ffmpeg 合成为带声视频。模型采用 MagiMoE 架构,每个 token 仅激活约 6B 参数,推理流程分为低分辨率 preview 去噪阶段和 1080p refiner 精修阶段。目前固定生成 10 秒视频,权重托管在 Hugging Face,约 307GB,本仓库主要提供推理 pipeline、配置、Docker 环境和示例脚本。
适用领域
AI 视频生成 / 文生视频 T2V / 图生视频 I2V / 音视频联合生成 / 多模态生成模型 / 扩散模型推理 / 大模型推理工程 / 高性能 GPU 计算
配置难度
高。该项目对 GPU 硬件、CUDA/PyTorch 分布式推理、超大模型权重管理、Docker 环境和音视频处理都有较高要求。若使用官方 Docker 且具备 8 卡 Hopper 环境,可以较快跑通 demo;若从源码安装或做工程集成,难度明显上升。
商业价值
商业价值较高,适合用于高质量短视频生成、广告创意、影视分镜、游戏概念视频、虚拟内容制作和 AIGC 产品验证。Apache-2.0 许可证降低了商业集成障碍,同时音视频联合生成能力具备差异化。但由于硬件成本极高、推理速度可能较慢、目前仅支持 10 秒视频,更适合企业研发、云端生成服务或高端内容生产平台做技术储备和原型验证,不太适合轻量级本地应用。
01
技术亮点
- 114B 参数大规模音视频统一生成模型,但采用 MoE 机制,每 token 仅激活约 6B 参数,强调扩展效率。
- 同时支持文本到视频和图像到视频,且可生成同步音频。
- 采用两阶段生成:preview 阶段生成低分辨率结果,refiner 阶段提升到 1080p 交付级别。
- 官方提供 Docker 镜像,降低复杂依赖如 MagiAttention、MagiCompiler 的构建难度。
- Apache-2.0 许可证,商业使用友好度较高。
- 提供 Hugging Face 权重和完整目录结构说明,便于复现。
- 支持提示词增强,可将短提示改写为结构化的长 caption,以更好利用训练分布。
- 示例脚本和样例数据齐全,适合做快速技术验证。
02
目标用户
- 具备多卡 NVIDIA Hopper GPU 资源的 AI 研究团队
- 视频生成模型研究人员
- 多模态大模型工程师
- AIGC 产品原型开发团队
- 希望评估高质量音视频生成能力的企业研发部门
- 需要本地部署生成式视频模型的实验室或算力平台
03
配置要求
- 必须具备 8 张 NVIDIA Hopper GPU;该项目不是面向普通消费级单卡环境设计。
- Python 版本要求为 3.12。
- 需要较新的 CUDA toolkit。
- 需要 ffmpeg 用于将音频轨道 mux 到输出视频中。
- 权重不随仓库提供,需要从 Hugging Face 下载 sand-ai/MAGI-2-preview,体积约 307GB。
- 默认权重目录为仓库根目录下的 ckpt,也可通过环境变量 MAGI2_CKPT_ROOT 指向其他位置。
- 提示词增强功能需要 OpenAI-compatible API,并在 inference/prompt_enhancement/enhancer.py 中设置 API_KEY;留空则跳过提示词增强。
- 推理脚本依赖 torchrun 分布式启动,典型命令需要 --nproc_per_node=8。
- run_demo.sh 支持通过环境变量 SAMPLES、OUTPUT_DIR、SEED、MASTER_PORT 控制样本文件、输出目录、随机种子和端口。
- 单次推理入口支持 --prompt、--prompt-file、--image、--seed、--config、--output-width、--output-height、--num-inference-steps、--refiner-num-inference-steps、--deterministic 等参数。
04
适用场景
- 根据文本提示词生成 10 秒带声音的视频片段
- 基于首帧图片和提示词生成图像到视频内容
- 评估 MoE 架构在超大规模视频生成模型中的推理表现
- 构建影视、广告、短视频、游戏概念片段的生成式原型
- 研究音频与视频同步生成的多模态 pipeline
- 测试大规模模型在 8 卡 Hopper GPU 上的分布式推理流程
- 对比 preview/refiner 两阶段视频生成效果
05
部署与配置
- 准备硬件环境:至少 8 张 NVIDIA Hopper 架构 GPU,并安装较新的 CUDA toolkit。
- 准备软件环境:Python 3.12,确保 ffmpeg 在 PATH 中;如果缺少 ffmpeg,视频仍可生成但不会合成音频。
- 推荐使用 Docker:执行 docker pull sandai/magi-2-preview:latest 拉取官方镜像。
- 启动容器:docker run --gpus all -it -v /path/to/ckpt:/workspace/ckpt sandai/magi-2-preview:latest。
- 如需自行构建镜像:在仓库根目录执行 docker build -t magi-2-preview:local .。
- 如从源码安装:执行 pip install -r requirements.txt。
- 源码安装还需要 MagiAttention 和 MagiCompiler,具体固定版本可参考 Dockerfile 中的 build args。
- 下载权重:先安装 huggingface_hub,然后执行 hf download sand-ai/MAGI-2-preview --local-dir ckpt。
- 确认 ckpt 目录包含 preview、refiner、text_encoder、vae、stable-audio-open-1.0、turbo_vae 等子目录。
- 运行示例:执行 bash scripts/run_demo.sh,或使用 torchrun --nproc_per_node=8 inference/pipeline/entry.py --prompt "a red fox in snow" --output output/ 生成单个视频。
06
风险与注意事项
- 硬件门槛极高,明确要求 8 张 NVIDIA Hopper GPU,普通开发者和中小团队难以直接运行。
- 权重体积约 307GB,对存储、下载带宽和部署环境要求很高。
- 当前 base 版本尚未 step-distilled,推理步数为 100 preview + 5 refiner,生成耗时可能较长。
- 模型目前只支持 10 秒视频,时长灵活性有限。
- 1080p 输出实际生成尺寸受 VAE stride 约束,可能是 1088x1920,需要额外 resize 才能得到精确 1080x1920。
- 提示词增强依赖外部 OpenAI-compatible LLM 服务,可能引入额外成本、延迟和数据合规问题。
- 仓库主要是推理代码,不包含训练代码或完整数据管线实现,二次训练和深度定制难度较大。
- 依赖 MagiAttention、MagiCompiler 等特定组件,源码安装和环境调试可能复杂。
- 项目仍是 Preview 阶段,接口、性能和模型版本可能变化较快。
2026-08-11
第17名
新收录 · github_search
2026-08-10
第25名
新收录 · github_search
2026-08-09
第23名
新收录 · github_search
2026-08-08
第28名
新收录 · github_search