LingBot-World 2.0(LingBot-World-Infinity)是一个基于 Python/Wan2.2 的交互式世界模型项目,目标是根据初始图像、文本提示和动作输入生成连续视频世界。项目发布了 14B causal-fast 推理代码与模型权重,强调无限交互时长、实时响应、多样化动作交互以及 Agentic Harness(由 pilot agent 规划角色行为、director agent 合成环境变化)。当前仓库更偏研究与推理演示,部署代码未开源。
适用领域
生成式 AI / 视频生成 / 世界模型 / 交互式视频生成 / 多模态 AI / 游戏 AI / 虚拟环境仿真 / AI Agent / 扩散模型推理 / 实时渲染/实时生成
配置难度
高。该项目需要多 GPU 环境、较强的 PyTorch/分布式推理经验、CUDA 与 flash-attn 环境排障能力,并且模型为 14B 级别。适合有 AI 基础设施和研究经验的团队,不适合初学者直接上手。
商业价值
该项目在交互式视频生成、游戏原型、虚拟世界、AI Agent 环境仿真、数字人/虚拟拍摄等方向具有较高研究和原型价值。但由于 CC BY-NC-SA 4.0 限制非商业使用、部署代码未开源、推理成本高,短期更适合科研验证、技术储备和概念 Demo,不适合直接用于商业产品上线。
01
技术亮点
- 支持长时序甚至号称无界交互时长的因果世界模型生成
- 发布了 14B causal-fast 模型,面向快速响应和实时交互场景
- 推理采用 KV cache,按视频 chunk 处理,而不是一次性处理所有帧,有利于长视频生成
- 支持丰富交互元素,包括攻击、射箭、施法、射击等动作和文本驱动事件
- 引入 Agentic Harness,将 pilot agent 与 director agent 融入世界模型交互流程
- 提供 HuggingFace 与 ModelScope 双平台模型下载,对国内开发者更友好
- README 中给出了可直接运行的多 GPU 推理命令和 run_fast.sh 脚本
- 项目热度较高,已有 536 stars,说明在研究社区有一定关注度
02
目标用户
- 从事视频生成、世界模型、多模态生成研究的算法工程师和研究员
- 希望探索交互式 AI 场景生成的游戏/VR/AR 原型团队
- 具备多 GPU 推理环境的 AI 工程团队
- 研究 AI Agent 与生成式环境交互的开发者
- 希望复现论文结果或进行二次研究的高校/实验室用户
03
配置要求
- Python 环境,具体版本 README 未明确说明
- PyTorch >= 2.4.0
- CUDA GPU 环境,官方示例使用 8 张 GPU 进行 14B causal-fast 推理
- 需要安装 flash-attn,编译和 CUDA/PyTorch 版本匹配可能是常见问题
- 需要下载 14B 模型权重,磁盘空间、显存和下载带宽要求较高
- 推荐熟悉 torchrun、FSDP、Ulysses 并行、KV cache 等多 GPU 推理配置
- 输入包括初始图像、动作路径 action_path、文本 prompt、输出帧数 frame_num、分辨率 size 等
- 如果在国内环境使用,ModelScope 下载可能比 HuggingFace 更方便
- 官方未发布部署代码,生产部署需参考 SGLang 或 NVIDIA flashdreams 相关方案
04
适用场景
- 从单张图像和文本 prompt 生成可持续推进的交互式视频场景
- 研究角色动作输入对视频世界演化的影响,例如攻击、射箭、施法、射击等动作
- 构建游戏 NPC、虚拟世界、开放场景模拟的研究原型
- 测试因果视频生成模型在长时序、多 chunk 推理下的一致性
- 作为 Wan2.2 生态下的世界模型推理样例进行学习和改造
- 探索 pilot agent 与 director agent 协同控制世界生成的交互范式
05
部署与配置
- 克隆仓库:git clone https://github.com/robbyant/lingbot-world-v2.git && cd lingbot-world-v2
- 参考 Wan2.2 官方文档准备基础环境,项目声明其代码基于 Wan2.2 构建
- 安装 Python 依赖:pip install -r requirements.txt
- 确保 PyTorch 版本 >= 2.4.0,并配置可用 CUDA 环境
- 安装 flash-attn:pip install flash-attn --no-build-isolation
- 安装 HuggingFace CLI:pip install "huggingface_hub[cli]",然后下载模型:huggingface-cli download robbyant/lingbot-world-v2-14b-causal-fast --local-dir ./lingbot-world-v2-14b-causal-fast
- 或使用 ModelScope:pip install modelscope,然后执行 modelscope download robbyant/lingbot-world-v2-14b-causal-fast --local_dir ./lingbot-world-v2-14b-causal-fast
- 多 GPU 推理示例:torchrun --nproc_per_node=8 generate.py --task i2v-A14B --size 480*832 --ckpt_dir lingbot-world-v2-14b-causal-fast --image examples/03/image.jpg --action_path examples/03 --dit_fsdp --t5_fsdp --ulysses_size 8 --frame_num 361 --local_attn_size 18 --sink_size 6 --prompt "your prompt"
- 也可以使用脚本:bash run_fast.sh <weights_dir> <frame_num>,例如 bash run_fast.sh lingbot-world-v2-14b-causal-fast 361
06
风险与注意事项
- 许可证为 CC BY-NC-SA 4.0,仅允许非商业使用,商业化应用存在明确限制
- 模型规模为 14B,推理资源门槛高,官方示例使用 8 GPU,多数个人开发者难以运行
- 部署代码不会开源,工程化落地需要自行适配 SGLang、flashdreams 或其他推理服务框架
- README 中部分模型仍为 TODO,例如 causal-pretrain、bidirectional、1.3B 版本尚未发布
- 项目更偏研究演示,缺少完整 API 服务、Web UI、生产监控、批处理等工程组件
- flash-attn 安装可能受 CUDA、PyTorch、编译环境影响,环境搭建成本较高
- 技术报告和项目发布时间标注为 2026,若当前依赖或链接变化,复现时需核验资源有效性
- 生成内容的稳定性、可控性、安全性和版权合规需要进一步评估
- 模型权重大、推理成本高,不适合低成本实时大规模用户服务
2026-07-15
第2名
新收录 · github_search
2026-07-14
第2名
新收录 · github_search
2026-07-13
第4名
新收录 · github_search
2026-07-12
第6名
新收录 · github_search
2026-07-11
第9名
新收录 · github_search
2026-07-10
第15名
新收录 · github_search