Python · 项目报告

Robbyant/lingbot-world-v2

Infinite Worlds with Versatile Interactions

已完成 打开 GitHub
R
1,096星标
62Fork
4Issue
NOASSERTION许可证

分析结果

项目分析

LingBot-World 2.0(LingBot-World-Infinity)是一个基于 Python/Wan2.2 的交互式世界模型项目,目标是根据初始图像、文本提示和动作输入生成连续视频世界。项目发布了 14B causal-fast 推理代码与模型权重,强调无限交互时长、实时响应、多样化动作交互以及 Agentic Harness(由 pilot agent 规划角色行为、director agent 合成环境变化)。当前仓库更偏研究与推理演示,部署代码未开源。

适用领域 生成式 AI / 视频生成 / 世界模型 / 交互式视频生成 / 多模态 AI / 游戏 AI / 虚拟环境仿真 / AI Agent / 扩散模型推理 / 实时渲染/实时生成
配置难度 高。该项目需要多 GPU 环境、较强的 PyTorch/分布式推理经验、CUDA 与 flash-attn 环境排障能力,并且模型为 14B 级别。适合有 AI 基础设施和研究经验的团队,不适合初学者直接上手。
商业价值 该项目在交互式视频生成、游戏原型、虚拟世界、AI Agent 环境仿真、数字人/虚拟拍摄等方向具有较高研究和原型价值。但由于 CC BY-NC-SA 4.0 限制非商业使用、部署代码未开源、推理成本高,短期更适合科研验证、技术储备和概念 Demo,不适合直接用于商业产品上线。
01

技术亮点

  • 支持长时序甚至号称无界交互时长的因果世界模型生成
  • 发布了 14B causal-fast 模型,面向快速响应和实时交互场景
  • 推理采用 KV cache,按视频 chunk 处理,而不是一次性处理所有帧,有利于长视频生成
  • 支持丰富交互元素,包括攻击、射箭、施法、射击等动作和文本驱动事件
  • 引入 Agentic Harness,将 pilot agent 与 director agent 融入世界模型交互流程
  • 提供 HuggingFace 与 ModelScope 双平台模型下载,对国内开发者更友好
  • README 中给出了可直接运行的多 GPU 推理命令和 run_fast.sh 脚本
  • 项目热度较高,已有 536 stars,说明在研究社区有一定关注度
02

目标用户

  • 从事视频生成、世界模型、多模态生成研究的算法工程师和研究员
  • 希望探索交互式 AI 场景生成的游戏/VR/AR 原型团队
  • 具备多 GPU 推理环境的 AI 工程团队
  • 研究 AI Agent 与生成式环境交互的开发者
  • 希望复现论文结果或进行二次研究的高校/实验室用户
03

配置要求

  • Python 环境,具体版本 README 未明确说明
  • PyTorch >= 2.4.0
  • CUDA GPU 环境,官方示例使用 8 张 GPU 进行 14B causal-fast 推理
  • 需要安装 flash-attn,编译和 CUDA/PyTorch 版本匹配可能是常见问题
  • 需要下载 14B 模型权重,磁盘空间、显存和下载带宽要求较高
  • 推荐熟悉 torchrun、FSDP、Ulysses 并行、KV cache 等多 GPU 推理配置
  • 输入包括初始图像、动作路径 action_path、文本 prompt、输出帧数 frame_num、分辨率 size 等
  • 如果在国内环境使用,ModelScope 下载可能比 HuggingFace 更方便
  • 官方未发布部署代码,生产部署需参考 SGLang 或 NVIDIA flashdreams 相关方案
04

适用场景

  • 从单张图像和文本 prompt 生成可持续推进的交互式视频场景
  • 研究角色动作输入对视频世界演化的影响,例如攻击、射箭、施法、射击等动作
  • 构建游戏 NPC、虚拟世界、开放场景模拟的研究原型
  • 测试因果视频生成模型在长时序、多 chunk 推理下的一致性
  • 作为 Wan2.2 生态下的世界模型推理样例进行学习和改造
  • 探索 pilot agent 与 director agent 协同控制世界生成的交互范式
05

部署与配置

  • 克隆仓库:git clone https://github.com/robbyant/lingbot-world-v2.git && cd lingbot-world-v2
  • 参考 Wan2.2 官方文档准备基础环境,项目声明其代码基于 Wan2.2 构建
  • 安装 Python 依赖:pip install -r requirements.txt
  • 确保 PyTorch 版本 >= 2.4.0,并配置可用 CUDA 环境
  • 安装 flash-attn:pip install flash-attn --no-build-isolation
  • 安装 HuggingFace CLI:pip install "huggingface_hub[cli]",然后下载模型:huggingface-cli download robbyant/lingbot-world-v2-14b-causal-fast --local-dir ./lingbot-world-v2-14b-causal-fast
  • 或使用 ModelScope:pip install modelscope,然后执行 modelscope download robbyant/lingbot-world-v2-14b-causal-fast --local_dir ./lingbot-world-v2-14b-causal-fast
  • 多 GPU 推理示例:torchrun --nproc_per_node=8 generate.py --task i2v-A14B --size 480*832 --ckpt_dir lingbot-world-v2-14b-causal-fast --image examples/03/image.jpg --action_path examples/03 --dit_fsdp --t5_fsdp --ulysses_size 8 --frame_num 361 --local_attn_size 18 --sink_size 6 --prompt "your prompt"
  • 也可以使用脚本:bash run_fast.sh <weights_dir> <frame_num>,例如 bash run_fast.sh lingbot-world-v2-14b-causal-fast 361
06

风险与注意事项

  • 许可证为 CC BY-NC-SA 4.0,仅允许非商业使用,商业化应用存在明确限制
  • 模型规模为 14B,推理资源门槛高,官方示例使用 8 GPU,多数个人开发者难以运行
  • 部署代码不会开源,工程化落地需要自行适配 SGLang、flashdreams 或其他推理服务框架
  • README 中部分模型仍为 TODO,例如 causal-pretrain、bidirectional、1.3B 版本尚未发布
  • 项目更偏研究演示,缺少完整 API 服务、Web UI、生产监控、批处理等工程组件
  • flash-attn 安装可能受 CUDA、PyTorch、编译环境影响,环境搭建成本较高
  • 技术报告和项目发布时间标注为 2026,若当前依赖或链接变化,复现时需核验资源有效性
  • 生成内容的稳定性、可控性、安全性和版权合规需要进一步评估
  • 模型权重大、推理成本高,不适合低成本实时大规模用户服务

历史记录

热榜历史快照

2026-07-15 第2名 新收录 · github_search
2026-07-14 第2名 新收录 · github_search
2026-07-13 第4名 新收录 · github_search
2026-07-12 第6名 新收录 · github_search
2026-07-11 第9名 新收录 · github_search
2026-07-10 第15名 新收录 · github_search