Python · 项目报告

jd-opensource/JoyAI-Video-Edit

[Official Repo] JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion

已完成 打开 GitHub
J
698星标
27Fork
6Issue
Apache-2.0许可证

分析结果

项目分析

JoyAI-Video-Edit 是京东开源的实时、指令驱动视频编辑系统,面向直播流或已上传视频,支持在帧到达时进行因果式编辑,无需等待完整视频、预设视频长度或回看未来帧。项目基于 MLLM 条件编码器、因果视频 VAE 和 16B 参数多模态扩散 Transformer,主打 720p 实时视频编辑,官方部署 benchmark 声称端到端可达 30.19 FPS。仓库提供部署代码、在线 Demo、技术报告和 Hugging Face 权重,采用 Apache-2.0 许可证。

适用领域 AI 视频编辑 / 生成式 AI / 扩散模型 / 多模态大模型 / 实时视频流处理 / 计算机视觉 / 视频生成与视频到视频转换 / AIGC 内容生产
配置难度 高。该项目不是普通 Python 应用,而是大规模多模态扩散视频模型部署项目。虽然 Quick Start 步骤相对清晰,但需要 CUDA/PyTorch/Triton/TorchInductor、高显存 GPU、模型权重管理、外部检测器和多组件服务配置经验。适合有深度学习推理部署经验的算法或平台工程师,不太适合初学者直接上手。
商业价值 商业价值较高,尤其适合短视频、直播、电商营销、广告创意、虚拟拍摄和互动内容生产场景。其核心吸引力在于将传统离线视频编辑推进到实时或准实时交互式编辑,可用于构建 AI 视频滤镜、直播换装、背景替换、品牌风格化、商品视频再创作等功能。Apache-2.0 许可证降低了商业原型使用门槛。不过,当前硬件成本、部署复杂度、训练管线未完全开放以及生成内容合规风险,会影响中小团队直接产品化。
01

技术亮点

  • 支持实时开放式视频编辑,可处理直播流或上传视频,不需要完整视频输入
  • 自然语言指令控制能力较丰富,覆盖主体编辑、局部编辑、背景替换、风格迁移、运动变化和参考引导编辑
  • 采用自回归扩散设计,结合 MLLM 条件编码器、因果视频 VAE 和 MMDiT 主干
  • 官方称在 720x1280 分辨率下可达到 30.19 FPS 端到端吞吐,适合探索交互式视频生成
  • 提供在线 Demo、论文、部署代码和模型权重,便于快速体验和研究复现
  • Apache-2.0 许可证对商业原型较友好
  • 使用有界 KV-state 推理、长时序优化和部署调度来降低长视频漂移和推理开销
02

目标用户

  • 视频生成与编辑方向的算法工程师
  • 多模态大模型和扩散模型研究人员
  • AIGC 产品原型开发团队
  • 直播、短视频、电商内容生产平台开发者
  • 需要实时视频特效或风格化能力的工程团队
  • 具备高端 GPU 部署能力的企业研发团队
03

配置要求

  • 操作系统:README 未明确限制,但项目为 Python/CUDA 深度学习部署,通常建议 Linux 环境
  • Python:3.10
  • 依赖安装:requirements.txt
  • GPU:需要 NVIDIA CUDA GPU;模型包含 16B 参数,实际部署大概率需要高端数据中心 GPU 或多 GPU
  • 消费级 GPU:官方 TODO 中提到仍在优化对 GeForce RTX 5090 等消费级 GPU 的支持,说明当前消费级显卡支持可能不成熟
  • 模型权重:需要手动从 Hugging Face 下载并放置到指定目录
  • 额外依赖:MiMo-VL 和 ONNX detector 是外部运行时依赖,需要参考 DEPLOYMENT.md 单独配置
  • 服务配置:可通过 deploy/run_server.sh 配置 checkpoint 路径、CUDA 设备、host、port
  • 性能缓存:默认脚本会设置 TorchInductor、Triton 和 CUDA 持久化缓存目录,以便复用编译产物
  • 网络:如在国内环境下载 Hugging Face 权重,可能需要镜像或代理
04

适用场景

  • 对直播摄像头画面进行实时风格迁移,例如水彩、电影、动漫或特定艺术风格
  • 对上传视频进行自然语言指令编辑,例如更换背景、替换人物服装、修改物体颜色
  • 实时视频特效和互动式视频生成 Demo
  • 电商或营销场景中的商品、模特、背景快速变换
  • 短视频平台中的 AI 视频滤镜、局部对象编辑、主体替换或移除
  • 研究自回归扩散模型在长视频和流式视频编辑中的部署方法
  • 构建参考图引导的视频编辑原型
05

部署与配置

  • 创建 Python 3.10 Conda 环境:conda create -n joyai-video-edit python=3.10 -y
  • 激活环境:conda activate joyai-video-edit
  • 安装依赖:python -m pip install -r requirements.txt
  • 从 Hugging Face 下载 JoyAI-Video-Edit 权重:https://huggingface.co/jdopensource/JoyAI-Video-Edit
  • 将权重放置到 deploy/deps/checkpoints/JoyAI-Video-Edit/,其中 dit/ 下放置 joyai_video_edit_dit_0804.pth,vae/ 下放置 config.json 和 diffusion_pytorch_model.safetensors
  • 准备外部运行时依赖,包括 MiMo-VL 和 ONNX detector 文件,具体参考仓库中的 DEPLOYMENT.md
  • 进入部署目录:cd deploy
  • 启动服务:bash run_server.sh
  • 浏览器访问 http://localhost:8080
  • 如需远程访问,需在 run_server.sh 中将服务绑定到 0.0.0.0,并开放端口或使用 SSH 端口转发
06

风险与注意事项

  • 模型规模达到 16B 参数,硬件门槛高,普通开发者或消费级 GPU 可能难以本地部署
  • README 明确完整训练框架和数据生成流水线尚未开源,二次训练和深度定制受限
  • 消费级 GPU 支持仍在 TODO 中,当前更适合有数据中心级 GPU 的团队
  • 实时 30 FPS 性能是官方部署 benchmark,实际效果依赖 GPU 型号、显存、分辨率、batch、编译缓存和系统环境
  • 外部依赖 MiMo-VL 和 ONNX detector 需要额外配置,部署复杂度较高
  • 生成式视频编辑可能存在时序漂移、局部细节不稳定、身份保持不一致或指令理解偏差
  • 项目发布时间较新,生态、社区问题解答和生产级稳定性仍需观察
  • 国内访问 Hugging Face 可能不稳定,权重下载可能成为落地障碍
  • 用于人物、直播、电商内容时需注意肖像权、版权、内容安全和深度伪造合规风险

历史记录

热榜历史快照

2026-08-11 第9名 新收录 · github_search
2026-08-10 第12名 新收录 · github_search
2026-08-09 第18名 新收录 · github_search