ComfyUI-MiniMaxH3-Easy 是一个面向 ComfyUI 的 MiniMax H3 视频生成工作流扩展,目标是把 T2V 文生视频、I2V 图生视频、首尾帧生成、参考视频生成等能力整合到一个更紧凑的主节点中。它通过统一的多媒体 Media 输入口、@ 媒体引用、结构化对白块、Prompt 优化器和模式化参数面板,减少 ComfyUI 工作流连线复杂度,同时保留与采样器、LoRA、注意力补丁、解码、视频组装和保存节点等 ComfyUI 生态组件的兼容性。
适用领域
AI 视频生成 / ComfyUI 自定义节点 / MiniMax H3 工作流 / 文生视频 T2V / 图生视频 I2V / 参考视频生成 / 多模态 Prompt 编辑 / 创意内容生产 / AIGC 工具链
配置难度
中高。对于已经熟悉 ComfyUI 自定义节点、模型目录、采样器和 VAE 工作流的用户,上手难度中等;对于新手,MiniMax H3 模型准备、GGUF 兼容、显存管理、Reference Video 媒体规则以及 Prompt 优化 API 配置会带来较高学习成本。
商业价值
该项目的商业价值主要体现在提升 MiniMax H3 在 ComfyUI 中的可用性和生产效率。它将复杂的视频生成输入、引用、对白和 Prompt 优化整合到统一节点中,可减少工作流搭建和维护成本,适合短视频生产、广告创意、产品展示、动画分镜、音乐视频和品牌内容制作等场景。MIT 许可证降低了企业内部定制和二次开发门槛,但实际商用仍需重点评估 MiniMax H3 模型授权、第三方 API 数据合规、素材隐私和 GPU 成本。
01
技术亮点
- 单一 Media 输入口可同时接入图片、视频和独立音频,减少传统 ComfyUI 节点大量固定输入口造成的复杂连线。
- 不同媒体类型独立编号,并保留工作流保存和加载时的链接顺序。
- 支持从 Media 端口拖拽到空白画布快速创建兼容媒体加载节点。
- Reference Video 模式下支持 @ 选择已连接媒体,并在运行时自动转换为 MiniMax H3 标签。
- 断开的 @ 引用不会被静默删除,方便用户发现并手动修复失效引用。
- 支持结构化 Dialogue Block,对话块序列化为 <d>...</d>,适合对白、歌词、字幕类视频生成。
- 提供结构化编辑器与原始 Prompt 视图切换,既方便可视化编辑,也能查看真实运行文本。
- 支持外部 STRING 输入,便于与自动化 Prompt 生成、批处理或其他 ComfyUI 节点集成。
- 内置 Prompt 优化器,支持 OpenAI 兼容接口、OpenAI Responses 和 Gemini Native,并能根据不同 H3 模式加载对应 Prompt Guide。
- Prompt 优化器支持读取连接媒体,并显式要求模型不要编造媒体内容。
- Loader 可按需加载 Transformer,并在模式切换时释放缓存,有助于控制显存占用。
- Model Bridge 允许使用原生、社区或 GGUF Loader 输出组装 H3 Bundle,兼容性较好。
- 高级选项按模式显示,减少无关参数干扰。
- MIT 许可证,便于个人和商业项目二次开发或集成。
02
目标用户
- 使用 ComfyUI 进行视频生成的创作者
- 希望使用 MiniMax H3 本地模型的 AIGC 用户
- 需要降低复杂工作流连线成本的 ComfyUI 用户
- 制作短视频、广告片、产品展示、MV、动画短片的内容团队
- 需要参考图片、视频、音频进行多模态视频生成的开发者
- 熟悉模型文件管理、显存优化和 ComfyUI 插件安装的高级用户
03
配置要求
- 需要已安装并可运行的 ComfyUI 环境。
- 需要 MiniMax H3 相关模型文件,包括 FL2VA Transformer、Ref2VA Transformer、Qwen3-VL 文本编码器、视频 VAE、音频 VAE 等,具体文件名支持常见社区命名和量化变体。
- 至少需要配置一个 Transformer,FL2VA 或 Ref2VA 可以其中一个为 None;如果两个都配置,则文本、图像、关键帧模式优先 FL2VA,完整参考生成优先 Ref2VA。
- 模型应放在 ComfyUI 标准模型目录中:diffusion_models、text_encoders、vae。
- 如使用 GGUF 模型,需安装 ComfyUI-GGUF。
- Prompt 优化功能可选,需要配置 API 格式、API URL、API Key、模型名,可支持 OpenAI Compatible Chat Completions、OpenAI Responses、Gemini Native generateContent。
- Prompt 优化配置会保存到 ComfyUI/custom_nodes/ComfyUI-MiniMaxH3-Easy/prompt_optimizer.json,该文件包含明文 API Key,不应提交、发布或打包。
- Reference Video 模式限制最多 9 张图片、3 个视频、3 个独立音频,可见媒体链接总数最多 15 个;至少需要 1 张图片或 1 个视频,不支持纯音频参考。
- I2V 或 First/Last Frame 模式最多 2 张图片,不接受视频和音频输入。
- 连接媒体用于 Prompt 优化时,本地可解析文件单个最大 32 MiB;Gemini Native 支持图像、视频和音频,OpenAI 兼容接口目前主要附加图像。
04
适用场景
- 通过文本直接生成短视频
- 使用一张图片生成视频,支持首帧或尾帧控制
- 使用两张图片进行首尾帧视频生成
- 在 Reference Video 模式下引用多张图片、多个视频和独立音频生成参考驱动视频
- 在 Prompt 中通过 @ 引用已连接媒体,自动转换为 MiniMax H3 所需的 <Picture N>、<Video N>、<Audio N> 标签
- 通过结构化对白块编写带有 <d>...</d> 的对话或歌词内容
- 连接外部 STRING 节点动态输入 Prompt
- 使用 OpenAI 兼容接口、OpenAI Responses 或 Gemini Native API 优化 MiniMax H3 Prompt
- 搭配 LoRA、采样器、加速器、VAE 解码和视频保存节点构建完整 ComfyUI 视频生成流程
- 在不同 MiniMax H3 Transformer 模型之间按模式自动切换以节省显存
05
部署与配置
- 进入 ComfyUI 的 custom_nodes 目录。
- 将仓库克隆或下载到 ComfyUI/custom_nodes/ComfyUI-MiniMaxH3-Easy。
- 将 MiniMax H3 相关模型放入标准目录:ComfyUI/models/diffusion_models/、ComfyUI/models/text_encoders/、ComfyUI/models/vae/。
- 如果使用 .gguf 格式的 Transformer 或文本编码器,需要额外安装 ComfyUI-GGUF。
- 重启 ComfyUI 以加载 Python 后端节点。
- 如果只是更新前端文件,通常刷新浏览器即可。
- 在 ComfyUI 中添加 MiniMax H3 Easy Loader、MiniMax H3 Easy、MiniMax H3 Easy Output 等节点并连接采样、解码、保存等常规节点。
06
风险与注意事项
- 项目依赖 MiniMax H3 模型文件,模型体积、获取方式、授权和显存需求可能成为实际使用门槛。
- README 中强调 API Key 会以明文保存到 prompt_optimizer.json,存在误提交或泄露风险。
- Prompt 优化依赖外部 API,可能产生费用、延迟、失败、超时或隐私合规问题。
- 连接媒体读取功能会把本地图片、视频或音频发送给第三方模型服务,商业或敏感素材需谨慎使用。
- Reference Video 模式对媒体数量、类型和引用关系有较多规则,复杂工作流中用户需要自行维护失效引用。
- 高分辨率、多参考图片、长时长或高 FPS 生成会显著增加显存和计算压力。
- Transformer 按模式切换虽然有助于显存管理,但可能带来加载等待时间。
- 如果同时通过上游节点加载 FL2VA 和 Ref2VA,两个模型可能同时驻留内存,低显存设备容易 OOM。
- 插件包含前端交互增强逻辑,与 ComfyUI 版本变化或其他前端插件可能存在兼容性风险。
- 仓库星标约 273,属于有一定关注度但仍需验证长期维护稳定性的社区项目。
2026-08-12
第29名
新收录 · github_search