这是一个面向 ComfyUI 的 Minimax H3 视频生成自定义节点,用神经网络直接放大 24 通道 Minimax H3 VAE latent,避免“VAE 解码 → 像素放大 → VAE 编码”的高成本流程。它提供 2D 与 3D 两类 latent upscaler:2D 更快,3D 更注重时间一致性,并支持按倍率、目标宽高或目标像素量进行放大。项目主要价值在于加速高分辨率 Minimax H3 视频生成流程,并减少普通 latent 插值带来的重影、双影等伪影。
适用领域
AIGC / 视频生成 / ComfyUI 插件 / Latent Upscaling / Minimax H3 / 深度学习推理 / 高分辨率视频工作流优化
配置难度
中等。对于熟悉 ComfyUI 自定义节点安装的用户,部署较简单;但要正确接入 Minimax H3 工作流、选择 2D/3D 节点、设置 scale/width/height/megapixels、处理显存和精度,需要一定 ComfyUI 视频生成经验。开发者如需改模型结构或调试 latent 格式,则难度较高。
商业价值
对以 Minimax H3 生成高分辨率视频的团队或个人有较高实用价值。它可以减少高分辨率视频生成中的等待时间,提高迭代效率,尤其适合批量出片、商业短视频、广告素材、动画预览和 AIGC 内容生产流水线。不过它不降低最终高分辨率 refine 的显存门槛,也存在未声明许可证的问题,因此商业落地前应重点确认权重和代码许可。
01
技术亮点
- 直接在 Minimax H3 latent 空间放大,跳过昂贵的 VAE 解码和重新编码
- 针对 24 通道 Minimax H3 latent 训练,使用训练时的 per-channel mean/std 归一化
- 相比 bilinear 或 bicubic latent 插值,能减少重影和双图像伪影
- 同时提供 2D 快速版本和 3D 时间一致性更强的版本
- 3D 节点支持倍率、目标宽高、目标 megapixels 三种输出尺寸控制方式
- 支持 CUDA、CPU,3D 节点还支持 ROCm
- 支持 fp32、fp16、bf16 推理精度选择
- 权重加载器支持 safetensors 和 pth,并可自动检测网络结构
- 模型按 name、device、precision 缓存,重复运行成本较低
- 训练数据规模约 8 万对样本,以视频片段为主,并覆盖 1x 到 4x 的多种放大倍率
02
目标用户
- 使用 ComfyUI 进行 Minimax H3 视频生成的创作者
- 需要优化高分辨率视频生成耗时的 AIGC 工作流开发者
- ComfyUI 自定义节点使用者和插件开发者
- 有 CUDA 或 ROCm GPU 环境的本地 AI 绘图/视频用户
- 研究 latent-space upscaling 或视频时序一致性的开发者
03
配置要求
- 需要 ComfyUI 运行环境
- 需要 Minimax H3 相关视频生成工作流和 24 通道 H3 latent 输入
- 模型权重不包含在仓库内,需要单独下载并放置到 ComfyUI/models/latent_upscale_models/
- 支持 .safetensors 和 .pth 权重格式
- 2D 节点支持 cuda 或 cpu;3D 节点支持 cuda、rocm 或 cpu
- ROCm 需要安装支持 HIP 的 PyTorch
- 推理精度支持 fp32、fp16、bf16
- 放大比例范围为 1.0x 到 4.0x,不支持低于 1.0x 的缩小
- 3D 节点可配置 align 对齐网格,默认 32,用于输出宽高对齐
- 长视频建议启用 enable_chunking 以降低显存压力;短视频可关闭以使用完整上下文推理
04
适用场景
- 先生成低分辨率 Minimax H3 latent,再放大 latent,最后进行高分辨率 refine 或 re-sample,从而缩短整体生成时间
- 替代传统的 VAE Decode → Pixel Upscale → VAE Encode 流程,减少 Minimax H3 大型 VAE 带来的额外耗时
- 提升低分辨率视频 latent 的空间分辨率,同时尽量保持视频时间一致性
- 在 ComfyUI 工作流中快速预览更高分辨率结果
- 使用 3D 节点按目标宽高或 megapixels 自动计算放大比例,方便固定输出规格的视频生成
05
部署与配置
- 进入 ComfyUI 的 custom_nodes 目录:cd ComfyUI/custom_nodes
- 克隆仓库:git clone https://github.com/LBH-123-AI/Comfyui_Minimax_h3_latent_Upscaler.git
- 确认 ComfyUI 环境中已有 torch、einops、safetensors,标准 ComfyUI 环境通常无需额外安装
- 从 Hugging Face 下载预训练权重:https://huggingface.co/LBH-123-AI/Minimax_h3_latent_Upscaler
- 将 .safetensors 或 .pth 权重文件放入 ComfyUI/models/latent_upscale_models/ 目录
- 重启 ComfyUI
- 在 ComfyUI 节点菜单 video/MinimaxH3 下添加 2D 或 3D Latent Upscaler 节点,并在 model_name 下拉框中选择权重
06
风险与注意事项
- 仓库未声明 license,商业使用和二次分发存在法律不确定性
- 模型权重不随仓库提供,需要额外从 Hugging Face 下载,部署时需确认权重许可和可用性
- 该节点节省的是时间而不是峰值显存;refine 阶段仍在目标分辨率运行,显存需求接近直接高分辨率生成
- 仅适用于 Minimax H3 24 通道 latent,不适合通用 Stable Diffusion、FLUX 或其他 VAE latent
- 3D 节点计算和显存开销更高,长视频或高分辨率下可能仍然吃紧
- 如果输入 latent 格式、通道数或模型权重结构不匹配,可能无法正确运行
- 项目较新,stars 约 291、forks 约 16,生态和长期维护稳定性仍需观察
- README 中部分更新日期显示为 2026 年,可能来自未来日期或维护者记录习惯,需以实际提交记录为准
2026-08-24
第29名
新收录 · github_search