Add MIT License
English · 中文
Minimax H3 视频生成专用 Latent 神经网络放大节点 学习型 · 高保真 · 2D 与 3D 双版本
MMH3 Temporal Split Params
MMH3 Spatial Split Params
MMH3 Split Upscale
seam_denoise
soft_empty_cache
.contiguous()
force_unload
enable_chunking
enable_temporal_chunking
target dimensions
megapixels
rocm
align
scale by multiplier
fp32
fp16
bf16
一个 ComfyUI 自定义节点,用训练好的神经网络(而非简单插值)对 Minimax H3 的 VAE latent (24 通道)进行放大。它的主要目的是加速高分辨率视频的生成,并提升画质:
同时,它避免了直接对 latent 插值(双线性/双三次)带来的鬼影、重影问题,作用类似于 LTX2.3 中的 latent 放大模型。
⚠️ 它节省的是时间,不是显存 —— 精修阶段仍在目标分辨率下运行,峰值显存与直接高清生成接近, 收益纯粹是更快出片。
提供两个节点变体,均注册在 video/MinimaxH3 分类下:
video/MinimaxH3
scale
width
height
1.2
3D 节点在尺寸模式下会在内部计算出等效 scale 并喂给同一个训练好的模型,因此 1.0×–4.0× 之间 任意目标都能用。
两个节点均只支持放大(等效 scale >= 1.0)。scale = 1.0 返回输入原样;等效倍率小于 1.0 会报错。
scale >= 1.0
scale = 1.0
来源: 该组合是在 Comfyui-MMH3-UltimateUpscale 项目基础上拆解优化而来。原本的单节点被拆成三个可组合节点(时间切分 / 空间切分 / 主放大), 并在原有分块逻辑之上,针对拼接稳定性、色彩一致性、时间连续性、易用性与轻量化做了系统性增强。
一套独立的三节点组合,在扩散采样器内部做分块式「高清重采样」放大(而非用预训练放大网络)。 它接收 H3 的 AV latent(嵌套:视频 24 通道 + 音频 32 通道),沿时间切块、沿空间分块, 对每一块单独跑采样器,再用缝降噪、两级颜色匹配与时间锚点把结果无缝拼接回去,避免出现接缝和鬼影。 两个 * Split Params 节点负责配置切分方式,并喂给主节点 MMH3 Split Upscale(两者均可选—— 不连接即为整段/整帧单次处理)。它需要 model + conditioning + sampler/sigmas,即会在更高 分辨率上重新跑一遍采样。
* Split Params
model
conditioning
sampler
sigmas
相比原版主要增强(拆解优化点):
seam_polish
grade_pin
frame-0 锚
motion 锚
identity 锚
negative
新增 / 优化的模块(相对于原项目):
overlap
fade
视频放大对比
图像放大对比
Comfyui_Minimax_h3_latent_Upscaler/ ├── examples/ │ ├── Minimax_h3_latent_Upscaler_001.mp4 │ └── Minimax_h3_latent_Upscaler_002.jpg ├── workflow_templates/ │ └── minimax_h3_r2v_Latent Upscaler example workflow.json # ComfyUI 模板示例工作流 ├── nodes/ │ ├── __init__.py # 合并 2D/3D/组合节点映射 │ ├── minimax_h3_latent_upscaler_2d.py # 2D 主干 + Temporal 3D Conv(倍数模式) │ ├── minimax_h3_latent_upscaler_3d.py # 纯 3D 卷积,支持 3 种缩放模式 │ └── MMH3_Split_Upscale.py # MMH3 Split Upscale 组合(基于 Comfyui-MMH3-UltimateUpscale 拆解优化) ├── README.md ├── README_zh.md └── __init__.py
模型权重不随仓库提供,请按下方「模型放置」说明放入 ComfyUI 模型目录。
.safetensors
.pth
upscaler.
cuda
cpu
推理时强制关闭注意力(attn=False)以提升速度与稳定性;已加载模型按 (名称, 设备, 精度) 缓存,重复调用开销很低。
attn=False
(名称, 设备, 精度)
将仓库克隆到 ComfyUI 的 custom_nodes 文件夹:
custom_nodes
cd ComfyUI/custom_nodes git clone https://github.com/LBH-123-AI/Comfyui_Minimax_h3_latent_Upscaler.git
所需依赖(torch、einops、safetensors)在标准 ComfyUI 环境中已自带,无需额外安装。
torch
einops
safetensors
重启 ComfyUI。
节点从这里扫描并加载权重:
ComfyUI/models/latent_upscale_models/
把你的 Minimax H3 latent 放大模型权重(.safetensors 或 .pth)放进该目录,节点下拉框会自动列出。
预训练权重可在此下载: huggingface.co/LBH-123-AI/Minimax_h3_latent_Upscaler
加载器会自动识别结构,只要权重存储的结构匹配,2D 与 3D 节点可共用同一份权重。
从 video/MinimaxH3 菜单中添加所需节点,连入一个 LATENT,选择模型、设置缩放模式/参数,再解码即可。
LATENT
典型流程:
[Minimax H3 Latent] → [H3 Latent Upscaler] → [VAE 解码]
[低清 Latent] → [H3 Latent Upscaler] → [二次采样重绘/精修] → [VAE 解码]
相比「[Latent] → [VAE 解码] → [像素放大] → [VAE 编码] → …」这种朴素做法,直接在 latent 空间 放大跳过了昂贵的 VAE 解码/编码往返。Minimax H3 的约 5B 参数 VAE 让解码与再编码都明显偏慢,时间 主要就省在这里。同时也避免了直接对 latent 插值(双线性/双三次)造成的鬼影 / 重影问题。
⚠️ 省时间,不省显存: 精修仍在目标分辨率下运行,峰值显存与直接高清生成接近,收益纯粹是更快出片。
latent
model_name
latent_upscale_models/
device
precision
输出: LATENT — 放大后的 latent,可直接送 VAE 解码。
mode
输出: LATENT — 放大后的 latent。
选哪个节点? 帧间已较稳定、求快时选 2D;需要更强运动/时间一致性,或想直接按目标 像素/百万像素出图,选 3D。
一套分块式「高清重采样」的 H3 视频放大方案,在 Comfyui-MMH3-UltimateUpscale 项目基础上拆解优化而来。和 2D/3D 节点(用预训练放大网络)不同,这套组合会在 latent 的更高分辨率版本上重跑扩散采样器,并切块以适配显存。它操作的是 H3 的 AV latent (嵌套:视频 24 通道 + 音频 32 通道),需要 model + conditioning + sampler/sigmas。
MMH3 Temporal Split Params — 沿时间怎么切(对齐 H3 原生的 5+17·m 帧/token 网格):
chunk_frames
temporal_overlap_frames
anchor_strength
motion_anchor_frames
identity_anchor_frames
输出:temporal_split_param(自定义类型,喂给主节点)。
temporal_split_param
MMH3 Spatial Split Params — 每帧怎么切瓦片:
tile_width
tile_height
overlap_ratio
fade_ratio
min_tile_size
输出:spatial_split_param(自定义类型)+ grid_preview(字符串,显示计算出的瓦片/重叠网格)。
spatial_split_param
grid_preview
MMH3 Split Upscale — 主调度节点:
noise
cfg
color_match
输出: LATENT — 放大后的 H3 AV latent,可直接送 VAE 解码。
注意: 两个 * Split Params 节点都可不接(即为整段/整帧单次处理,不做时间/空间切分)。 该组合会在更高分辨率上重跑采样器,因此以额外算力换取长视频 / 高分辨率下的显存余量。
in_channels=24
in_blocks=12
out_blocks=12
base_channels=512
dropout=0.1
temporal_every=2
temporal_kernel=5
该放大模型在近 8 万对样本上训练(低分辨率 latent 与高分辨率目标配对),并在数据类型与缩放倍数上做了均衡,以提升泛化能力。
按数据类型:
按缩放倍数(占比,约):
重点放在 2×(40%),对应最常见的实际使用场景;而 1–4 之间的任意小数位占 10% 这一设计, 是为了避免模型只对固定的 1.5×/2×/2.5×/3×/4× 几个档位过拟合,从而能在推理时处理 1.0×–4.0× 区间内 任意连续 scale 值。
本节点沿用了 Ttl 提出的「神经网络 latent 放大」思路 (ComfyUi_NNLatentUpscale, https://github.com/Ttl)。本项目模型架构同时参考借鉴了 LTX 2.3 Spatial Upscaler (ltx-2.3-spatial-upscaler-x2-1.1.safetensors)。感谢这些开源工作为本项目奠定基础。
ltx-2.3-spatial-upscaler-x2-1.1.safetensors
版权所有:中国计算机学会技术支持:开源发展技术委员会 京ICP备13000930号-9 京公网安备 11010802047560号
English · 中文
ComfyUI Minimax H3 Latent Upscaler
Minimax H3 视频生成专用 Latent 神经网络放大节点 学习型 · 高保真 · 2D 与 3D 双版本
📰 更新动态
MMH3 Temporal Split Params、MMH3 Spatial Split Params、MMH3 Split Upscale),对 H3 视频做分块式「高清重采样」放大。该组合是在 Comfyui-MMH3-UltimateUpscale 项目基础上拆解优化而来——把 AV latent 沿时间切块、沿空间分块,逐块重采样后再无缝拼接;相比原版主要增强:更稳的拼接(seam_denoise+ probe 门控二道缝修补)、颜色零漂移(空间+时间两级颜色匹配 + 首块/每 chunk 钉源)、三重时间锚(frame-0 / motion / identity)、更易用(空间参数简化为重叠率/渐变率百分比并自动吸附网格)、更轻量(移除内置放大模型,改接外部预放大 latent)。soft_empty_cache与显式.contiguous(),降低加载与推理期间的显存/内存峰值;推理后卸载到 CPU 改为可选开关force_unload(默认开启);enable_chunking更名为enable_temporal_chunking,分块有效帧数由 24 提升至 32;模型文件现可放入子目录(PR #30);target dimensions与megapixels上限分别放宽到 8192 像素与 16 MP。enable_chunking开关(短片段可关闭,使用全上下文推理);修复时间分块边缘伪影——采用 Replicate Padding 与重叠区域加权融合,消除末尾帧闪烁;新增 ROCm(AMD 显卡)后端支持,设备选项新增rocm。align网格(默认 32),修复底部光带问题;归一化/反归一化由原地操作改为标准运算,保留时间分块以支持长视频。scale by multiplier、target dimensions、megapixels)合并进单一节点;修复特定模式下造成的比例不统一,修复各类特定尺寸造成的边缘伪影;新增示例工作流供参考。fp32/fp16/bf16推理。一个 ComfyUI 自定义节点,用训练好的神经网络(而非简单插值)对 Minimax H3 的 VAE latent (24 通道)进行放大。它的主要目的是加速高分辨率视频的生成,并提升画质:
同时,它避免了直接对 latent 插值(双线性/双三次)带来的鬼影、重影问题,作用类似于 LTX2.3 中的 latent 放大模型。
⚠️ 它节省的是时间,不是显存 —— 精修阶段仍在目标分辨率下运行,峰值显存与直接高清生成接近, 收益纯粹是更快出片。
提供两个节点变体,均注册在
video/MinimaxH3分类下:scale倍数(1.0×–4.0×)。scale by multiplier:经典scale倍数(1.0×–4.0×)。target dimensions:直接填目标像素width/height。megapixels:填目标总像素(百万像素,例如1.2),保持原宽高比。target dimensions与megapixels两种模式会按可配置的像素网格对齐输出,并自动反推等效倍率。MMH3 Split Upscale(组合节点)
一套独立的三节点组合,在扩散采样器内部做分块式「高清重采样」放大(而非用预训练放大网络)。 它接收 H3 的 AV latent(嵌套:视频 24 通道 + 音频 32 通道),沿时间切块、沿空间分块, 对每一块单独跑采样器,再用缝降噪、两级颜色匹配与时间锚点把结果无缝拼接回去,避免出现接缝和鬼影。 两个
* Split Params节点负责配置切分方式,并喂给主节点MMH3 Split Upscale(两者均可选—— 不连接即为整段/整帧单次处理)。它需要model+conditioning+sampler/sigmas,即会在更高 分辨率上重新跑一遍采样。相比原版主要增强(拆解优化点):
seam_denoise)+ probe 门控的二道缝修补(seam_polish),消除接缝与鬼影;在高降噪 + 快速运动下,运动物体也不再被切断(”断肢”)。grade_pin),彻底解决块间闪烁、左上角发青等问题。frame-0 锚+motion 锚+identity 锚三重时间锚,高降噪时自动兜底身份一致性,人物不漂移。negative紧跟conditioning布局,连线更直观。新增 / 优化的模块(相对于原项目):
grade_pin)——保证各瓦片、各时间块之间的色彩与亮度一致,杜绝块间闪烁与局部发青。seam_denoise上限——在高降噪 + 快速运动下,缝邻域以中等降噪续写邻居内容,防止运动物体被切断(”断肢”);配合 probe 门控的二道缝修补,接缝与鬼影一并消除(建议 0.5–0.8;1.0 = 关闭)。seam_polish)——每个瓦片获得正确作用域的条件/关键帧,去缝门控不再过度或不足。overlap/fade改为百分比参数(重叠率 / 渐变率,与分辨率无关),替代原来的绝对像素值,并自动吸附 latent 网格;negative紧跟conditioning,布局更直观。📸 示例
视频放大对比
图像放大对比
📁 项目结构
🚀 核心特性
scale by multiplier/target dimensions/megapixels,均带像素网格对齐与宽高比锁定。.safetensors与.pth;自动 FP8→FP16;兼容合并权重中的upscaler.前缀。cuda/cpu与 fp32/fp16/bf16 选项。推理时强制关闭注意力(
attn=False)以提升速度与稳定性;已加载模型按(名称, 设备, 精度)缓存,重复调用开销很低。📦 安装
将仓库克隆到 ComfyUI 的
custom_nodes文件夹:所需依赖(
torch、einops、safetensors)在标准 ComfyUI 环境中已自带,无需额外安装。重启 ComfyUI。
🤖 模型放置
节点从这里扫描并加载权重:
把你的 Minimax H3 latent 放大模型权重(
.safetensors或.pth)放进该目录,节点下拉框会自动列出。预训练权重可在此下载: huggingface.co/LBH-123-AI/Minimax_h3_latent_Upscaler
加载器会自动识别结构,只要权重存储的结构匹配,2D 与 3D 节点可共用同一份权重。
🧩 使用方法
从
video/MinimaxH3菜单中添加所需节点,连入一个LATENT,选择模型、设置缩放模式/参数,再解码即可。典型流程:
[Minimax H3 Latent] → [H3 Latent Upscaler] → [VAE 解码][低清 Latent] → [H3 Latent Upscaler] → [二次采样重绘/精修] → [VAE 解码]相比「[Latent] → [VAE 解码] → [像素放大] → [VAE 编码] → …」这种朴素做法,直接在 latent 空间 放大跳过了昂贵的 VAE 解码/编码往返。Minimax H3 的约 5B 参数 VAE 让解码与再编码都明显偏慢,时间 主要就省在这里。同时也避免了直接对 latent 插值(双线性/双三次)造成的鬼影 / 重影问题。
⚠️ 省时间,不省显存: 精修仍在目标分辨率下运行,峰值显存与直接高清生成接近,收益纯粹是更快出片。
节点参数 — 2D
latentmodel_namelatent_upscale_models/中的模型scaledeviceprecision输出:
LATENT— 放大后的 latent,可直接送 VAE 解码。节点参数 — 3D
latentmodel_namelatent_upscale_models/中的模型modescale by multiplierscale by multiplier/target dimensions/megapixelsscalemode为scale by multiplier时使用widthtarget dimensions使用)heighttarget dimensions使用)megapixelsmegapixels使用),保持宽高比alignenable_temporal_chunkingforce_unloaddeviceprecision输出:
LATENT— 放大后的 latent。节点参数 — MMH3 Split Upscale(组合)
一套分块式「高清重采样」的 H3 视频放大方案,在 Comfyui-MMH3-UltimateUpscale 项目基础上拆解优化而来。和 2D/3D 节点(用预训练放大网络)不同,这套组合会在 latent 的更高分辨率版本上重跑扩散采样器,并切块以适配显存。它操作的是 H3 的 AV latent (嵌套:视频 24 通道 + 音频 32 通道),需要
model+conditioning+sampler/sigmas。MMH3 Temporal Split Params— 沿时间怎么切(对齐 H3 原生的 5+17·m 帧/token 网格):chunk_framestemporal_overlap_framesanchor_strengthmotion_anchor_framesidentity_anchor_frames输出:
temporal_split_param(自定义类型,喂给主节点)。MMH3 Spatial Split Params— 每帧怎么切瓦片:tile_widthtile_heightoverlap_ratiofade_ratiomin_tile_sizeseam_denoise输出:
spatial_split_param(自定义类型)+grid_preview(字符串,显示计算出的瓦片/重叠网格)。MMH3 Split Upscale— 主调度节点:modelconditioningnegativelatentnoisesamplersigmascfgtemporal_split_paramMMH3 Temporal Split Paramsspatial_split_paramMMH3 Spatial Split Paramsseam_polishcolor_match输出:
LATENT— 放大后的 H3 AV latent,可直接送 VAE 解码。🧪 模型与架构
in_channels=24、in_blocks=12、out_blocks=12、base_channels=512、dropout=0.1、temporal_every=2、temporal_kernel=5、attn=False。📊 训练数据
该放大模型在近 8 万对样本上训练(低分辨率 latent 与高分辨率目标配对),并在数据类型与缩放倍数上做了均衡,以提升泛化能力。
按数据类型:
按缩放倍数(占比,约):
重点放在 2×(40%),对应最常见的实际使用场景;而 1–4 之间的任意小数位占 10% 这一设计, 是为了避免模型只对固定的 1.5×/2×/2.5×/3×/4× 几个档位过拟合,从而能在推理时处理 1.0×–4.0× 区间内 任意连续
scale值。🙏 致谢
本节点沿用了 Ttl 提出的「神经网络 latent 放大」思路 (ComfyUi_NNLatentUpscale, https://github.com/Ttl)。本项目模型架构同时参考借鉴了 LTX 2.3 Spatial Upscaler (
ltx-2.3-spatial-upscaler-x2-1.1.safetensors)。感谢这些开源工作为本项目奠定基础。