Add files via upload
专为 MiniMax H3 视频模型打造的 ComfyUI 节点包,包含 6 个节点,覆盖二采条件注入、时间分段提示词控制、注意力感受野约束、动态 CFG 调度、低噪细节精修和空间分块采样。
无第三方依赖,仅需 PyTorch。
推荐一个在线一键运行的comfyui平台 中国国内runninghub —- 国际runninghub 丰富的插件和模型,点开即用
原理: 官方 MiniMaxH3ImageToVideo 每次都输出空 AV latent(纯噪声起点),无法用于二采续跑。本节点新增 video_latent 输入:传入一采输出的 latent 时直接透传,并按实际帧数重算关键帧锚点,实现后段采样/高清精修。
MiniMaxH3ImageToVideo
video_latent
二采高清用法: 一采输出 LATENT 接 video_latent,首帧/末帧可选,width/height 自动对齐二采 latent 分辨率。apply_keyframes 设为 disable 可跳过关键帧注入。
width
height
apply_keyframes
disable
clip
vae
prompt
length
first_frame
last_frame
原理: H3 使用打包自注意力(text + cond + audio + video 在同一序列),不存在独立 cross-attention。本节点通过对自注意力矩阵中 video query -> text key 路径施加时间惩罚 mask,实现不同时间段只关注对应 prompt 的效果。
用法: 将官方 prompt 原文复制到 local_prompts,在分段处加 | 分隔符。global_prompt(可选)填入全局风格基调,全程对所有帧可见。支持官方图生视频节点(MiniMaxH3ImageToVideo)及多参版本(MiniMaxH3ImageToVideoMultiParams)。
local_prompts
|
global_prompt
MiniMaxH3ImageToVideoMultiParams
CLIP -> [MiniMaxH3ImageToVideo / MultiParams] -> CONDITIONING ─┐ CLIP ──────────────────────────────────────────────────────────┤ latent ──────────────────────────────────────────────────────> [H3PromptRelay] -> MODEL -> [采样器] ↑ CONDITIONING └─── (透传) ─────────┘
model
conditioning
latent
segment_lengths
epsilon
patch_ratio
原理: 针对全景场景下肢体和面部容易被背景同化或扯碎的问题,通过时空高斯感受野遮罩强行约束模型在中前期去噪时的局部注意力,阻断大面积背景对微小细节的特征同化。
receptive_field_scale
temporal_weight
start_at_sigma
end_at_sigma
num_frames
original_width
original_height
原理: 根据去噪阶段动态调整 CFG 引导强度。高 sigma(早期构图)用低 CFG 保大形,低 sigma(后期细节)用高 CFG 提细节。H3 flow matching 默认 CFG=1.0,动态范围很小,微调即可。
接线: 插在 MODEL 和采样器之间。
cfg_low
cfg_high
原理: 对低 Sigma 区间进行局部加步——保留原始调度的高噪头部不动,从阈值点起把尾部重采样成更长、更平滑的曲线,让模型在细节收尾阶段多走几步,消除高速运动边缘的马赛克与像素紊乱。
接线: 插在调度器和采样器之间。
BasicScheduler -> (sigmas) -> H3 Sigma Refiner -> (sigmas) -> SamplerCustomAdvanced
sigmas
extra_steps
spacing
spacing 曲线:
原理: 768p/2K 高分辨率上采样精修时,H3 DiT 打包自注意力的 token 数远超训练分布,导致显存爆炸或画面质量下降。本节点沿 H 或 W 轴空间分块,每块独立采样后 cosine 窗口融合,严格保持 H3 视频/音频独立模态,音频 passthrough 不参与采样。
接线: 替代 SamplerCustomAdvanced,接入 noise / guider / sampler / sigmas / latent_image。
SamplerCustomAdvanced
适用场景: 二采高清精修(低噪起步),不适用重去噪(纯噪声起点会破坏全局一致性)。
noise
guider
sampler
latent_image
bypass_tiling
tile_axis
n_tiles
tile_overlap
max_size_for_no_tile
target_frames
frame_padding_mode
debug
ComfyUI-YCNodes-MiniMax-H3
ComfyUI/custom_nodes/
H3
一采(低分辨率):
[CLIP] ─────────────────────────────────────────────────────────┐ [图像] -> [MiniMaxH3ImageToVideo / MultiParams] -> COND ────────┤ ├─> [H3PromptRelay] -> MODEL ─┐ [CLIP] ─────────────────────────────────────────────────────────┘ │ ├─> [H3DynamicCFGScheduler] -> MODEL -> [采样器] [BasicScheduler] -> [H3SigmaRefiner] -> SIGMAS ──────────────────────────────────────────────┘
二采(高清精修,Tail 节点续跑,Tiled 采样):
一采LATENT -> video_latent ─┐ [图像] -> [MiniMaxH3ImageToVideoTail] -> COND ─┐ [CLIP] ────────────────────────────────────────┤ ├─> [H3PromptRelay] -> MODEL -> [H3DynamicCFGScheduler] -> MODEL ─┐ LATENT ───────────────────────────────────────────────────────────┤ ├─> [H3TiledSampler] -> LATENT [BasicScheduler] -> [H3SigmaRefiner] -> SIGMAS ────────────────────────────────────────────────────────────────────┘
版权所有:中国计算机学会技术支持:开源发展技术委员会 京ICP备13000930号-9 京公网安备 11010802047560号
ComfyUI-YCNodes-MiniMax-H3
专为 MiniMax H3 视频模型打造的 ComfyUI 节点包,包含 6 个节点,覆盖二采条件注入、时间分段提示词控制、注意力感受野约束、动态 CFG 调度、低噪细节精修和空间分块采样。
无第三方依赖,仅需 PyTorch。
推荐一个在线一键运行的comfyui平台 中国国内runninghub —- 国际runninghub 丰富的插件和模型,点开即用
节点总览
1. MiniMax H3 Image to Video (Tail)(二采条件节点)
原理: 官方
MiniMaxH3ImageToVideo每次都输出空 AV latent(纯噪声起点),无法用于二采续跑。本节点新增video_latent输入:传入一采输出的 latent 时直接透传,并按实际帧数重算关键帧锚点,实现后段采样/高清精修。二采高清用法: 一采输出 LATENT 接
video_latent,首帧/末帧可选,width/height自动对齐二采 latent 分辨率。apply_keyframes设为disable可跳过关键帧注入。clipvaepromptwidthheightlengthfirst_framelast_framevideo_latentapply_keyframes2. H3 Prompt Relay(时间分段提示词控制)
原理: H3 使用打包自注意力(text + cond + audio + video 在同一序列),不存在独立 cross-attention。本节点通过对自注意力矩阵中 video query -> text key 路径施加时间惩罚 mask,实现不同时间段只关注对应 prompt 的效果。
用法: 将官方 prompt 原文复制到
local_prompts,在分段处加|分隔符。global_prompt(可选)填入全局风格基调,全程对所有帧可见。支持官方图生视频节点(MiniMaxH3ImageToVideo)及多参版本(MiniMaxH3ImageToVideoMultiParams)。modelconditioningcliplatentglobal_promptlocal_prompts|分隔segment_lengthsepsilonpatch_ratio3. H3 Distance Attention Patcher(距离注意力约束)
原理: 针对全景场景下肢体和面部容易被背景同化或扯碎的问题,通过时空高斯感受野遮罩强行约束模型在中前期去噪时的局部注意力,阻断大面积背景对微小细节的特征同化。
modelreceptive_field_scaletemporal_weightstart_at_sigmaend_at_sigmanum_framesoriginal_widthoriginal_height4. H3 Dynamic CFG Scheduler(动态 CFG 调度)
原理: 根据去噪阶段动态调整 CFG 引导强度。高 sigma(早期构图)用低 CFG 保大形,低 sigma(后期细节)用高 CFG 提细节。H3 flow matching 默认 CFG=1.0,动态范围很小,微调即可。
接线: 插在 MODEL 和采样器之间。
modelcfg_lowcfg_highstart_at_sigmaend_at_sigma5. H3 Sigma Refiner(低噪细节精修)
原理: 对低 Sigma 区间进行局部加步——保留原始调度的高噪头部不动,从阈值点起把尾部重采样成更长、更平滑的曲线,让模型在细节收尾阶段多走几步,消除高速运动边缘的马赛克与像素紊乱。
接线: 插在调度器和采样器之间。
sigmasextra_stepsstart_at_sigmaend_at_sigmaspacingspacing 曲线:
6. H3 Tiled Sampler(空间分块采样)
原理: 768p/2K 高分辨率上采样精修时,H3 DiT 打包自注意力的 token 数远超训练分布,导致显存爆炸或画面质量下降。本节点沿 H 或 W 轴空间分块,每块独立采样后 cosine 窗口融合,严格保持 H3 视频/音频独立模态,音频 passthrough 不参与采样。
接线: 替代
SamplerCustomAdvanced,接入 noise / guider / sampler / sigmas / latent_image。适用场景: 二采高清精修(低噪起步),不适用重去噪(纯噪声起点会破坏全局一致性)。
noiseguidersamplersigmaslatent_imagebypass_tilingtile_axisn_tilestile_overlapmax_size_for_no_tiletarget_framesframe_padding_modedebug安装
ComfyUI-YCNodes-MiniMax-H3目录放入ComfyUI/custom_nodes/下。H3即可找到全部节点。推荐工作流接线
一采(低分辨率):
二采(高清精修,Tail 节点续跑,Tiled 采样):