一体化音频模式优化
RH Vibex主页 · 在线运行AI应用
MiniMax H3 的独立 ComfyUI 一体化集成节点,支持文本生视频、首尾帧、全能参考和音视频混合条件构建。节点会自动识别素材组合、生成官方媒体标签,自动优化提示词,支持本地模型优化与在线API优化。
An independent ComfyUI integration node for MiniMax H3 conditioning.
The diffusion model remains an external input in the downstream sampler. This package bundles the T8 conditioning implementation.
根据上传的素材智能判定任务类型,负责收集图片、视频、音频和提示词,加载 H3 所需的 CLIP/VAE,并输出供后续采样器使用的 AV(Audio-Video)混合潜空间条件,支持原声音轨输出。
扩散模型本身仍由下游采样器执行。本仓库内置了 T8 风格的条件构建逻辑。
MiniMax-H3 智能一体化(GH)
主节点,负责:
前端支持拖放/上传图片、视频和音频;首尾帧模式与全能参考模式可以分别保存提示词和素材状态,切换模式不会丢失另一模式的内容。
主节点默认画幅为“自适应”,会优先根据当前模式下第一个有效视觉素材的宽高比计算目标画布;没有视觉素材时使用 16:9。用户也可以手动选择常用固定比例和目标百万像素。
素材区还支持:
MiniMax-H3 适配器(GH)
接收主节点的 MiniMax 输出,并拆分为下游工作流需要的端口:
MiniMax
positive
av_latent
适配器还会输出“原始音频”(内部端口名为 mux_audio),可连接到 VHS_VideoCombine.audio。
mux_audio
VHS_VideoCombine.audio
适配器输出的“原始音频”可直接连 VHS_VideoCombine 的音频输入,保证原始音质不变。
VHS_VideoCombine
前端模式名为 text_keyframes,根据上传情况自动解析任务类型:
text_keyframes
<Picture 1>
Picture 1
Picture 2
hybrid_audio
首帧和尾帧素材点击后会自动将官方格式标签插入提示词。切换任务类型、上传或删除素材时,已有媒体标签也会自动统一为当前任务所需的带尖括号或不带尖括号格式。标签编号是否仍对应现有素材由“严格提示词标签”选项控制。
首尾帧模式中的 hybrid_audio 是专用参考音频。上传后默认将音频模式切换为“锁定源音频”,移除后恢复为“自动生成”;用户可以在高级选项中手动覆盖。
前端模式名为 all_reference,用于 Ref2VA/Hybrid 参考素材工作流,支持:
all_reference
独立音频支持 MP3、WAV、FLAC、M4A/AAC、OGG/Opus、WMA、AIFF 等常见格式。节点会先使用 ComfyUI 默认解码器;遇到兼容性较差的编码或容器时,自动通过 FFmpeg 转为 PCM 音频后继续处理。
全能参考模式会按视频音轨和独立音频的顺序生成音频序号,可在高级选项中选择驱动音频。参考媒体标签使用官方尖括号格式,例如 <Picture 1>、<Video 1>、<Audio 2>。
<Video 1>
<Audio 2>
单击已上传素材会插入对应标签;双击视频会插入该视频音轨的音频标签。视频卡片右上角静音后,该视频音频不会传入参考条件。
标签格式会根据当前任务类型自动统一:
<Audio 1>
当“严格提示词标签”开启时,引用不存在的素材编号会停止执行并报错提示:
当前提示词引用了不存在的素材标签,请引用正确的标签后重试
关闭后不会因编号不存在而中断,但仍会进行标签格式规范化。
native
reference_only
lock_source
remix_source
没有可用驱动音频时,节点会自动回退为“自动生成”,避免将空音频传入后端。
MiniMax-H3 智能一体化(GH) ↓ MiniMax MiniMax-H3 适配器(GH) ├─ positive → BasicGuider / 条件输入 ├─ av_latent → 采样器 latent_image 或 H3 音频潜空间控制节点 ├─ video_vae / audio_vae → H3 AV 解码节点 └─ 原始音频(mux_audio)→ VHS_VideoCombine.audio └─ 模型序号(models munber)→ int整数,全能参考时输出1,非全能参考输出0
picture 1
image1
图像1
视频1
音频1
<Subject 1>
[Shot 1]
[场景1]
<d>
[Chinese]
subject_definitions:
summary:
retention_analysis:
detailed_description:
overall_soundscape:
ComfyUI/models/llm
mmproj
web/audio/done.mp3
2089252473927196673
2090668262521675778
reasoning_content
4096
512
8192
max_Token
<Picture N>
<Video N>
<Audio N>
picture1
image 1
图1
图 1
(S1)
(S20)
(S2)
<d>[Chinese]中文台词</d>
MiniMax-H3 双时钟-T8(GH)
基于 T8 双时钟设计实现的独立 H3 音视频采样配置节点,不依赖安装 T8 节点包。主要解决0.32.0以上版本comfyui口型对不上或报错问题。
MiniMax-H3解码-T8(GH)
独立的 H3 音视频潜空间解码节点,不依赖安装 T8 节点包。主要解决性能开销与开头破音的问题。
Minimax H3 Latent Upscaler (GH)
独立的 AV latent 放大节点:自动分离音频,仅放大视频 latent 后重新合并;支持整幅优先、显存不足时自动空间分块、FP16/BF16/FP32、目标尺寸/倍率/百万像素模式,并保持音频 latent 透传。
Minimax-H3二采分块采样器
用于 H3 高清二采:支持 AV latent、长边自动分块、像素级重叠(64 像素步长)、Euler 逐步同步融合、高清首尾帧重新编码,以及非 Euler 采样器兼容回退;输出采样结果和降噪结果。
requirements.txt
node --check
将本节点克隆到custom_nodes:
cd ComfyUI/custom_nodes/ git clone https://github.com/goohai/Goohai-MiniMax-H3_Integration.git
然后使用 ComfyUI 自己的 Python 环境安装依赖:
python -m pip install -r ComfyUI/custom_nodes/Goohai-MiniMax-H3_Integration/requirements.txt
秋叶整合包等 Windows 便携版可在 ComfyUI 根目录执行:
..\python\python.exe -m pip install -r .\custom_nodes\Goohai-MiniMax-H3_Integration\requirements.txt
requirements.txt 包含本地 Transformers 视觉模型和视频预处理所需的依赖。imageio-ffmpeg 会提供可随 Python 环境使用的 FFmpeg,通常不需要用户另外安装系统版 FFmpeg。
imageio-ffmpeg
GGUF 本地提示词优化属于可选功能,还需要安装支持当前 Python、操作系统及 CUDA 环境的 llama-cpp-python。预编译依赖可从以下地址下载:
llama-cpp-python
选择 .whl 文件时,需要同时匹配:
.whl
win_amd64
cp313
cu130
节点会在选择 GGUF 模型时自动检测以上环境,并在配置页面优先显示匹配的 wheel 文件名和下载链接。用户可直接按节点给出的链接安装;如果没有找到完全匹配的预编译版本,再前往发布页面手动选择。不使用 GGUF 时无需安装该依赖。
下载后请使用 ComfyUI 自己的 Python 环境安装 wheel,例如:
..\python\python.exe -m pip install "下载的llama_cpp_python文件.whl"
完成后重启 ComfyUI,在节点菜单中搜索 MiniMax-H3 智能一体化(GH),输出端拉出连线可自动连接 MiniMax-H3 适配器(GH)。
GPL-3.0-or-later. See LICENSE.
LICENSE
版权所有:中国计算机学会技术支持:开源发展技术委员会 京ICP备13000930号-9 京公网安备 11010802047560号
MiniMax H3 ComfyUI 智能一体化(GH)
🎬 视频教程
👉 点击前往 B 站主页观看全部教程
🧩 RunningHub 工作流
👉 点击访问我的 RunningHub 个人主页
MiniMax H3 的独立 ComfyUI 一体化集成节点,支持文本生视频、首尾帧、全能参考和音视频混合条件构建。节点会自动识别素材组合、生成官方媒体标签,自动优化提示词,支持本地模型优化与在线API优化。
An independent ComfyUI integration node for MiniMax H3 conditioning.
The diffusion model remains an external input in the downstream sampler. This package bundles the T8 conditioning implementation.
功能概览
根据上传的素材智能判定任务类型,负责收集图片、视频、音频和提示词,加载 H3 所需的 CLIP/VAE,并输出供后续采样器使用的 AV(Audio-Video)混合潜空间条件,支持原声音轨输出。
扩散模型本身仍由下游采样器执行。本仓库内置了 T8 风格的条件构建逻辑。
节点
MiniMax-H3 智能一体化(GH)主节点,负责:
前端支持拖放/上传图片、视频和音频;首尾帧模式与全能参考模式可以分别保存提示词和素材状态,切换模式不会丢失另一模式的内容。
主节点默认画幅为“自适应”,会优先根据当前模式下第一个有效视觉素材的宽高比计算目标画布;没有视觉素材时使用 16:9。用户也可以手动选择常用固定比例和目标百万像素。
素材区还支持:
MiniMax-H3 适配器(GH)接收主节点的
MiniMax输出,并拆分为下游工作流需要的端口:positive);av_latent,同时包含视频和音频潜空间);适配器还会输出“原始音频”(内部端口名为
mux_audio),可连接到VHS_VideoCombine.audio。适配器输出的“原始音频”可直接连
VHS_VideoCombine的音频输入,保证原始音质不变。工作模式
首尾帧 / 文生视频
前端模式名为
text_keyframes,根据上传情况自动解析任务类型:<Picture 1><Picture 1>Picture 1、Picture 2(不带尖括号)hybrid_audio<Picture 1>,音频作为参考条件首帧和尾帧素材点击后会自动将官方格式标签插入提示词。切换任务类型、上传或删除素材时,已有媒体标签也会自动统一为当前任务所需的带尖括号或不带尖括号格式。标签编号是否仍对应现有素材由“严格提示词标签”选项控制。
首尾帧模式中的
hybrid_audio是专用参考音频。上传后默认将音频模式切换为“锁定源音频”,移除后恢复为“自动生成”;用户可以在高级选项中手动覆盖。全能参考
前端模式名为
all_reference,用于 Ref2VA/Hybrid 参考素材工作流,支持:独立音频支持 MP3、WAV、FLAC、M4A/AAC、OGG/Opus、WMA、AIFF 等常见格式。节点会先使用 ComfyUI 默认解码器;遇到兼容性较差的编码或容器时,自动通过 FFmpeg 转为 PCM 音频后继续处理。
全能参考模式会按视频音轨和独立音频的顺序生成音频序号,可在高级选项中选择驱动音频。参考媒体标签使用官方尖括号格式,例如
<Picture 1>、<Video 1>、<Audio 2>。提示词标签
单击已上传素材会插入对应标签;双击视频会插入该视频音轨的音频标签。视频卡片右上角静音后,该视频音频不会传入参考条件。
标签格式会根据当前任务类型自动统一:
<Picture 1>、<Video 1>、<Audio 1>;Picture 1、Picture 2。当“严格提示词标签”开启时,引用不存在的素材编号会停止执行并报错提示:
关闭后不会因编号不存在而中断,但仍会进行标签格式规范化。
高级音频模式
native):不使用驱动音频初始化音频 latent,由模型生成目标音频;reference_only):音频只作为参考条件,模型生成目标音频;lock_source):将驱动音频写入音频 latent,保持源音频,同时单独输出一份同时长源音质音频;remix_source):以驱动音频为基础重绘,重绘程度由音频重绘强度控制。没有可用驱动音频时,节点会自动回退为“自动生成”,避免将空音频传入后端。
推荐连接
新增功能
提示词输入与富文本显示
picture 1、image1、图像1、视频1、音频1等中英文素材标签及对应尖括号格式;<Subject 1>、[Shot 1]、[场景1]、<d>、[Chinese]等标签;subject_definitions:、summary:、retention_analysis:、detailed_description:、overall_soundscape:等官方段落标题会以独立颜色显示,对话正文也会高亮,后台仍保存原始纯文本;H3 提示词优化
ComfyUI/models/llm目录读取;mmproj视觉模型,也可在独立的视觉模型下拉框中手动更换;主模型后的刷新按钮会同时刷新两份模型列表,并会显示依赖环境检测结果;web/audio/done.mp3,仅在本地模型或在线 API 真正完成一次新优化时播放;在原文与缓存结果之间切换不会重复播放;在线 API 与 RunningHub
2089252473927196673,海外版 AI 应用 ID 为2090668262521675778;参考图片、视频、系统提示词、用户提示词和最大输出 Token 会按两个应用各自的节点映射传入;reasoning_content后出现“后台成功并扣费,但最终提示词为空”的情况;如果第三方接口仍只返回推理内容,节点会显示明确的空输出原因;最大输出 Tokens
4096,最小512,最大8192,并随工作流保存;max_Token节点;本地视觉模型管理
mmproj视觉模型分别显示在两个下拉列表中。选择主模型时会自动推荐名称匹配度最高的mmproj,用户仍可手动覆盖,刷新按钮会统一更新两份列表;ComfyUI/models/llm,主模型列表自动过滤mmproj文件,并只显示节点能够识别的视觉模型;素材排序与标签联动
<Picture N>、<Video N>、<Audio N>编号及缩略图会按新顺序同步更新;视频增删造成音频序号变化时,对应音频标签也会自动重排;富文本标签与素材预览
picture 1、picture1、image 1、图像1、图1、图 1、视频1、音频1及对应的尖括号格式;有对应素材时显示 26 像素缩略图或音频图标,没有素材时仍保留代码块标签样式;(S1)至(S20)、<Subject 1>、[Shot 1]、[场景1]、<d>、[Chinese]等官方标签;系统提示词会约束人物简写统一使用带括号的(S1)、(S2)格式;<d>[Chinese]中文台词</d>格式;台词正文和官方段落标题分别高亮显示;音频裁剪与时间对齐
独立采样与解码节点
MiniMax-H3 双时钟-T8(GH)基于 T8 双时钟设计实现的独立 H3 音视频采样配置节点,不依赖安装 T8 节点包。主要解决0.32.0以上版本comfyui口型对不上或报错问题。
MiniMax-H3解码-T8(GH)独立的 H3 音视频潜空间解码节点,不依赖安装 T8 节点包。主要解决性能开销与开头破音的问题。
Minimax H3 Latent Upscaler (GH)独立的 AV latent 放大节点:自动分离音频,仅放大视频 latent 后重新合并;支持整幅优先、显存不足时自动空间分块、FP16/BF16/FP32、目标尺寸/倍率/百万像素模式,并保持音频 latent 透传。
Minimax-H3二采分块采样器用于 H3 高清二采:支持 AV latent、长边自动分块、像素级重叠(64 像素步长)、Euler 逐步同步融合、高清首尾帧重新编码,以及非 Euler 采样器兼容回退;输出采样结果和降噪结果。
限制与注意事项
requirements.txt中安装的依赖,不要求用户另外安装系统级 FFmpeg;node --check、Python 编译检查和单元测试只能验证代码层面,不能替代实际模型采样和浏览器交互测试。安装
将本节点克隆到custom_nodes:
然后使用 ComfyUI 自己的 Python 环境安装依赖:
秋叶整合包等 Windows 便携版可在 ComfyUI 根目录执行:
requirements.txt包含本地 Transformers 视觉模型和视频预处理所需的依赖。imageio-ffmpeg会提供可随 Python 环境使用的 FFmpeg,通常不需要用户另外安装系统版 FFmpeg。GGUF 本地提示词优化属于可选功能,还需要安装支持当前 Python、操作系统及 CUDA 环境的
llama-cpp-python。预编译依赖可从以下地址下载:选择
.whl文件时,需要同时匹配:win_amd64;cp313;cu130。节点会在选择 GGUF 模型时自动检测以上环境,并在配置页面优先显示匹配的 wheel 文件名和下载链接。用户可直接按节点给出的链接安装;如果没有找到完全匹配的预编译版本,再前往发布页面手动选择。不使用 GGUF 时无需安装该依赖。
下载后请使用 ComfyUI 自己的 Python 环境安装 wheel,例如:
完成后重启 ComfyUI,在节点菜单中搜索
MiniMax-H3 智能一体化(GH),输出端拉出连线可自动连接MiniMax-H3 适配器(GH)。License
GPL-3.0-or-later. See
LICENSE.