数字人模式会把 Media 中唯一的一条音频作为驱动音轨锁定到生成结果,不再把它当成普通参考音频。视觉参考可以是图片或视频;如果没有提供音频,节点会自动退回普通参考生视频,不会直接报错。
媒体与提示词
四种媒体输入方式
方式
适合场景
Media Loader
推荐的日常用法;集中管理素材,并支持视频参考解码缓存
直接连接 Media 口
从普通图片、视频、音频节点直接连接;同一个可见端口支持多条虚拟连线
Media Bridge
工作流 API、无头运行或需要显式输入口的工作流
Media Splitter
将 Media Bundle 拆成可接入其他工作流的独立图片、视频和音频输出
Media Loader 支持从资源管理器直接拖入图片、视频和音频,也可以在单独选中该节点后使用 Ctrl+V 粘贴剪贴板中的媒体。拖入或粘贴的素材会自动归入对应分类。
音频卡片提供低调的播放/暂停按钮,方便快速检查;视频卡片仍以缩略图预览为主。
Media Loader 本身可以保存较大的素材库,实际数量限制由使用它的 Easy 或 Context Segments 节点检查。四种方式中,只有 Media Loader 会缓存视频参考的解码结果:同一个视频首次解码后,后续生成可通过 ComfyUI 的节点缓存直接复用,从而减少重复使用视频参考时的加载和解码时间。更换文件或文件内容变化后缓存会自动失效。直接连接 Media 口、Media Bridge 和 Media Splitter 不提供这项视频解码缓存;它节省的是生成前的视频处理时间,不会缩短模型本身的采样时间。
Media Splitter 是 Media Loader / Media Bridge 的反向工具:把一个 Media Bundle 拆成标准的 IMAGE、VIDEO、AUDIO 输出。设置三类数量后,节点只显示对应数量的输出口;不需要的输出不会占用画布空间,适合把同一套素材分给其他 ComfyUI 工作流。
直接连接 Media 口时,可以从端口拖到空白画布快速创建媒体节点,也可以点击虚拟连线编号删除对应素材。
ComfyUI-MiniMaxH3-Easy
English README
一套面向实际创作的 MiniMax H3 ComfyUI 节点:用更少的节点完成文生、图生、首尾帧、参考生视频、数字人和长视频上下文分段,并提供统一媒体管理、可视化素材引用、提示词优化与分段二采。
主要优势
@即可插入图片、视频或音频引用,不必手写<Picture N>等标签。安装
请先更新到包含 MiniMax H3 官方节点的较新版本 ComfyUI。
在
ComfyUI/custom_nodes中安装:也可以通过 ComfyUI Manager 搜索
ComfyUI-MiniMaxH3-Easy安装。请在版本选择中安装 Nightly 版本,Nightly 才是当前最新版;其他发布版本可能落后于本仓库。安装或更新 Python 文件后请重启 ComfyUI。常规模型放入:
使用 Latent Upscale 二采时,将对应的 H3 3D latent 放大模型放入:
Easy Loader 可以直接选择 FL2VA、Ref2VA、文本编码器和两个 VAE。模型加载器已经取消文件名白名单和命名筛选,会显示 ComfyUI 对应模型目录中的全部可用文件;请根据模型用途选择正确的文件。如果希望使用其他原生、社区或 GGUF 加载器,也可以通过 MiniMax H3 Easy Model Adapter 接入。
快速开始
最快的方式是导入
workflow/1.MiniMax_H3_Easy.json,然后:手动搭建时,基本结构是:
主节点输出的
Model可继续连接 LoRA、模型补丁或采样器;H3 Context连接 MiniMax H3 Easy Output。生成模式
首尾帧图片会按目标画布进行必要的中心裁切,不会被横向或纵向拉伸。
“图生或首尾帧”和“参考生视频”两种模式在没有连接任何素材时都会自动走文生视频,不需要为了文生单独切换到固定模式。
当 Loader 同时配置 FL2VA 和 Ref2VA 时,普通文生/图生优先使用 FL2VA,完整参考生视频优先使用 Ref2VA;只配置一个模型时,该模型会承担所有模式。
数字人
数字人模式会把 Media 中唯一的一条音频作为驱动音轨锁定到生成结果,不再把它当成普通参考音频。视觉参考可以是图片或视频;如果没有提供音频,节点会自动退回普通参考生视频,不会直接报错。
媒体与提示词
四种媒体输入方式
Media Loader 支持从资源管理器直接拖入图片、视频和音频,也可以在单独选中该节点后使用
Ctrl+V粘贴剪贴板中的媒体。拖入或粘贴的素材会自动归入对应分类。音频卡片提供低调的播放/暂停按钮,方便快速检查;视频卡片仍以缩略图预览为主。
Media Loader 本身可以保存较大的素材库,实际数量限制由使用它的 Easy 或 Context Segments 节点检查。四种方式中,只有 Media Loader 会缓存视频参考的解码结果:同一个视频首次解码后,后续生成可通过 ComfyUI 的节点缓存直接复用,从而减少重复使用视频参考时的加载和解码时间。更换文件或文件内容变化后缓存会自动失效。直接连接 Media 口、Media Bridge 和 Media Splitter 不提供这项视频解码缓存;它节省的是生成前的视频处理时间,不会缩短模型本身的采样时间。
Media Splitter是 Media Loader / Media Bridge 的反向工具:把一个Media Bundle拆成标准的IMAGE、VIDEO、AUDIO输出。设置三类数量后,节点只显示对应数量的输出口;不需要的输出不会占用画布空间,适合把同一套素材分给其他 ComfyUI 工作流。直接连接 Media 口时,可以从端口拖到空白画布快速创建媒体节点,也可以点击虚拟连线编号删除对应素材。
@素材引用在参考生视频或上下文提示词中输入
@,即可选择已经连接的图片、视频或音频。界面可以按序号或文件名显示引用,运行时会自动转换为 H3 需要的标签。图片、视频和音频分别独立编号。例如
@图片1、@视频1和@音频1可以同时存在。台词块与原始视图
输入
#可以创建台词块,运行时自动转换为<d>...</d>。编辑器右下角的按钮用于提示词优化和结构化/原始提示词视图切换。提示词参数也可以转换为普通
STRING输入。连接外部文本后,节点内编辑器会进入只读状态,并以外部字符串为准。上下文分段长视频
上下文分段把一条长视频拆成多个连续片段。每段保留自己的提示词、时长和参考素材,同时从上一段取得连续性信息。
最基本的链路是:
基本用法
---分隔每段提示词;在结构化编辑器中输入~会自动插入这个分隔符;5,5,5;@为各段指定需要的媒体;H3 Context连接到 Segment Sample。普通第一采工作流:
3.MiniMax_H3_Easy_Context_Segments.json逐段控制(可选)
如果只想一条链完成所有分段,直接使用 Segment Sample 即可。需要逐段调整 Seed、临时替换某段提示词,或以后只重跑受影响的分段时,可使用
5.MiniMax_H3_Easy_Context_Segments_Control.json。它用 MiniMax H3 Easy Sample Setup 接收一次公共的 Context、Model、SAMPLER 和 SIGMAS,再把多个 Segment Step 串联起来;第一次运行仍会完整生成,局部重跑只是额外能力。第一个 Step 接 Setup,后续 Step 只连接
Previous segment,分段顺序由连线自动确定。每个 Step 都有自己的 Seed,Prompt override是可选输入;不连接时继续使用 Context Segments 中的分段提示词和@素材。示例工作流放了 3 个 Step,可按需要增加或减少。分段提示词与参考媒体
所有连接到 Context Segments 的素材组成一个共享素材库,但不会自动全部参与每一段。每个分段只会直接使用该段提示词中通过
@明确引用的图片、视频或音频;引用不会从上一段继承。同一份素材需要用于多段时,应在每个相关分段中再次@引用。未被当前分段引用的素材不会送入该段生成,避免不同片段的参考内容互相干扰。编辑器会在运行时把
@引用转换为 H3 所需的标签,并按当前分段使用的素材重新编号;即使某段没有直接引用素材,所选连续方式仍会把上一段的上下文传给它。连续方式
5 / 22 / 39 / 56 / 735 / 22 / 39 / 56 / 7339 / 90 / 14139 / 90 / 141如果更重视说话人或歌手声音的连续性,优先使用 AV Prefix,或提供明确的音频参考。单纯的 RGB Guide 主要传递视觉边界,不能可靠锁定音色。
Context Segments 也支持数字人音频模式:连接且仅连接一条音频后,它会按整条时间线自动切片,并作为最终完整音轨。
分段二采
MiniMax H3 Easy Segment Refine 会逐段放大和重新采样,并继续把上一段二采结果传给下一段,因此不会把不同段的提示词和参考素材混在一起。
对应示例(可在两个分组之间切换):
4.MiniMax_H3_Easy_Context_Segments_Refine.jsonSegment Decode 会逐段解码并写入临时视频文件,最终输出带音频的完整 ComfyUI
VIDEO,因此不需要在内存中保留整条 RGB 视频。提示词优化
点击提示词编辑器右下角的
✦可以手动优化当前提示词,也可以在设置中开启“运行工作流时自动优化”。支持:Context Segments 的专用优化
“分段秒数”同时决定优化器需要输出多少段。例如填写
5,5,5时,可以只在输入框中写一整段故事或创意,再点击✦(或开启运行时自动优化),优化器会把它规划成 3 段独立提示词,并自动用---分隔。这套优化不是简单扩写:它会根据每段时长安排动作密度,保留必要的主体外观、场景、道具状态和声音线索,让每段提示词都能独立使用,同时避免输出“第 2 段”“接着上一段”这类模型无法直接利用的规划文字。开启“读取媒体”后,优化器还会保留或分配真正需要的
@引用;最终生成时仍严格遵守“每段只使用本段引用素材”的规则。自动优化会记录已经处理过的提示词;当提示词、优化设置和媒体都没有变化时,不会在每次运行时重复改写。
API 设置保存在插件目录的
prompt_optimizer.json。API Key 在该文件中以明文保存,请勿公开或上传。节点一览
使用限制与注意事项
imageio-ffmpeg,也支持系统 PATH 中的 FFmpeg。Legacy Widget Width Fix节点,这样修复才会生效;只安装插件不会启用修复。这是 ComfyUI 前端的问题,不是本节点的 bug。大多数用户无需处理。其他说明
workflow目录;不同工作流可能需要额外模型、LoRA 或自定义节点。致谢
上下文连续生成的设计思路受到 NikoDemon80/ComfyUI-H3-Motion-Context 及其衍生项目 ethanfel/ComfyUI-MiniMaxH3-Contex-Loop 的启发,代码与节点实现均独立完成。
License 与署名
本项目使用 MIT License。
如果项目中复用或改编了本项目较多代码或重要实现,请在项目说明中注明
ComfyUI-MiniMaxH3-Easy及原作者,并请勿将复用的部分声明为完全独立原创。少量参考、普通调用或仅使用本节点不受此署名说明约束。