文章讲解在 ComfyUI 0.30.0 以上部署开放权重的 MiniMax H3,并按显存选择模型及配置文生视频、图生视频和参考视频工作流。还指出本地生成分辨率上限和商业许可的地域限制。
2026 年 8 月 3 日,MiniMax H3 以开放权重的形式发布,ComfyUI 也在同一天上线了原生支持。
这是一款能够同时处理文本、图像和音频的新一代模型,可生成带有立体声音频的视频。不过,它也存在一些官方博客和早期评测很少提及的实际限制:本地运行时的分辨率上限,以及商业许可证中的地区限制。
本文将介绍如何在 ComfyUI 0.30.0 及以上版本中完成配置、如何根据 VRAM 选择模型、如何使用三种工作流(T2V/I2V/R2V),以及截至 2026 年 8 月需要注意的许可证问题。
MiniMax H3 是中国 MiniMax 于 2026 年 8 月 3 日发布的一款开放权重视频生成模型。
它是海螺系列的第三代产品,也是该公司首次公开模型权重。ComfyUI 在模型发布当天便加入了原生支持。
下面介绍如何在本地 ComfyUI 中运行 MiniMax H3,涵盖从配置到生成的完整流程。
MiniMax H3 对 GPU 性能的要求相当高,因此开始之前,请确保你的硬件资源留有足够余量。
启动 ComfyUI,并在继续操作之前将其更新至最新版本。更新完成后,即可开始安装模型数据。
接下来,下载视频生成所需的模型数据。
模型通过 Hugging Face 上的 Comfy-Org/MiniMax-H3 仓库分发。MiniMax 的官方仓库(MiniMaxAI/MiniMax-H3)包含所有精度和格式的文件,总大小约为 498GB;但如果只下载 ComfyUI 实际需要的文件,通常只需几十 GB。
视频生成需要三部分模型数据:
加载工作流后,界面中会显示所需下载文件的列表。你可以按照顺序逐个下载,也可以使用以下命令一次性获取全部文件:
# Video model data
cd ComfyUI/models/diffusion_models
wget https://huggingface.co/Comfy-Org/MiniMax-H3/resolve/main/diffusion_models/minimax_h3_fl2va_pruned_int8_convrot.safetensors
# Text encoder
cd ComfyUI/models/text_encoders
wget https://huggingface.co/Comfy-Org/MiniMax-H3/resolve/main/text_encoders/qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
# VAE
cd ComfyUI/models/vae
wget https://huggingface.co/Comfy-Org/MiniMax-H3/resolve/main/vae/minimax_h3_audio_vae_fp32.safetensors
wget https://huggingface.co/Comfy-Org/MiniMax-H3/resolve/main/vae/minimax_h3_video_vae_fp16.safetensors
本指南使用官方提供的组合工作流。
从 Comfy 的文档中下载官方工作流。
(来源:docs.comfy.org)

将下载的工作流文件拖放到 ComfyUI 画布中,然后确认所有节点均已正确加载。
MiniMax H3 的 Text-to-Video 模式只需相对简单的 prompt,就能生成高质量视频。
在 prompt 字段中使用自然语言描述场景,然后单击“▷Queue”按钮开始生成。
使用 MiniMax H3(ComfyUI)生成的视频:
充满情感张力的动漫角色电影。图 1 中的女孩仍处于原来的场景:室内一条沐浴着温暖阳光的木质走廊,富有戏剧性的暖金色逆光与柔和的环境补光照亮空间,深沉而柔和的阴影逐渐过渡为浓郁的琥珀色调。整体采用温暖的单色调色板,以金色光线为主,并由女孩双眼中的柔和蓝色作为点缀。情感意象:一只拼命伸出的手,以及一滴正在坠落的眼泪。整个过程中环境保持不变。
SHOT 1:画面完全从图 1 的场景开始,女孩绝望地向镜头伸出手;泪水逐渐盈满她的双眼,金色逆光略微增强、闪动,尘埃微粒从她身旁缓缓飘过。镜头缓慢而克制地向前推进,聚焦于她因用力伸展而紧绷的手指,以及泪光闪烁的双眼。
SHOT 2:切换至极近距离的侧脸特写,她的泪水终于从泛红的脸颊滑落;镜头沿着她的面庞缓慢移动,温暖的气流吹动几缕散落的发丝,她的衣领和领带也在轻轻颤动。
SHOT 3:切换至一个低机位、带有倾斜角度的广角镜头:她失去平衡,身体向前倾倒,双马尾剧烈甩动;正在远去的人影所发出的脚步声逐渐消失在画面之外。温暖的光线在她湿润的双眼边缘轻柔绽放,随后画面定格为柔和的静止瞬间——她落下的手终究只差一点便能触及目标。
音频:柔和的室内环境底噪、颤抖而绝望的呼吸声、衣料摩擦声、微弱的发饰清响、木地板上逐渐远去的脚步声,以及渐渐高涨的钢琴与弦乐情感配乐;在最后一拍,所有声音归于低沉、屏息般的寂静。
MiniMax H3 也可以使用单张参考图像生成视频。
该工作流可以在同一个官方工作流页面中获取。
按照镜头(SHOT 1–3)组织你的 prompt,然后单击“▷Queue”开始生成。
使用 I2V 生成的视频:
你的 ComfyUI 版本低于 0.30.0。请更新至最新版本。需要注意的是,Desktop 和 Cloud 版本会跟随稳定版发布,因此更新可能会有所延迟。
diffusion model 请使用 pruned int8,而不是 bf16;文本编码器则使用 nvfp4 AWQ。如果资源仍然紧张,可以降低 Resolution Selector 中的百万像素数量,或缩短视频时长。
MiniMax H3 支持的最低分辨率为 384p。任何等于或低于 256p 的分辨率都会导致生成失败,请改用模板中提供的分辨率预设。
检查是否同时加载了 minimax_h3_video_vae_fp16.safetensors(视频)和 minimax_h3_audio_vae_fp32.safetensors(音频),并确认 VAEDecodeAudio 节点已连接至 SaveVideo 节点。
T2V 和 I2V(包括指定起始帧和结束帧)应使用 FL2VA 系列;由参考内容驱动的 R2V 应使用 Ref2VA 系列。二者使用不同的权重,如果混用,工作流将无法正常运行。
MiniMax H3 采用名为“MiniMax H3 Community License”的自定义许可证发布。
截至本文写作时,已确认的主要条款如下:
(信息截至 2026 年 8 月。)
这一地区限制条款已成为海外技术博客在讨论 MiniMax H3 时重点关注的话题。如果你计划将其集成到商业服务中,请在作出决定之前,与法务团队共同核查许可证原文,即 Hugging Face 上的 LICENSE 文件。
本文中的任何内容均不构成法律建议。
MiniMax H3/LICENSE:https://huggingface.co/MiniMaxAI/MiniMax-H3/blob/main/LICENSE
以上介绍了如何使用开放视频生成模型中的最新产品 MiniMax H3。
它是当前视频生成领域最强大的免费开源选择之一,值得趁其刚刚发布之际深入研究。
本文经过 AI 辅助编辑。*最初以日语发布于 EdgeHUB。
如需采取进一步措施,你可以考虑屏蔽此人和/或举报滥用行为。