前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8614
  • FLUX 3上线原生音视频生成
  • 用300行 Python 自动生成资讯简报
  • 给 AI 编程工具加一道本地隐私网关
  • 用类型系统消除量化模型格式歧义
  • Meta 发布终端编程智能体 Muse Code
  • AI 代码生成平台安全检查清单
  • MiniMax H3登顶开源视频模型社区
  • 动态定价下的LLM预算保护设计
  • 把生产环境提示词当作代码治理
  • 五个被低估的MCP能力
  • 按任务场景选择大模型的方法
  • 欧盟 AI 透明度规则正式生效
  • 让 AI Agent 按工单自动结算
  • 构建可审计的半自主 EDA Agent
  • 让编码 Agent 记住被否决的方案
  • 构建动态多模型路由层
  • 用脚本自检守住高风险正则
  • 让AI代理继承用户权限而非共享密钥
  • 五款自托管AI对话前端怎么选
  • 用命令行低成本批量分析文本
  • MiniMax H3 的 ComfyUI 部署指南
  • Node.js 多模型摘要服务设计
  • 用停止条件预防AI代理越权
  • 三类协议如何组成 Agent 技术栈
  • 降低Claude Code无头调用成本
  • 百美元树莓派部署自治 AI Agent
  • 统一统计三类AI编程助手成本
  • 检测器三次重写暴露同类逻辑错误
  • VS Code 1.132 强化智能体协作
  • 代码检索为何需要三类索引协同
  • 用可替换网关解耦实时多模态模型
  • 小米开源具身智能模型完整工具链
  • 用A2A打通多智能体协作流程
  • 用连续性账本维持AI角色记忆
  • 自建全套AI开发工具:Token消耗实测下降52%
  • 我是如何构建自主Agent流水线的
  • WPA引入AI辅助定位性能瓶颈
  • 微软 SkillOpt 证明优化后的 Agent 技能可跨模型和工具链复用
  • Meta模型测试时越界攻击外部系统
  • Agent Plugins 1.0获多款开发工具支持
  • Vercel集成可自动安装Agent技能
  • Ling 3.0 Tiny上线Vercel AI Gateway
  • Agent插件开放标准正式发布
  • Meta 发布 Muse Code 编程 Agent,长上下文工具调用能力突出
  • 联网误配置让模型误攻真实网站
  • AI时代云成本剧变:决策成本反超实现成本
  • 用LLM自动诊断Python性能瓶颈:轻量级性能剖析代理实战
  • Spec转可部署微服务:FastAPI+LLaMA驱动的端到端代码生成
  • AI安全测试失控:英国AISI评测中模型绕过限制攻击真实系统
  • Meta Muse模型测试中误闯真实系统,第三方评测机构配置失误
  • Meta推出编程智能体Muse Code,挑战Claude Code和Codex
  • 已加载 51 / 8614
9.0
重磅
AI SCORE
技术实践2026-08-06 11:09

MiniMax H3 的 ComfyUI 部署指南

dev.to · AI#MiniMax H3#ComfyUI#视频生成
Editor brief · 编辑速览

文章讲解在 ComfyUI 0.30.0 以上部署开放权重的 MiniMax H3,并按显存选择模型及配置文生视频、图生视频和参考视频工作流。还指出本地生成分辨率上限和商业许可的地域限制。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

2026 年 8 月 3 日,MiniMax H3 以开放权重的形式发布,ComfyUI 也在同一天上线了原生支持。

这是一款能够同时处理文本、图像和音频的新一代模型,可生成带有立体声音频的视频。不过,它也存在一些官方博客和早期评测很少提及的实际限制:本地运行时的分辨率上限,以及商业许可证中的地区限制。

本文将介绍如何在 ComfyUI 0.30.0 及以上版本中完成配置、如何根据 VRAM 选择模型、如何使用三种工作流(T2V/I2V/R2V),以及截至 2026 年 8 月需要注意的许可证问题。

MiniMax H3 是中国 MiniMax 于 2026 年 8 月 3 日发布的一款开放权重视频生成模型。

它是海螺系列的第三代产品,也是该公司首次公开模型权重。ComfyUI 在模型发布当天便加入了原生支持。

  • 模型架构:拥有 331 亿参数的单流 omni transformer(其中约 130 亿参数位于 AdaLN-modulation 分支中;如果只进行推理,则无须加载这些参数)
  • 文本编码器:Qwen3-VL-32B
  • 输出:最长 15 秒、24fps,并带有立体声音频
  • 支持的任务:Text-to-Video(T2V)、Image-to-Video(I2V,支持指定起始帧和结束帧)、Reference-to-Video(R2V)
  • 支持的语言:包括日语在内的 11 种语言
  • Checkpoint:分为两个系列——FL2VA(处理 T2V/I2V)和 Ref2VA(处理由参考内容驱动的 R2V)

在 ComfyUI 中开始使用 MiniMax H3

下面介绍如何在本地 ComfyUI 中运行 MiniMax H3,涵盖从配置到生成的完整流程。

第 1 步:将 ComfyUI 更新至最新版本

MiniMax H3 对 GPU 性能的要求相当高,因此开始之前,请确保你的硬件资源留有足够余量。

启动 ComfyUI,并在继续操作之前将其更新至最新版本。更新完成后,即可开始安装模型数据。

第 2 步:获取模型数据

接下来,下载视频生成所需的模型数据。

模型通过 Hugging Face 上的 Comfy-Org/MiniMax-H3 仓库分发。MiniMax 的官方仓库(MiniMaxAI/MiniMax-H3)包含所有精度和格式的文件,总大小约为 498GB;但如果只下载 ComfyUI 实际需要的文件,通常只需几十 GB。

视频生成需要三部分模型数据:

加载工作流后,界面中会显示所需下载文件的列表。你可以按照顺序逐个下载,也可以使用以下命令一次性获取全部文件:

# Video model data
cd ComfyUI/models/diffusion_models
wget https://huggingface.co/Comfy-Org/MiniMax-H3/resolve/main/diffusion_models/minimax_h3_fl2va_pruned_int8_convrot.safetensors

# Text encoder
cd ComfyUI/models/text_encoders
wget https://huggingface.co/Comfy-Org/MiniMax-H3/resolve/main/text_encoders/qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors

# VAE
cd ComfyUI/models/vae
wget https://huggingface.co/Comfy-Org/MiniMax-H3/resolve/main/vae/minimax_h3_audio_vae_fp32.safetensors
wget https://huggingface.co/Comfy-Org/MiniMax-H3/resolve/main/vae/minimax_h3_video_vae_fp16.safetensors

第 3 步:启动 ComfyUI 并打开工作流

本指南使用官方提供的组合工作流。

从 Comfy 的文档中下载官方工作流。

(来源:docs.comfy.org)

ComfyUI Native Workflows page showing the MiniMax H3 Text-to-Video download button

将下载的工作流文件拖放到 ComfyUI 画布中,然后确认所有节点均已正确加载。

第 4 步:输入 prompt 并开始生成(T2V)

MiniMax H3 的 Text-to-Video 模式只需相对简单的 prompt,就能生成高质量视频。

在 prompt 字段中使用自然语言描述场景,然后单击“▷Queue”按钮开始生成。

使用 MiniMax H3(ComfyUI)生成的视频:

充满情感张力的动漫角色电影。图 1 中的女孩仍处于原来的场景:室内一条沐浴着温暖阳光的木质走廊,富有戏剧性的暖金色逆光与柔和的环境补光照亮空间,深沉而柔和的阴影逐渐过渡为浓郁的琥珀色调。整体采用温暖的单色调色板,以金色光线为主,并由女孩双眼中的柔和蓝色作为点缀。情感意象:一只拼命伸出的手,以及一滴正在坠落的眼泪。整个过程中环境保持不变。

SHOT 1:画面完全从图 1 的场景开始,女孩绝望地向镜头伸出手;泪水逐渐盈满她的双眼,金色逆光略微增强、闪动,尘埃微粒从她身旁缓缓飘过。镜头缓慢而克制地向前推进,聚焦于她因用力伸展而紧绷的手指,以及泪光闪烁的双眼。

SHOT 2:切换至极近距离的侧脸特写,她的泪水终于从泛红的脸颊滑落;镜头沿着她的面庞缓慢移动,温暖的气流吹动几缕散落的发丝,她的衣领和领带也在轻轻颤动。

SHOT 3:切换至一个低机位、带有倾斜角度的广角镜头:她失去平衡,身体向前倾倒,双马尾剧烈甩动;正在远去的人影所发出的脚步声逐渐消失在画面之外。温暖的光线在她湿润的双眼边缘轻柔绽放,随后画面定格为柔和的静止瞬间——她落下的手终究只差一点便能触及目标。

音频:柔和的室内环境底噪、颤抖而绝望的呼吸声、衣料摩擦声、微弱的发饰清响、木地板上逐渐远去的脚步声,以及渐渐高涨的钢琴与弦乐情感配乐;在最后一拍,所有声音归于低沉、屏息般的寂静。

第 5 步:通过图像生成视频(I2V)

MiniMax H3 也可以使用单张参考图像生成视频。

该工作流可以在同一个官方工作流页面中获取。

按照镜头(SHOT 1–3)组织你的 prompt,然后单击“▷Queue”开始生成。

使用 I2V 生成的视频:

常见错误及解决方法

ComfyUI 中未显示 MiniMax H3 节点

你的 ComfyUI 版本低于 0.30.0。请更新至最新版本。需要注意的是,Desktop 和 Cloud 版本会跟随稳定版发布,因此更新可能会有所延迟。

VRAM 不足或内存占用过高

diffusion model 请使用 pruned int8,而不是 bf16;文本编码器则使用 nvfp4 AWQ。如果资源仍然紧张,可以降低 Resolution Selector 中的百万像素数量,或缩短视频时长。

使用 256p 等低分辨率时生成失败

MiniMax H3 支持的最低分辨率为 384p。任何等于或低于 256p 的分辨率都会导致生成失败,请改用模板中提供的分辨率预设。

输出视频中没有音频

检查是否同时加载了 minimax_h3_video_vae_fp16.safetensors(视频)和 minimax_h3_audio_vae_fp32.safetensors(音频),并确认 VAEDecodeAudio 节点已连接至 SaveVideo 节点。

不确定 I2V 应该使用哪个 checkpoint

T2V 和 I2V(包括指定起始帧和结束帧)应使用 FL2VA 系列;由参考内容驱动的 R2V 应使用 Ref2VA 系列。二者使用不同的权重,如果混用,工作流将无法正常运行。

MiniMax H3 许可证与商业使用

MiniMax H3 采用名为“MiniMax H3 Community License”的自定义许可证发布。

截至本文写作时,已确认的主要条款如下:

(信息截至 2026 年 8 月。)

这一地区限制条款已成为海外技术博客在讨论 MiniMax H3 时重点关注的话题。如果你计划将其集成到商业服务中,请在作出决定之前,与法务团队共同核查许可证原文,即 Hugging Face 上的 LICENSE 文件。

本文中的任何内容均不构成法律建议。

MiniMax H3/LICENSE:https://huggingface.co/MiniMaxAI/MiniMax-H3/blob/main/LICENSE

以上介绍了如何使用开放视频生成模型中的最新产品 MiniMax H3。

它是当前视频生成领域最强大的免费开源选择之一,值得趁其刚刚发布之际深入研究。

本文经过 AI 辅助编辑。*最初以日语发布于 EdgeHUB。

如需采取进一步措施,你可以考虑屏蔽此人和/或举报滥用行为。

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
用命令行低成本批量分析文本
下一篇
Node.js 多模型摘要服务设计