MiniMax H3于7月31日开源权重至Hugging Face,核心生成器开放但预处理和2K修复层仍走API,最小量化版约21GB,完整版123.6GB。
7月31日,MiniMax发布了通用多模态视频生成系统H3,并在随后不久确认权重已开源——已在Hugging Face上线,仓库为MiniMaxAI/MiniMax-H3,同日ComfyUI重构版镜像也正式支持该模型。
首先需要注意的是:据报道,开源权重许可证不适用于欧盟、英国、韩国和美国等地区。在其他地区的商业使用免费,但需要在产品界面中显示"MiniMax H3",年收入超过2000万美元需单独获得书面授权。如果身处上述排除地区,在规划使用前请直接查阅Hugging Face模型卡上的许可证原文——不要将任何二手概述(包括本文)作为你具体情况的最终依据。

实际开源与仅通过API提供的区别在于:系统包含三层架构——托管的预处理/编排层(Context-IR)保留在MiniMax API背后,开源的是核心生成器(H3-Base),而2K再生通道(Regenerate-2K)同样仅通过API托管。因此这里的"开源"指的是核心生成器,而非完整的商业 pipeline。
对于评估该模型是否能在自有硬件上运行的人来说,关键技术参数如下:这是一个33B密集单流Transformer,以两个任务特定的检查点形式发布——fl2va(文本/图像驱动生成)和ref2va(参考驱动生成),各自最小量化形式约为21GB。完整精度版本约为123.6GB;最小可运行组合据报道约为42.5GB。ComfyUI的自身指导建议12GB显存的显卡加CPU卸载即可运行,但预期体验会比较缓慢而非流畅。本地原生生成在短边为768像素——2K输出来自单独的上下文再生通道,不属于开源权重的一部分。
大致的运行方式(请查阅官方模型卡获取准确、最新的命令——此处仅为示意,由于发布细节变化迅速,无法保证可直接复制使用):
from huggingface_hub import snapshot_download
# Download only the checkpoint you actually need —
# fl2va for text/image-driven generation, ref2va for reference-driven
snapshot_download(
repo_id="MiniMaxAI/MiniMax-H3",
allow_patterns=["fl2va/*"], # or "ref2va/*"
local_dir="./minimax-h3"
)
# From here, follow the model card's specific inference instructions —
# this is a 33B video model, not a drop-in chat completion call,
# and exact loading code depends on which runtime (ComfyUI, diffusers-style
# pipeline, etc.) you're using.
这次发布引发关注的原因不仅在于"又一款模型发布":据Artificial Analysis报道,H3在视频编辑中排名第一,在文生视频和图生视频中均进入前三,并指出开源权重将使该模型成为该领域领先的开放权重模型(Artificial Analysis,2026年7月)。不过需要平衡看待的是,同一基准测试也显示H3在文生视频方面落后于Gemini Omni Flash,在图生视频方面则落后于Seedance 2.0和Gemini Omni Flash(South China Morning Post,2026年7月)——它在某个特定类别(编辑)表现出色,并非全面碾压。
简要总结:MiniMax开源了H3的核心生成器(而非完整的托管pipeline)——这是一款33B视频生成模型,能够同时理解文本/图像/视频/音频并输出带原生音频的视频。据第三方基准测试,它在视频编辑方面表现突出,并非在所有维度都排名第一。许可证排除欧盟、英国、韩国和美国——在规划商业使用前请查阅官方条款。了解更多,请访问:RouteAI
对于后续行动,你可以考虑屏蔽此人或举报滥用行为。