33B 参数统一视频生成模型,同时处理文本、图像、视频、音频并输出带立体声的 4-15 秒视频,在视频编辑榜单排名第一,首个商业化开源旗舰视频生成模型。
在 H3 之前,视频生成领域在设计上就是碎片化的。图像生成被拆分为多个专家模型,分别负责文生图、编辑、主体参考、运动参考和风格参考。音频生成将语音、音效和音乐视为独立领域。视频生成则进一步细分为文生视频、图生视频、首尾帧、主体参考、运动参考、语音参考和视频编辑——且图像、视频、音频之间存在硬边界。
这些任务孤岛限制了创作工作流,也制约了模型在训练时的泛化能力。MiniMax 为 H3 制定的第一条设计原则,就是从预训练阶段开始统一并泛化所有这些任务。
H3 系统由三个顺序工作的模块组成:
H3-Context-IR 负责指令解析、跨模态关联和时序理解。它接收自由格式的多模态输入——提示词、参考图像、视频片段、音频片段——并将它们提炼为结构化的"上下文中间表示"。原始素材约需 100,000 个 token 的推理量,被压缩到约 4,000 个 token(压缩比 25:1)。语言作为上下文与目标视频之间的通用桥梁。该模块以托管 API 的形式提供服务,未开源。
H3-Base 是开源权重核心:一个 331 亿参数的单流 Transformer,在 768p 分辨率下生成视频和立体声音频。它使用 Qwen3-VL-32B 作为文本和视觉编码器(从第 50 层提取隐藏状态),自定义的 H3-VisualVAE 用于视频分词,以及 H3-AudioVAE 用于音频。三维多模态旋转位置嵌入(MM-RoPE)处理时序和空间维度上的位置关系。
H3-Regenerate-2K 接收 768p 输出和原始多模态上下文,重建出 2K 版本。它不使用传统超分辨率模块那样猜测缺失细节,而是让基础模型进行上下文内重建——借助原始参考素材恢复标准超分辨率无法重建的精细纹理、文字和品牌标识。
H3 有几个设计选择值得仔细审视。
VAE 全面重构。MiniMax 为 H3 完全重建了分词器。新的 H3-VAE 实现了 32 倍空间压缩比和 4 倍时序压缩比,相比上一代在有效序列长度上获得 4 倍提升。这使得原生 2K 输出在成本上变得可行——即使在高分辨率下序列长度也保持可控。
AdaLN 预计算。331 亿参数中约 130 亿位于自适应层归一化(AdaLN)调制分支。这些可以从时间步嵌入中预计算并缓存,使有效推理参数更接近 200 亿——这是显著的效率提升。
分离计算负载。引入多模态上下文后,训练样本的序列长度方差增加了两倍。H3 将理解和生成的计算负载分离,分别针对两者微调硬件利用率,同时平衡样本级异构计算与样本间负载均衡。MiniMax 报告这使训练吞吐量提升了近 30%。
两个检查点变体。Hugging Face 上开源权重发布时附带两个任务专用检查点:用于首尾帧生成的 H3-Base-FL2VA(零、一或两张输入图像),以及用于全参考生成的 H3-Base-Ref2VA(最多 9 张图像、3 个视频片段和 3 个音频片段)。分离使每个检查点保持专注,同时共享底层架构。
H3 最多接受 9 张参考图像(JPG、PNG、WEBP、HEIC,每张最大 30 MB),最多 3 个视频片段(MP4 或 MOV,每段 2-15 秒,每段最大 50 MB),以及最多 3 个音频片段(WAV 或 MP3,每段 2-15 秒,每段最大 15 MB)。每次请求文件总数上限为 12 个,请求体限制 64 MB,提示词限制 7,000 字符。
一个值得注意的限制:音频不能作为独立输入发送——必须伴随至少一张图像或一个视频片段。图生视频和参考生视频模式在单次请求中互斥。
输出为 4-15 秒、24 FPS,配有原生 32 kHz 立体声音频,支持 21:9 到 9:16 的宽高比。
API 采用异步任务模型:提交生成请求后获得任务 ID,轮询完成状态,然后下载结果 URL。定价为每秒钟 2K 视频输出 $0.13(约每分钟 $7.80),前五张参考图像免费,超出部分每张 $0.04。参考音频免费。768p 档位定价降至每秒钟 $0.09,不过该档位目前处于封闭测试阶段。
对比来看,Kling 3.0 在 1080p 下约合每分钟 $20.16,Dreamina Seedance 2.0 在 1080p 下约合每分钟 $22.45。H3 的 2K 输出每分钟 $7.80 大幅低于两者,这也是它吸引商业内容团队关注的部分原因。
MiniMax 于 2026 年 8 月 3 日在 MiniMax H3 社区许可证下开源了 H3-Base 权重。该许可证允许年收入低于 2,000 万美元的组织商业使用,需显著标注归属。超过该阈值的组织需要单独的 commercial agreement。
H3-Context-IR 和 H3-Regenerate-2K 模块仍作为托管 API 提供服务。H3-Base 本地部署通过 SGLang 支持,使用四块 GPU 和 Ulysses-degree 并行,但完整的 2K 工作流需要调用封闭模块的 API。
H3 最实用的贡献是将多模型Pipeline压缩为单一上下文。像"参考视频 1 的镜头运动,让图像 2 中的角色唱歌,人声与音频 3 匹配"这样的提示词由一个模型处理,而不是一系列专用系统——这简化了工程实现和创意迭代循环。
H3 2K 输出的上下文内重建方法也值得关注。利用基础模型自身的生成能力恢复细节,而非使用独立的上采样器,这可能影响其他视频生成系统处理分辨率缩放的方式。
开源权重发布——即使有营收上限——也值得关注。自该领域兴起以来,闭源模型一直主导视频生成。H3 是首个具有商业可行性的旗舰模型发布权重,为微调、硬件特定优化和社区实验打开了大门,这些都是封闭 API 无法支持的。
MiniMax H3 是一个技术上一致的设计,用单一统一系统替代了碎片化的专家视频模型生态。架构选择——重建的 VAE、AdaLN 预计算、分离的计算负载、上下文内 2K 重建——每一条都旨在让这种统一变得实用,而非只是概念上吸引人。随着模型扩展和技术报告发布,这一方案能否经受考验值得关注。
权重可在 Hugging Face 的 MiniMaxAI/MiniMax-H3 获取,API 在 platform.minimax.io 正式上线。