MiniMax H3是统一处理文本、图像、视频、音频的多模态生成模型,可输出2K分辨率15秒视频并内置立体声,体现多模态AI的最新进展。
人工智能
MiniMax 发布了 MiniMax H3,这是一款通用多模态生成模型。MiniMax H3 并不是一款通过附加功能扩展而来的文生视频模型。MiniMax 将其定义为通用多模态生成模型:它能够把文本、图像、视频和音频作为统一上下文进行理解,并生成自带原生立体声音频的视频。主要规格包括:支持 2K 输出、时长 4~15 秒,且仅支持整数秒。
以往的视频生成技术栈通常被拆分成文生视频、图生视频、首尾帧生成、主体参考、动作参考和视频编辑等不同任务,每项任务往往都需要一个独立的专家模型。MiniMax H3 将这些能力整合进同一种预训练范式,并通过自然语言描述参考关系和编辑关系。MiniMax 给出的示例 prompt 很能说明这一点:参考视频 1 的镜头运动,让图像 2 中的角色演唱,并让演唱声音与音频 3 保持一致。
目前的情况是:可以通过 API 使用,但不能在自己的硬件上运行。MiniMax 于 2026 年 7 月 31 日发布 H3,该模型已在平台 API 中上线,model ID 为 MiniMax-H3,同时也已登陆面向消费者的 Hailuo AI 应用。
适用行业:MiniMax 将 MiniMax H3 定位于广告、品牌、电商、产品设计、UI/UX 和游戏等领域,同时也适用于电影预演和零售商品目录媒体制作。
应用场景:生成广告变体、制作产品及商品列表视频、动态海报、电影片头、网站首屏循环视频、角色一致的游戏过场动画,以及视频到视频的动作迁移。
视频生成指南记录了三种输入模式:文生视频、首尾帧图生视频,以及参考生成。这些模式共用同一个 endpoint,并采用异步三步流程:创建任务、轮询 task_id、下载 content.url。
设计应用时需要考虑以下输入限制:
参考图像:最多 9 张。参考视频:最多 3 个片段,每个片段 2~15 秒,总时长不超过 15 秒。参考音频:最多 3 个片段,而且音频不能单独发送,必须同时提供图像或视频。
混合输入最多支持 12 个文件。Prompt 长度不超过 7,000 个字符;request body 不超过 64 MB,大型素材建议通过 URL 输入。
单个素材的文件大小限制:视频不超过 50 MB,图像不超过 30 MB,音频不超过 15 MB。
支持格式:H.264/H.265 视频、JPG/PNG/WEBP/HEIC/HEIF 图像,以及 WAV/MP3 音频。
MiniMax 重构了 captioning 系统,使其描述的不再只是目标视频本身,而是上下文与目标视频之间的关系。大多数源素材大约需要 100K tokens 的推理过程,经过蒸馏后平均缩减至约 4K tokens。语言充当了桥梁,把一组固定任务转变成开放且可描述的任务空间。
这是一次完整的 tokenizer 重构。其高压缩比带来了官方所称的 4 倍有效序列长度提升,降低了训练和推理成本,同时也成为实现原生 2K 的关键技术。
MiniMax 明确表示,这里没有沿用 Hailuo-02 的架构。多模态上下文使序列长度的方差扩大至原来的三倍,因此训练架构将理解和生成工作负载分离,并分别优化各自的硬件利用率。官方报告的结果是:端到端训练吞吐量提升了近 30%。
基础模型没有外挂一个超分辨率模块,而是在 context 内重新生成自己的低分辨率输出,同时再次读取最初的多模态上下文。正是这一机制还原了传统 upscaler 只能依靠猜测补全的小型文字和精细细节,因此与品牌视觉和产品渲染尤为相关。
MiniMax 自己宣称:在 2K 分辨率下,H3 的每秒价格不到主流模型的三分之一;在 768p 分辨率下,其价格不到主流 720p 模型的一半。该公司还在 X 上进一步宣传了此次发布及其定价定位(1、2)。第三方追踪平台和发布报道显示,2K 按量付费价格为每秒 0.13 美元,一个 15 秒视频片段约为 1.95 美元。但截至本文撰写时,MiniMax 的按量付费页面仍只列出了 Hailuo 2.3 的价格档位,因此应将这一数字视为媒体报道数据,而非一手官方数据。
关于模型排名:据《南华早报》援引 Artificial Analysis 的数据,H3 在视频编辑方面排名领先;但在文生视频方面落后于 Google 的 Gemini Omni Flash,在图生视频方面则落后于 Seedance 2.0 和 Gemini Omni Flash。
H3 将文本、图像、视频和音频统一到一个生成模型中——支持 2K、4~15 秒视频,并提供原生立体声音频。
官方承诺将在“未来几天内”开放权重,但目前尚未发布;现阶段 API 是唯一的使用途径。
H3-VAE 带来的 4 倍有效序列长度提升,是让原生 2K 在经济成本上具备可行性的关键。
In-Context Regeneration 取代了超分辨率技术,能够保留小型文字和品牌标识。
Artificial Analysis 将 H3 的视频编辑能力评为第一,但其文生视频和图生视频能力仍落后于竞争对手。
欢迎查看技术细节。也欢迎在 Twitter 上关注我们,别忘了加入我们拥有超过 15 万名成员的机器学习 SubReddit,并订阅我们的 Newsletter。等等!你使用 Telegram 吗?现在也可以加入我们的 Telegram。
需要与我们合作,推广你的 GitHub Repo、Hugging Face Page、产品发布或 Webinar 等内容吗?欢迎联系我们。
Asif Razzaq 是 Marktechpost Media Inc. 的 CEO。作为一位富有远见的企业家和工程师,Asif 致力于运用 Artificial Intelligence 的潜力推动社会公益。他最近开展的项目是推出 Artificial Intelligence 媒体平台 Marktechpost。该平台凭借对 machine learning 和 deep learning 新闻的深入报道脱颖而出,其内容既具备可靠的技术基础,也便于广大读者理解。该平台每月浏览量超过 200 万,足以体现其在受众中的受欢迎程度。