MiniMax H3视频模型:原生立体声与2K分辨率
MiniMax发布H3视频生成模型,支持2K和原生立体声输出,简化了多步骤音视频处理。
MiniMax发布H3视频生成模型,支持2K和原生立体声输出,简化了多步骤音视频处理。
MiniMax 最新的视频模型 H3 已在 POST videos/create 上线,模型参数为 "Hailuo-3.0"。它与 MiniMax 其他产品的区别有两点:第一,每次生成都自带原生立体声——无需单独的语音或音乐合成步骤;第二,默认以 24 fps 渲染 2K 分辨率,短边为 1440 像素(16:9 比例为 2560×1440,9:16 比例为 1440×2560)。
H3 是一个通用的多模态模型,而非一组专用模态。同一个端点支持仅传递提示词、起始帧,或一组包含图片、视频和音频的参考素材。请求格式与 Seedance 2.0 一致——直接设置 model、resolution 和 duration 即可。
下面三个视频片段是单个 4 秒运行在各个模式下的实际输出,未做任何编辑。请打开声音——所有三个视频中的音频都由模型生成。
最后一个是直接对标:它复用了我们 Seedance 2.0 omni 演示中的完整图片、视频和音频参考,以及完全相同的提示词,这样 H3 和三个 Seedance 2.0 层级就可以在相同输入上进行评判,而不是在各自独立的演示上。
aspectRatio 在这里需要显式指定,不过 H3 在没有参考素材时默认为 16:9。
Aerial push over jagged sea cliffs at dawn. Waves crash white against black rock far below as mist burns off in the first gold light. A lone seabird crosses frame. Cinematic wide-angle, natural color grade. Crashing surf, wind, and distant gull calls.
浪花声、风声和海鸥叫声都是模型生成的——没有额外添加到音轨中。
提供一张图片作为起始帧,由提示词驱动后续发生什么。下面的肖像与我们 Seedance 2.0 omni 演示中使用的参考相同,这样两个模型就可以在相同输入上进行比较。
fileID — 起始帧。需要先用 POST /files 上传它。
She looks into the camera, smiles, and says warmly: "You made it — I was starting to think you'd stood me up." Warm bar lights bokeh behind her, subtle handheld drift on the camera. Low jazz and crowd murmur sit under her voice.
在提示词中拼写出说话的台词。H3 从文本渲染发音,所以引用台词并说明它是语音就是给音轨赋予声音的方式。
来自 Seedance 2.0 omni 演示的三个相同参考和相同的提示词,通过 H3 运行以进行直接对标。H3 最多接受 9 张图片、3 个视频和 3 个音频片段,总共 12 个文件,每个在提示词中用 @-tag 标记。
@video1 — the scene, rope, and motion to keep. Its face is blurred on purpose: a clear real face in a video reference is rejected by the content filter, and the identity comes from @image1 anyway.
🎧 Play on useapi.net
@audio1 — the speech to drive, about 2 seconds. Together with the portrait above as @image1, that is the full tray.
Replace the woman in @video1 with @image1, keeping the same outdoor scene, rope, and jumping movements. She speaks out loud, clearly saying "Count me jumping" in the voice from @audio1, audible throughout the clip.
这里没有发送 aspectRatio。当附加参考时,H3 默认为 Auto,并自动匹配输入的 9:16 尺寸。
H3 每秒输出费用为 12 积分,2K 分辨率。视频参考按其自身长度单独计费,按相同速率在生成片段的基础上累加——图片和音频参考每秒不额外收费。
这个额外费用值得计划:将视频参考裁剪至包含所需运动的最短片段,因为不论输出时长如何,其完整长度都会计费。
Seedance 2.0 仍可达 4K,在 480p 和 720p 时每秒成本更低,因此对于大量迭代和最高分辨率仍是更好的选择。H3 是当你需要 2K 分辨率加声音并在单次调用中完成时的首选——原生音频轨道消除了流程中的整个步骤,24 fps 的 1440 分辨率是后期制作工作的实质性不同起点。
详见 POST videos/create 参考,了解每个参数、参考媒体限制和实时试用控制台。