前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8629
  • DeepSeek V4 Flash 正式版上线:原生适配 Codex
  • AI 解决 50 年数学难题,AI for Science 再获突破
  • DeepSeek V4-Flash 更新,Pro 版即将发布
  • Cursor Cloud Agent 体验:云端编程不是结对,更像雇了个工程师
  • 语义缓存按含义不按字符串:向量匹配减半 API 调用成本
  • 梯度累积:小显存跑大批量—微批次加权求和一步更新
  • 产品文案流水线进终端:一份 Brief 自动生成 5 平台营销文案
  • 谱聚类:用拉普拉斯特征向量聚类,非凸形状自动展开
  • 思维缓冲库:复用推理模板而非答案—检索、实例化、蒸馏迭代
  • 从 PARC 到 NeXTSTEP:AI Agent GUI 设计思考
  • 多源AI信息聚合搜索引擎
  • AI编码助手浏览器控制协议
  • AI编码助手性能优化框架
  • Windows开发者工具集
  • 12周AI完整入门课程
  • Gemini多模态AI应用案例
  • 本地化AI图像超分模型集成
  • 图序列化对RAG成本精度的影响
  • AI食谱生成器产品开发案例
  • PolyAI 发布音频原生对话模型 Dialog-RSN-1
  • MiniMax H3视频模型:原生立体声与2K分辨率
  • 2026年开源AI正在挑战科技巨头垄断
  • 隐私优先的创意与文档工具开源合集
  • 用 Omnigent 构建安全的多智能体财务工作流
  • OpenAI重磅降价:GPT-5.6 Luna便宜80%
  • AI 芯片竞赛转向金融杠杆时代
  • MiniMax H3新模型发布
  • OpenAI大幅降价官宣:Luna降幅80%
  • Anthropic模型安全漏洞曝露:成功渗透客户系统
  • OpenConnector 开源工具解决 AI Agent 凭证管理
  • Chat SDK 新增 Teams 反应和临时消息支持
  • Vercel AI Gateway 新增实时请求日志分析
  • OpenAI 破获利用 ChatGPT 的国际诈骗团伙
  • Laguna S 2.1在AI Gateway容量扩展10倍
  • Sourcegraph 代码检索工具评估指南
  • Vercel MCP 适配新规范,支持无状态请求
  • GPT-5.6降价技术拆解:蒸馏与自优化驱动
  • AI 模型沙箱逃逸安全事件调查
  • AI生成内容的审美风格特征分析
  • Agent 任务执行路径与性能分析
  • 不该用 LLM 做安全检查的架构思考
  • 多模型路由成本对比:网关 vs 直连
  • AI 对内容平台生态的深层冲击
  • AI 周报:Agent 失控、隐私泄露与成本变化
  • Agent 逃逸与跨客户横向攻击案例
  • RAG 实战:用 AI 搜索企业知识库
  • 2026 对话 AI:从聊天机器人到多轮对话
  • 用向量数据库让AI Bot记住对话,构建有记忆的自主智能体
  • llm CLI 工具 0.32rc2 更新,默认模型升级
  • 云厂商大赢家:Amazon 加码数据中心,投资者持续追捧
  • Apple 推出 iCloud Plus AI 付费层,扩展使用额度
  • 已加载 51 / 8629
7.0
热点
AI SCORE
模型发布2026-07-31 13:04

MiniMax H3视频模型:原生立体声与2K分辨率

dev.to · AI#视频生成#MiniMax
Editor brief · 编辑速览

MiniMax发布H3视频生成模型,支持2K和原生立体声输出,简化了多步骤音视频处理。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

MiniMax H3 vs Seedance 2.0:原生音频 2K 对标测试

MiniMax 最新的视频模型 H3 已在 POST videos/create 上线,模型参数为 "Hailuo-3.0"。它与 MiniMax 其他产品的区别有两点:第一,每次生成都自带原生立体声——无需单独的语音或音乐合成步骤;第二,默认以 24 fps 渲染 2K 分辨率,短边为 1440 像素(16:9 比例为 2560×1440,9:16 比例为 1440×2560)。

H3 是一个通用的多模态模型,而非一组专用模态。同一个端点支持仅传递提示词、起始帧,或一组包含图片、视频和音频的参考素材。请求格式与 Seedance 2.0 一致——直接设置 model、resolution 和 duration 即可。

下面三个视频片段是单个 4 秒运行在各个模式下的实际输出,未做任何编辑。请打开声音——所有三个视频中的音频都由模型生成。

最后一个是直接对标:它复用了我们 Seedance 2.0 omni 演示中的完整图片、视频和音频参考,以及完全相同的提示词,这样 H3 和三个 Seedance 2.0 层级就可以在相同输入上进行评判,而不是在各自独立的演示上。

仅提示词,无参考素材

aspectRatio 在这里需要显式指定,不过 H3 在没有参考素材时默认为 16:9。

Aerial push over jagged sea cliffs at dawn. Waves crash white against black rock far below as mist burns off in the first gold light. A lone seabird crosses frame. Cinematic wide-angle, natural color grade. Crashing surf, wind, and distant gull calls.

浪花声、风声和海鸥叫声都是模型生成的——没有额外添加到音轨中。

起始帧 + 语音

提供一张图片作为起始帧,由提示词驱动后续发生什么。下面的肖像与我们 Seedance 2.0 omni 演示中使用的参考相同,这样两个模型就可以在相同输入上进行比较。

fileID — 起始帧。需要先用 POST /files 上传它。

She looks into the camera, smiles, and says warmly: "You made it — I was starting to think you'd stood me up." Warm bar lights bokeh behind her, subtle handheld drift on the camera. Low jazz and crowd murmur sit under her voice.

在提示词中拼写出说话的台词。H3 从文本渲染发音,所以引用台词并说明它是语音就是给音轨赋予声音的方式。

Omni 参考 — 图片、视频和音频一起

来自 Seedance 2.0 omni 演示的三个相同参考和相同的提示词,通过 H3 运行以进行直接对标。H3 最多接受 9 张图片、3 个视频和 3 个音频片段,总共 12 个文件,每个在提示词中用 @-tag 标记。

@video1 — the scene, rope, and motion to keep. Its face is blurred on purpose: a clear real face in a video reference is rejected by the content filter, and the identity comes from @image1 anyway.

🎧 Play on useapi.net

@audio1 — the speech to drive, about 2 seconds. Together with the portrait above as @image1, that is the full tray.
Replace the woman in @video1 with @image1, keeping the same outdoor scene, rope, and jumping movements. She speaks out loud, clearly saying "Count me jumping" in the voice from @audio1, audible throughout the clip.

这里没有发送 aspectRatio。当附加参考时,H3 默认为 Auto,并自动匹配输入的 9:16 尺寸。

成本和权衡

H3 每秒输出费用为 12 积分,2K 分辨率。视频参考按其自身长度单独计费,按相同速率在生成片段的基础上累加——图片和音频参考每秒不额外收费。

这个额外费用值得计划:将视频参考裁剪至包含所需运动的最短片段,因为不论输出时长如何,其完整长度都会计费。

Seedance 2.0 仍可达 4K,在 480p 和 720p 时每秒成本更低,因此对于大量迭代和最高分辨率仍是更好的选择。H3 是当你需要 2K 分辨率加声音并在单次调用中完成时的首选——原生音频轨道消除了流程中的整个步骤,24 fps 的 1440 分辨率是后期制作工作的实质性不同起点。

详见 POST videos/create 参考,了解每个参数、参考媒体限制和实时试用控制台。

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
PolyAI 发布音频原生对话模型 Dialog-RSN-1
下一篇
2026年开源AI正在挑战科技巨头垄断