三个视频生成模型在输入格式、生成时长、分辨率、音频支持等工程维度进行对比,并提供可复现的测试方案。
从演示片段选择 AI 视频模型是一个糟糕的工程决策。生产团队需要了解模型接受哪些输入、能保持多长时间的连续性、如何计费,以及在输出可用之前需要尝试多少次。
Seedance 2.5、MiniMax H3 和 Wan 3.0 现都已上线 AIHubMix。这使得用一个 API key 和通用的异步任务工作流来评估这三个模型成为可能。
本文对比已确认的产品能力,并提出一个可重复的测试计划。由于没有通用的公开盲测基准覆盖所有三个模型,本文不会宣称某个模型的视觉质量全面胜出。
有一个规格需要特别注意:第三方页面经常将 Seedance 2.5 描述为 4K 模型,但 ByteDance Seed 于 7 月 31 日发布的文章并未声明输出分辨率。在活跃 API 文档确认前,请将分辨率视为平台相关参数。
Wan 3.0 是灵活的生产选项。它支持单次生成最长 30 秒,AIHubMix 提供 480p、720p 和 1080p 三个输出档位。
更广泛的 Wan 3.0 工作流支持文本、图片、音频和视频参考源,以及结构化来源如文档、电子表格、演示文稿、PDF 和网页。当生成内容需要基于产品文档或现有品牌页面时,这非常有用。
优先选择 Wan 3.0 的场景:
需要测试的主要失败模式是长时连续性。30 秒的 prompt 应描述一个时间序列、相机路径和明确的连续性约束。
MiniMax H3 可生成最长 15 秒的原生 2K 视频,带立体声音频。MiniMax 强调指令遵循、准确的文字和品牌渲染、基于参考的编辑,以及视频到视频的运动迁移。
优先选择 MiniMax H3 的场景:
其工程权衡在于时长。对于更长的叙事,将每次 H3 生成视为一个镜头,然后在外部编辑器中组装序列。
Seedance 2.5 可生成最长 30 秒的音画同步视频,支持多轮扩展。其官方发布材料侧重于故事结构、转场、多模态参考和生成后控制。
单次请求可使用最多 30 张图片、10 个视频片段和 10 个音频片段。该模型还支持时间戳级指令,以及针对角色、动作、相机视角和绿幕背景的定向编辑。
优先选择 Seedance 2.5 的场景:
参考源数量不等于控制能力。每个资产都应有一个明确的用途,比如角色身份、地点、相机运动或声音。
三个当前模型 ID 为:
wan3.0-video
minimax-h3
doubao-seedance-2-5-260628
AIHubMix 文档记录了异步视频工作流。提交任务前需为账户启用 Async Tasks。
curl -X POST https://aihubmix.com/ai/v1/videos \
-H "Authorization: Bearer $AIHUBMIX_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "wan3.0-video",
"prompt": "A controlled product shot with one slow camera orbit",
"resolution": "720p"
}'
保存返回的 task ID,轮询任务端点,然后下载完成的产物。
curl https://aihubmix.com/ai/v1/tasks/{task_id} \
-H "Authorization: Bearer $AIHUBMIX_API_KEY"
curl https://aihubmix.com/ai/v1/tasks/{task_id}/content \
-H "Authorization: Bearer $AIHUBMIX_API_KEY" \
--output result.mp4
模型特定参数可能不同。更改 model 值对初始测试框架有用,但在将请求 schema 视为相同之前,请在各模型实时页面上验证支持的时长、分辨率和参考字段。
价格于 2026 年 8 月 8 日核查:
两个 Seedance 费率是替代计费路径,不是叠加收费。显示的视频输入费率较低这一点可能令人困惑,而且发布日模型页面在输入模态标签和视频参考定价之间存在一些歧义。在估算生产量之前,先用一个小任务确认实际计量用量。
不要直接将 Seedance 的按 token 数值与按秒价格进行对比。收集实际任务用量后再做标准化比较。
对每个模型使用相同的三个简报。
测试 A:角色连续性
提供一个角色参考。要求一个转身、一个手部互动和一个相机移动。按时间评分面部身份、服装、手部、运动和声音。
测试 B:产品保真度
提供一个产品参考。要求一个特写和一个环绕镜头。评分轮廓、logo、小文字、材质、反光,以及不必要的重新设计。
测试 C:时间指令遵循
定义三个动作和两个带明确时序的相机转场。评分事件顺序、转场质量、主体连续性和音画同步。
为每个任务持久化这些字段:
{
"model": "minimax-h3",
"brief_id": "product-orbit-v1",
"attempt": 1,
"duration_seconds": 10,
"resolution": "2k",
"latency_seconds": 0,
"billed_cost_usd": 0,
"usable": false,
"repair_minutes": 0,
"failure_labels": []
}
关键指标不是每次生成的价格,而是:
可用结果单次成本 = 总生成成本 / 接受的输出数量
单独追踪人工修复时间。廉价模型如果需要反复生成和后期制作,可能比标称价格更高的模型花费更多。
当时长、基于分辨率的成本控制和广泛的源内容基础是主要需求时,选择 Wan 3.0。
当交付物是带有原生声音、文字或品牌细节的短 2K 商业镜头时,选择 MiniMax H3。
当叙事结构、多个参考源、续写和定向编辑比简单请求 schema 更重要时,选择 Seedance 2.5。
由于三个模型现在都在 AIHubMix 上,最安全的选型流程是使用相同的简报、验收标准和成本核算进行 API 级 A/B 测试。
MiniMax H3 官方发布
AIHubMix 上的 MiniMax H3
Seedance 2.5 官方发布
AIHubMix 上的 Seedance 2.5
能力和价格于 2026 年 8 月 8 日核查。生产使用前请验证实时文档。