Claude Fable 5 与 GPT-5.6 视频生成对标
两个模型在 AI 视频生成上的能力对比。有趣的模型实测,但对通用程序员的直接实用价值有限。
两个模型在 AI 视频生成上的能力对比。有趣的模型实测,但对通用程序员的直接实用价值有限。
我们建立了一个小型 agentic 系统,它只有一个目标:给一个模型提供一首歌、一个硬性预算和一套工具,然后放手让它自己生成完整的音乐视频。这个模型会研究有哪些视频模型存在,生成视频片段,观看自己生成的素材,用 ffmpeg 编辑,最后组装成最终成品。
我们之前构建测试的一些读者说他们想看工具使用在模型之间的实际差异,所以我们给前沿级别的模型一个开放式的长期任务,让每个模型自己决定研究什么、生成什么、如何编辑。我们记录了每次工具调用,所以你可以看到每个模型具体是怎样工作的(完整的转录在下面)。
我们运行了两个模型,Claude Fable 5 和 GPT-5.6 Sol,各在两个预算下运行($25 和 $100),总共四次运行。每次运行获得相同的歌曲(Bruno Mars 和 Mark Ronson 的《Uptown Funk》)、简短的文字描述和一份带时间戳的歌词转录。
每个模型运行了一个自主的工具调用循环,包含六个工具:
plan: 用于思考的工具(无成本,无实际操作)。
web_search: 用于研究生成模型及其 API,获取关于音乐视频的信息(如需要)。
get_budget: 检查剩余预算。
generate_image 和 generate_video: 仅有的花费预算的工具。模型可以选择任何 FAL 或 Replicate 模型并传入自己的参数。
run_command: 一个本地 shell,配备 ffmpeg/ffprobe,用于分析音频、截取和连接片段、以及混音最终视频。
一旦预算达到零,付费生成就被拒绝,但模型可以继续编辑。每条模型消息、每次工具调用、每次费用和错误都被记录。整个系统是开源的,网址在 github.com/hershalb/music-video-arena,你可以自己运行它。
下面每个片段都是模型最终自己组装的 output.mp4,完整长度,原歌曲已混音。
所有四次运行都自己完成(没有一个触发步骤或时间限制),都生成了有效的、完整长度的视频,并且原歌曲已混音。
"生成成本"是计费的 FAL 费用,这是预算的上限。在 $25 时两个模型几乎用完了预算。在 $100 时它们分别花了 $36.57(Sol)和 $48.60(Fable),所以更大的预算确实转化为更多素材。这不包括运行模型本身的成本,我们下面会加上。
让模型自己选择工具后,它们的选择发散了。四次运行中有三次选择了纯文本转视频。只有 GPT-5.6 Sol 在 $25 预算下使用了图像转视频的流程(先生成静止图像,然后让它们动起来)。GPT-5.6 Sol 在 $100 预算下在单次运行中混合了三个不同的视频模型。
价格是 FAL 的标价,除非特别说明,按输出视频秒数显示。Hailuo 2.3 Standard 按视频计价(大约每 6 秒片段 $0.28),Seedance 1.0 Pro 按 token 计价(约每 5 秒 1080p 片段 $0.62,上面显示为其有效的每秒费率)。每次运行生成的不同片段数从 46 到 80 不等。
每次运行的完整转录,包括每个计划、工具调用和命令,都在这里:Fable 5 · $25, Sol · $25, Sol · $100, Fable 5 · $100。
"失败调用"是返回错误的生成请求(大多数是提供商的临时网络故障)。它们没有被计费,但模型花费步骤重试它们。
预算仅计费生成(FAL)成本。加上 Claude Fable 5 的 LLM token 成本(每百万 token 输入/输出 $10/$50)和 GPT-5.6 Sol 的($5/$30),就是每次运行的总成本。
对于 Claude Fable 5,仅 token 成本就运行了 $16.99 到 $25.05,约为每次运行总成本的 30-40%。GPT-5.6 Sol 的 token 成本尽管 token 量相似,但保持在接近 $3-4。
挂钟时间包括模型自己的重试和任何等待提供商队列的时间。
生成成本是从模型价格表最好的估计。
这个竞技场是开源的:github.com/hershalb/music-video-arena。把它指向你自己的歌曲和预算,替换成你想要进行对比的任何模型,看看它们会构建什么。欢迎提交 issue 和 PR,我们很乐意收到关于这个设置的反馈。
这些音乐视频都不是很好,但观察模型如何到达那里还是很有意思的,确实显示了前沿级别的模型仍然存在明显的差距。一些注意事项:
角色和故事连贯性对所有四个都是个挑战。重复出现的角色在镜头之间会漂移,没有一个视频从头到尾保持连贯的故事线。
模型理解歌词过于字面。"Make a dragon wanna retire, man"会让屏幕上出现一条真正的龙。前几个镜头还挺有趣,但用了一会儿之后就有点奇怪了。
节奏匹配很弱。剪切落在节拍上(它们都运行了 ffmpeg 节拍检测),但视频片段内的运动、舞蹈、摄像机移动,很少与歌曲的节奏匹配,所以经常感觉有点不对劲。一个例子是"gotta kiss myself I'm so pretty"这一行,主角的接吻动作太慢了。
GPT-5.6 Sol 在 $25 预算下是最有创意的编辑。它叠加了文本,用视频效果动画化静止图像,这些技巧其他任何运行都没有尝试过。其余的大多数只是把生成的片段拼接在一起。GPT-5.6 Sol $100 也尝试了多个视频模型,而不是像 Fable 那样坚持只用一个。
没有人真正迭代编辑。一旦片段存在,模型会连接和混音,但很少回过头来重新剪切或添加效果,也没有人认真地审视自己的片段以确认它们有多好。GPT-5.6 Sol 的 $100 运行提交了一些真正低质量的 AI 片段,而 Claude Fable 5 碰巧选了一个输出更连贯的模型。这部分可能是模型的限制,但缺乏自我审视值得注意。
没有任何模型使用 Replicate。FAL 和 Replicate 的 key 都可用,但所有四次运行都仅使用 FAL。
Claude Fable 5 是更昂贵的选择。尽管它完成得比 GPT-5.6 Sol 快,但每次运行的成本更高(总体最高,$73.65),GPT-5.6 Sol 的总成本是 $39.93 + $52.54 = $92.47。从主观上讲,我们稍微偏好 Fable $100 的视频,尽管没有一个给我们留下深刻印象。
$100 的预算可能太多了。两个模型都不想花到上限附近,都保持了较少的步骤数。有了这个调度空间,它们本可以,例如,提前生成一致的角色图像并从中进行动画处理,但都没有选择这样做。
随着模型继续变得更聪明,我们会看到模型是否能在更多主观/风格化的任务上改进,但目前仍然有很大的改进空间。
这里提到的每个模型都可以在 TryAI 上用一个账户获得,按量付费,无需订阅。