实测对比两个模型在百万Token长上下文任务上的准确率和性能差异。为长上下文应用选型提供实测数据参考。
这封 newsletter 是别人转发给你的吗?订阅后即可在收件箱中收到。
今天,Anthropic 发布了一个拥有 100 万 token 上下文窗口的 Claude Sonnet 4 版本。这大约相当于每个 prompt 都能容纳现存《哈利·波特》系列的全部内容。
我们上周获得了抢先体验资格,所以当然要把它好好测试一番。我们主要对 Claude Sonnet 4 进行了三项测试:
长上下文文本分析:我们把两个电影场景藏进 100 万 token 的上下文中,要求 Claude 一次性找出这些场景,并进行详细分析。
长上下文代码分析:我们载入了 Every 内容管理系统的完整代码库(并填充了一些内容,使其达到 100 万 token),要求 Claude 一次性完成四项详细的代码分析任务。
AI Diplomacy:我们让 Claude Sonnet 4 参加 AI Diplomacy,看看它在称霸世界这件事上表现如何。
在文本分析任务中,我们将它与 Google 旗下同样支持 100 万 token 上下文的模型进行了比较——Gemini 2.5 Pro 和 Gemini 2.5 Flash。Claude Sonnet 4 表现不错:总体上速度更快,产生的幻觉也比 Gemini 模型更少。
但它给出的文本分析不够详细,代码分析也不够完整。
下面就是我们在发布首日上手实测后的直观感受。
我们把两个现代电影场景深埋在 90 万词的《福尔摩斯》小说中。场景一:两位表兄弟在 JFK 机场面对悲痛(出自 Jesse Eisenberg 2024 年的电影《A Real Pain》)。场景二:Tom Hanks 在曼哈顿的一场派对上拿走了所有鱼子酱(出自 Nora Ephron 1998 年的电影《You've Got Mail》)。
我们把一个场景藏在第 26,581 行,另一个藏在第 42,245 行。它们分别位于这 90 万词内容的 43% 和 68% 处,而这些悬疑小说正好可以用来干扰模型。三个模型都找到了这两个场景,并进行了正确分析。下面来看看它们的表现对比。
Claude Sonnet 4 飞快地完成了任务,返回答案所用的时间大约只有 Gemini Flash 和 Pro 的一半:
三个模型都对场景做出了准确分析。不过,Gemini Flash 和 Pro 有时会错误地把《A Real Pain》识别成另一部电影。Sonnet 4 从未产生幻觉——它只是拒绝判断影片名称。
Gemini 模型给出的场景分析极其详细。下面摘录了 Flash 对场景中人物互动关系的分析(请注意,这次运行产生了幻觉,把影片名称误判成了《Lady Bird》):
而 Claude 给出的细节就少得多:
Claude 的完整回复始终在 500 词左右——相比之下,Flash 和 Pro 分别给出了 3,372 词和 1,591 词的回答。
结论:如果你需要速度和准确性,Claude 是胜者。如果你想要高质量且细致的分析,Gemini 更值得选择。
成为 Every 的付费订阅者,即可解锁本文,并进一步了解: