Anthropic发布Claude 3.5 Sonnet,推理和编码基准测试超越前旗舰Opus,速度提升2倍,定价与前代Sonnet相同($3/M输入/$15/M输出),200K上下文。
Anthropic 刚刚发布了 Claude 3.5 Sonnet,关键结论很简单:这款中档模型如今在关键推理和编程基准测试中,已经超越了他们上一代旗舰 Opus。这不是一次例行的版本迭代,而是成本-性能曲线的一次转变,使得 Sonnet 3.5 成为大多数生产级 AI 工作的实际选择,尤其适用于 Agent 驱动的编程任务。
Claude 3.5 Sonnet 是全新 3.5 系列的首个版本。它比 Claude 3 Opus 拥有更高的智能水平,但定价却与上一代能力较弱的 Sonnet 模型持平。具体来说,每百万输入 token 3 美元,每百万输出 token 15 美元,上下文窗口达 200K token。目前已通过 Anthropic API、 Amazon Bedrock 和 Google Cloud Vertex AI 对外提供。
性能提升在各个维度都非常显著。Anthropic 报告了在研究生水平推理(GPQA)、本科水平知识(MMLU)以及编程能力(HumanEval)方面的新一代行业基准。该模型运行速度是 Claude 3 Opus 的两倍,这对于任何实时或交互式应用来说都是重要的考量因素。
对于构建 AI 系统的工程师而言,最重要的指标往往是编程能力。这正是 Sonnet 3.5 展现出最显著提升的地方。在一次内部 agentic 编程评估中,Claude 3.5 Sonnet 解决了 64% 的问题,相比 Claude 3 Opus 的 38% 解决率实现了巨大飞跃。
这项评估衡量的是模型仅凭自然语言描述,对开源代码库进行 bug 修复或功能添加的能力。模型需要编写、编辑并执行代码,展现出复杂的推理能力。这不仅仅是生成样板代码,而是模型处理代码翻译、更新遗留应用、以及有效迁移代码库的能力。
在这种任务上达到 64% 的成功率,意味着该模型正在成为一个真正有用的结对编程工具,在某些场景下甚至可以成为特定开发工作流中的可行自主 Agent。将这一性能表现与 Sonnet 更低的成本和更高的速度相结合,使其成为构建编程 Agent 的默认选择。
API 的使用方式一如既往地简洁。如果你已经在使用 Messages API,只需更改模型名称即可。
import anthropic
client = anthropic.Anthropic(
# defaults to os.environ.get("ANTHROPIC_API_KEY")
api_key="your-api-key",
)
message = client.messages.create(
model="claude-3-5-sonnet-20240620",
max_tokens=4096,
messages=[
{
"role": "user",
"content": "Given the following Python file, add a function to calculate the Fibonacci sequence up to n.",
}
],
)
print(message.content)
除了代码能力,Claude 3.5 Sonnet 如今已是 Anthropic 最强的视觉模型。它在标准视觉基准测试中超越了 Opus,尤其在需要视觉推理的任务上表现突出,例如解读图表和图形。
其中一个核心能力是它能够从质量不佳的图像中准确转录文本。这在零售、物流和金融等行业有直接应用场景——这些行业的系统通常需要从文档、标签或产品的照片中提取结构化数据。这方面的提升是质的飞跃,而非渐进式的微调。
对于构建者而言,Claude 3.5 Sonnet 的发布改变了模型选择的逻辑。以前,你必须在成本、速度和智能之间做出艰难的权衡——最具能力的模型往往太慢或太贵,难以大规模用于生产。现在,中档模型比上一代旗舰更快、更便宜、也更智能。
这使得复杂的、多步骤的工作流以及对上下文敏感的 agentic 系统在经济上变得更加可行。「必须使用最大可用的模型才能完成重要工作」这一假设已经正式过时。对于当前任何基于 LLM 进行构建的团队来说,Sonnet 3.5 应该是新的评估起点。