Claude 3.5 Sonnet:官方版本发布
Anthropic 官方发布 Claude 3.5 Sonnet,性能、速度、成本均有突破性改进,是重要模型迭代。
Anthropic 官方发布 Claude 3.5 Sonnet,性能、速度、成本均有突破性改进,是重要模型迭代。
今天,我们推出 Claude 3.5 Sonnet——这是即将推出的 Claude 3.5 模型系列中的首个版本。Claude 3.5 Sonnet 在智能能力上树立了行业新标杆,在众多评估中优于竞争对手模型和 Claude 3 Opus,同时保持了我们中端模型 Claude 3 Sonnet 的速度和成本优势。
Claude 3.5 Sonnet 现已在 Claude.ai 和 Claude iOS 应用中免费提供,Claude Pro 和团队计划订阅者可以以更高的速率限制访问它。它也可以通过 Anthropic API、Amazon Bedrock 和 Google Cloud 的 Vertex AI 获得。该模型的定价为每百万输入令牌 3 美元,每百万输出令牌 15 美元,具有 200K 令牌的上下文窗口。
Claude 3.5 Sonnet 在研究生级推理 (GPQA)、本科级知识 (MMLU) 和编码能力 (HumanEval) 方面创造了新的行业基准。它在理解细微差别、幽默和复杂指令方面有显著提升,并在以自然、贴近生活的语气撰写高质量内容方面表现出色。
Claude 3.5 Sonnet 的运行速度是 Claude 3 Opus 的两倍。这种性能提升结合具有竞争力的定价,使 Claude 3.5 Sonnet 非常适合复杂任务,如上下文感知的客户支持和多步骤工作流编排。
在内部 Agent 编码评估中,Claude 3.5 Sonnet 解决了 64% 的问题,而 Claude 3 Opus 解决了 38%。我们的评估测试了模型在给定自然语言描述的所需改进的情况下,修复开源代码库中的 bug 或添加功能的能力。当被指示并提供相关工具时,Claude 3.5 Sonnet 可以独立地编写、编辑和执行代码,具有复杂的推理和故障排除能力。它可以轻松处理代码转换,特别适合更新遗留应用和迁移代码库。
Claude 3.5 Sonnet 是我们迄今为止最强大的视觉模型,在标准视觉基准上超越了 Claude 3 Opus。这些突破性改进在需要视觉推理的任务中最为明显,如解释图表和图形。Claude 3.5 Sonnet 也能够准确地从不完美的图像中转录文本——这是零售、物流和金融服务领域的核心能力,AI 可能从图像、图形或插图中获得比纯文本更多的洞察。
今天,我们还在 Claude.ai 上推出了 Artifacts,一个扩展用户与 Claude 互动方式的新功能。当用户要求 Claude 生成代码片段、文本文档或网站设计等内容时,这些 Artifacts 会在与对话相邻的专用窗口中显示。这创建了一个动态工作区,用户可以在其中实时查看、编辑和完善 Claude 的创作,将 AI 生成的内容无缝整合到他们的项目和工作流中。
这个预览功能标志着 Claude 从对话式 AI 向协作工作环境的演进。这只是对 Claude.ai 更广阔愿景的开始,它很快将扩展以支持团队协作。在不久的将来,团队甚至整个组织将能够在一个共享空间中安全地集中他们的知识、文档和进行中的工作,Claude 作为随时待命的团队成员。
我们的模型经受了严格的测试,并已被训练以减少滥用。尽管 Claude 3.5 Sonnet 的智能水平有了飞跃,但我们的红队评估得出结论,Claude 3.5 Sonnet 仍保持在 ASL-2。更多详情可在模型卡补充文档中找到。
作为我们对安全和透明度承诺的一部分,我们与外部专家合作,测试和完善这个最新模型中的安全机制。我们最近向英国人工智能安全研究所 (UK AISI) 提供了 Claude 3.5 Sonnet,用于部署前安全评估。英国 AISI 完成了对 3.5 Sonnet 的测试,并根据谅解备忘录与美国 AI 安全研究所 (US AISI) 分享了他们的结果,这是今年早些时候宣布的美国和英国 AISI 之间合作的产物。
我们已整合来自外部主题专家的政策反馈,以确保我们的评估是稳健的,并考虑了滥用的新趋势。这种合作帮助我们的团队扩展了评估 3.5 Sonnet 对各种类型滥用的能力。例如,我们使用来自儿童安全专家 Thorn 的反馈来更新我们的分类器并微调我们的模型。
指导我们 AI 模型开发的一个核心宪法原则是隐私。我们不在用户提交的数据上训练我们的生成模型,除非用户明确允许我们这样做。
我们的目标是每几个月就大幅改进智能、速度和成本之间的权衡曲线。为了完成 Claude 3.5 模型系列,我们将在今年晚些时候发布 Claude 3.5 Haiku 和 Claude 3.5 Opus。
除了开发下一代模型系列外,我们还在开发新的模态和功能以支持企业的更多使用案例,包括与企业应用的集成。我们的团队也在探索 Memory 等功能,这将使 Claude 能够记住用户的偏好和交互历史记录(如用户所指定的),使他们的体验更加个性化和高效。
我们不断努力改进 Claude,并很乐意听到来自用户的反馈。您可以直接在产品中提交关于 Claude 3.5 Sonnet 的反馈,以告知我们的开发路线图,帮助我们的团队改进您的体验。一如既往,我们期待看到您用 Claude 构建、创建和发现的一切。
Investigating three real-world incidents in our cybersecurity evaluations
Our position on open-weights models
Cognizant and Anthropic expand their partnership to bring Claude to enterprise clients