Claude 2.1 发布:更长上下文、更强推理
Anthropic 发布 Claude 2.1 显著升级推理能力和上下文窗口,直接影响 LLM 应用开发选型和实现。
Anthropic 发布 Claude 2.1 显著升级推理能力和上下文窗口,直接影响 LLM 应用开发选型和实现。
我们的最新模型 Claude 2.1 现已通过 Console 中的 API 提供,并已用于驱动 claude.ai 的聊天体验。Claude 2.1 在多项面向企业的关键能力上取得了进展,包括业界领先的 200K token 上下文窗口、显著降低模型幻觉率、支持 system prompt,以及全新的 Beta 功能:工具调用(tool use)。我们还更新了定价,以提高客户使用不同模型时的成本效率。
自今年早些时候发布以来,已有数百万人将 Claude 用于各种应用场景——从翻译学术论文,到起草商业计划,再到分析复杂合同。在与用户的交流中,他们希望在处理长文档时获得更大的上下文窗口和更准确的输出。
为此,我们将用户可以传递给 Claude 的信息量扩大了一倍,上限提升至 200,000 token,约合 150,000 个英文单词,或超过 500 页的材料。现在,用户可以上传完整代码库等技术文档、S-1 文件等财务报表,甚至《伊利亚特》或《奥德赛》这样的长篇文学作品。凭借与大规模内容或数据进行交互的能力,Claude 可以完成内容总结、问答、趋势预测、多文档比较与对照等诸多任务。
处理长度达到 200K 的消息是一项复杂的技术突破,也是业界首次实现。我们很高兴将这项强大的新能力交到用户手中,但对于通常需要人类花费数小时才能完成的任务,Claude 可能也需要几分钟。随着技术不断进步,我们预计延迟将大幅降低。
Claude 2.1 在诚实性方面也取得了显著进步:与此前的 Claude 2.0 模型相比,错误陈述减少了 2 倍。这使企业能够构建高性能的 AI 应用,解决具体的业务问题,并以更高的可信度和可靠性在各项业务中部署 AI。
为了测试 Claude 2.1 的诚实性,我们整理了一套大型、复杂的事实性问题集,专门探测当前模型的已知弱点。我们采用了一套评分标准,将错误断言(“玻利维亚人口第五多的城市是蒙特罗”)与承认不确定性(“我不确定玻利维亚人口第五多的城市是哪座”)区分开来。结果显示,Claude 2.1 更倾向于谨慎回避,而不是给出错误信息。
Claude 2.1 在理解和总结能力方面也取得了实质性改进,尤其是在处理法律文件、财务报告和技术规范等篇幅较长、结构复杂且要求高度准确的文档时。在我们的评估中,Claude 2.1 的错误回答减少了 30%,错误判断某份文档支持特定主张的概率降低至原来的四分之一到三分之一。
尽管这些准确性改进令人鼓舞,但提升输出结果的精确性和可靠性,仍然是我们产品与研究团队的首要任务。
应广大用户的要求,我们还增加了工具调用(tool use)。这是一项新的 Beta 功能,允许 Claude 与用户现有的流程、产品和 API 集成。我们希望通过扩展互操作性,让 Claude 在用户的日常工作中发挥更大作用。
Claude 现在可以编排开发者定义的函数或 API、搜索 Web 信息源,以及从私有知识库中检索信息。用户可以定义一组供 Claude 使用的工具,并提出请求。随后,模型会判断完成任务需要使用哪一种工具,并代表用户执行相应操作,例如:
使用计算器进行复杂的数值推理
将自然语言请求转换为结构化 API 调用
通过搜索数据库或使用 Web 搜索 API 回答问题
通过私有 API 在软件中执行简单操作
连接产品数据集,提供推荐并帮助用户完成购买
工具调用目前仍处于早期开发阶段——我们正在构建相关的开发者功能和 prompt 指南,让它更容易集成到应用中。我们鼓励用户分享关于工具调用的反馈,帮助我们塑造并改进这项产品功能。
我们一直在努力简化 Claude API 用户的开发者 Console 体验,同时让新 prompt 的测试更加便捷,从而加快学习和迭代速度。全新的 Workbench 产品让开发者能够在类似 playground 的环境中反复迭代 prompt,并访问新的模型设置,以优化 Claude 的行为。开发者可以创建多个 prompt,在不同项目之间切换使用;系统还会随时保存修订版本,从而保留历史上下文。开发者也可以生成代码片段,直接在我们的某个 SDK 中使用这些 prompt。
我们还推出了 system prompt,让用户可以向 Claude 提供自定义指令,从而提升模型表现。System prompt 能够提供有用的上下文,增强 Claude 扮演指定人格与角色的能力,也可以让回复采用更加可定制、更一致且更符合用户需求的结构。
Claude 2.1 现已通过我们的 API 提供,同时也已用于驱动 claude.ai 上面向免费版和 Pro 版用户的聊天界面。200K token 上下文窗口仅供 Claude Pro 用户使用,他们现在可以上传比以往更大的文件。在我们致力于构建业界最安全、技术最先进的 AI 系统之际,我们迫不及待地想看到这些新功能将催生出哪些应用场景。
探究我们在网络安全评估中遇到的三个真实事件
我们对开放权重模型的立场
Cognizant 与 Anthropic 扩大合作,将 Claude 带给企业客户