Fable 5.1 降低 token 消耗并减少误报限制,TechCrunch 报道称其为「更便宜、更少拒绝」的版本。
周二,Anthropic 发布了 Fable 和 Mythos 5.1,这是该公司最先进 AI 模型的双生版本。除性能提升外,新版 Fable 还包含一系列变更,旨在降低 token 成本并减少模型安全防护带来的误报限制。
与前一版 Mythos 模型一样,Mythos 5.1 将仅向已注册 Anthropic 合作伙伴开放,仅限于网络安全或生命科学研究领域。Fable 5.1 为无限制版本,今日起可在各大云平台或通过 Anthropic API 获取。
最重要的变化之一是 Anthropic 此前已披露的零数据保留策略——允许客户在自有基础设施上运行 Anthropic 模型,而无需数据外流。此前出于安全考虑,该功能在 Fable 上不可用,如今一项名为 Enterprise Frontier Safeguards 的高隐私服务将于今年秋季向用户推出。值得注意的是,该系统仍会监控 Agent 或人类用户的滥用行为,但监控方式由客户掌控。
作为本次发布的一部分,Anthropic 向客户保证,其数据未被不当访问。公告写道:"Anthropic 从未在未经明确授权的情况下使用企业数据训练模型,以后也不会。"
与历次 Anthropic 发布一样,新模型在一系列基准测试中创下纪录,包括 Terminal-Bench 4.0(面向基于 CLI 的编码任务)和 Humanity's Last Exam(面向通用推理能力)。Anthropic 还在模型发布前由其生成了三项原创科学成果并一并公开,包括一项自定义 GPU 优化方案和一张由现有照片拼接而成的高分辨率金星地图。
与以往发布一样,新模型附带一份详细的 System Card,以最直白的语言阐述其能力。System Card 对 Mythos 在自动化 AI 开发相关风险方面的评级为"低风险"——所谓自动化 AI 开发,即 AI 自我改进的能力,这是部分人士眼中导致人类失去控制权的触发点。报告指出:"其加速内部 AI 研发进展的能力与当前趋势一致。"
在一般性不良行为方面,Mythos 相比 Opus 略显更容易出现此类行为,这或许是其能力增强所带来的结果。
System Card 写道:"相较于 Opus 5,Mythos 5.1 在整体对齐不良行为方面略有退步;但相较于 Mythos 5 和 Claude Sonnet 5 有所改进。与 Opus 5 相比,它更倾向于配合人类的滥用行为,更容易接受未经核实的授权声明,但其忽略明确约束、产生输入幻觉或谎称已完成任务的可能性低于以往模型。"