Fable 5.1 发布,Terminal-Bench-Science 分数翻倍,Agent 编程任务提升超 30%,长链自主任务成本大降 45%;同场发布 Mythos 5.1。
Anthropic 发布了两个新模型:Claude Fable 5.1 和 Mythos 5.1,在编程性能和文本质量上都有显著提升。
缓存读取成本大幅降低,整体节省约 25%,复杂 Agent 工作流最高可节省 45%。
Fable 5.1 在 Agent 基准测试中优于前代 Fable 5 和竞品 GPT-5.6 Sol。目前已上线。
参与预发布测试的 Artificial Analysis 对这一成本节省声明提出质疑。虽然缓存读取优惠每项 Agent 任务节省约 1.40 美元,但 Fable 5.1 在全力模式下每任务成本实际上比 Fable 5 高出 20%,因为它消耗的输出 Token 大约是后者的 1.7 倍。在全力模式下,Fable 5.1 每项 Intelligence Index 任务运行成本为 3.76 美元,而 Opus 5 仅为 2.34 美元,后者得分仅低 3 分。在超高努力水平下,Fable 5.1 得分为 65,每任务成本 2.72 美元,缩小了差距但仍高于 Opus 5。
Anthropic 推出 Claude Fable 5.1 和 Mythos 5.1,这是迄今为止最强大的 AI 模型。除在 Agent 编程和文本质量上的提升外,公司还将成本最高降低了 45%。
与前辈一样,两个 5.1 模型共享同一基座模型,但安全护栏有所不同。Fable 5.1 向公众广泛开放,而 Mythos 5.1 仅限网络安全和生命科学领域的特殊访问计划使用。
它们也是首批内置水印的 Claude 模型。Anthropic 正在以私下预览形式推出检测 API,允许监管机构、媒体机构、事实核查机构和研究机构验证文本是否包含水印。公司计划逐步扩大访问范围,有兴趣的相关方可以在此处注册。
Fable 5.1 典型工作负载成本比 Fable 5 低约 25%,在涉及长时间自主运行和大量工具调用的重度 Agent 任务中,节省幅度攀升至约 45%。Anthropic 能做到这一点,是因为将缓存读取价格从每百万 Token 1 美元降至 0.25 美元。所有其他 API 价格保持不变:每百万输入 Token 10 美元,每百万输出 Token 50 美元。作为对比,Opus 5 的价格为每百万输入 5 美元、输出 25 美元,仅为一半。
成本过高是 Fable 5 最大的槽点,这可能也是该模型在企业客户中采用率较低的原因。价格压力自 Opus 5 于 7 月底发布以来一直在累积——后者已在大多数基准测试中追上或超越 Fable 5,同时价格更低。与早期 Claude 模型一样,新版本配备了控制计算使用量的努力级别系统。在低或中等努力级别下,Fable 5.1 应该能以更低成本达到与 Fable 5 相同的结果。
Fable 5.1 在 Agent 基准测试中取得重大进步。在 Terminal-Bench-Science 0.1 上,该模型达到 52.6%,是 Fable 5 的 24.7% 的两倍多,远超 GPT-5.6 Sol 的 22.4%。在 Agent 编程基准 Terminal-Bench 4.0 上,Fable 5.1 得分为 55.8%,Mythos 5.1 达到 60.9%,而 Fable 5 为 42.0%,GPT-5.6 Sol 为 37.3%。这些提升能否以同等规模转化为实际使用,将在接下来几周内见分晓。
Anthropic 研究员 Felix Rieseberg 表示,Fable 5.1 在写作风格上也有所改进。早期模型在对话中过度依赖列表和粗体文字,Fable 5.1 削弱了这一点,同时更严格地遵循风格指令,整体听起来更自然。
Fable 5.1 在 Artificial Analysis Intelligence Index 上以 66 分登顶,领先于 Claude Opus 5 的 63 分和 GPT-5.6 Sol 的 61 分。| 图片来源:Artificial Analysis

网络安全、生物学和医疗问题的安全过滤器比早期版本不那么激进了。在 5.0 模型中,这些过滤器过于敏感,甚至会误触发善意请求,产生令人沮丧的高误报率。
5.1 版本的网络安全过滤器产生的误报减少了 60%,在生物学相关查询中,关于基础生物学和医学的无害问题触发过滤器的频率降低了 85%。
Fable 5.1 现在首次能够识别软件漏洞,但不会开发漏洞利用。渗透测试和漏洞利用生成仍会路由到 Opus 模型。Mythos 也作为防御性工具加入 Claude Security。
Claude Fable 5.1 在所有平台上立即可用,包括 AWS、Google Cloud 和 Microsoft Azure。开发者可以通过 API 使用 claude-fable-5-1 访问它。对于企业客户,Anthropic 正在推出 Enterprise Frontier Safeguards(EFS),该服务将客户数据仅存储在客户自己的云基础设施上。
Claude Mythos 5.1 目前仅通过两个项目向美国组织开放:用于防御性安全工作的 Cyber Verification Program,以及与美国政府合作开发的 Life Sciences Verification Program。Anthropic 计划向国际合作伙伴扩展访问。
Anthropic 还在打击蒸馏攻击——即通过数千个虚假账户系统性地提取模型能力。新建 API 账户在多轮对话中不能再编辑 Claude 的先前上下文,同时保留思维记录文本,这据 Anthropic 称关闭了一种已记录在案的蒸馏技术。