Fable 5.1 在 Terminal-Bench-Science 0.1 上从 24.7% 跃升至 52.6%,上下文窗口扩展至 100 万 token,缓存读取费用从 $3.75 降至 $0.25/百万 token,但基础定价不变。另有 3 项 API 变更具有破坏性,包括移除强制工具调用。
Anthropic 发布了 Claude Fable 5.1 和 Claude Mythos 5.1,距离今年六月 Fable 5 系列上市仅三个月。两款模型底层相同,差异在于安全防护层级不同。Fable 5.1 以 claude-fable-5-1 为名全面开放;Mythos 5.1 仅限经过审查的组织使用。两者均支持 100 万 token 上下文窗口、最大 128K 输出 token,自适应思考始终开启。核心能力指标方面,Fable 5.1 在 Terminal-Bench-Science 0.1 上达到 52.6%,而 Fable 5 为 24.7%,Opus 5 为 29.0%。商业层面,缓存读取成本下降 75%,从每百万 token 1.00 美元降至 0.25 美元,Anthropic 测算典型工作负载成本降低约 25%,agentic 场景更高达 45%。基础输入和输出定价维持不变,分别为每百万 token 10 美元和 50 美元。
是的,Claude Fable 5.1 以 claude-fable-5-1 为名在 Claude API、Amazon Bedrock、AWS 上的 Claude Platform、Google Cloud 和 Microsoft Foundry 全面开放。Claude Mythos 5.1 则不然——它仅限于 Project Glasswing 内经过审查的美国组织使用。
在 Terminal-Bench-Science 0.1(一个 agentic 科学研究基准)上,Fable 5.1 得分为 52.6%,对比 Opus 5 的 29.0%、Fable 5 的 24.7% 和 GPT-5.6 Sol 的 22.4%。Anthropic 报告每个模型的标准误差为 3.5 至 4.5 分,因此对待差距数值需谨慎,不要只看排名。
在 Terminal-Bench 4.0 上,Fable 5.1 达到 55.8%,Mythos 5.1 达到 60.9%。两个相同模型之间的差距是安全防护干预的代价,这是一个难得的坦诚披露。其他成绩:CursorBench 3.2.0 为 73.4%,Humanity's Last Exam 无工具为 60.9%、有工具为 65.0%,AutomationBench 为 31.4%,OSWorld 2.0 严格模式为 41.7%,GDPval-AA v2 为 1853。
基础输入和输出定价不变。缓存读取下降 75%,从每百万 token 1.00 美元降至 0.25 美元,即其他所有 Claude 模型的 0.1 基础输入价格的 0.025 倍。Anthropic 测算典型工作负载成本降低约 25%,上下文密集的 agentic 工作负载更高达约 45%。批量处理为每百万 token 5 美元和 25 美元。
强制工具使用已取消:tool_choice 设置为 any 或 tool 返回 400。请改用 auto 配合 strict tool use 或 structured outputs。
思考块绑定到模型:Fable 5.1 可以读取早期模型的 thinking,但早期模型无法读取 Fable 5.1 自身的 thinking。路由器和回退设置在降级时会丢失 reasoning。
编辑早期回合会使 thinking 块失效:在对话中注入和删除每轮提醒,或重建 system 或 tools 数组,现已报错。此检查适用于 2026 年 8 月 31 日或之后创建的账户。修复方法是使用轮次作用域的系统消息和服务端上下文编辑。
累加性变更:per-message effort、轮次作用域的系统消息和 thinking.display: "updates" 均通过标头处于 beta 状态。内容溯源不可省略,所有输出均有统计文本水印,文件附带 C2PA 凭证。
Anthropic 也记录了真实的回归问题。并行工具调用变异性更大,因此 agent 循环可能每轮只发出一条调用,而 Fable 5 会批量发送多条。模型叙述减少,低 effort 时更频繁地凭记忆回答,且倾向于整文件重写而非针对性编辑。
网络安全防护现在允许漏洞发现但不允许漏洞利用开发,使 Claude Code 每次会话的干预次数减少约 60%。生物安全防护在良性请求上触发频率降低 85%。渗透测试、漏洞利用生成和基于二进制的漏洞扫描仍重定向到 Opus。
在研究方面:Mythos 5.1 设计的蛋白质结合剂在 12 个靶点上达到约 50% 命中率,而通常仅为 10% 至 15%;Fable 5.1 构建了金星高程图,分辨率为 2 至 3 公里;定制 GPU 内核使 7 个开源基因组学模型加速高达 2.5 倍。
Fable 5.1 和 Mythos 5.1 是同一模型加两层安全防护;只有 Fable 全面开放。
Terminal-Bench-Science 0.1 上达到 52.6%,约为 Fable 5 的 24.7% 的两倍。
缓存读取降至每百万 0.25 美元,降幅 75%;基础费率不变。
三个破坏性 API 变更影响任何编辑对话历史的 agent。
保留期为 30 天;零数据保留需要明确授权。