Fable 5.1 全面提升任务处理能力,新增反蒸馏机制,价格最高降幅达 45%,Claude 全系能力再进化。
无论你此前让 Claude 处理什么任务,Fable 5.1 都能做更多,并且把最难的部分完成得更出色
梦晨 发自 凹非寺量子位 | 公众号 QbitAI
刚刚,Fable 5.1 和 Mythos 5.1 发布!
8 项公开基准测试全部第一,价格最高降 45%。
尤其是在科学研究和代码这两项上,明显甩开了 Fable 5 和隔壁 GPT-5.6 Sol。

换个更直观的视角,现在用中、低推理程度跑 Fable 5.1,表现基本相当于老版 Mythos 5 开到极高甚至最高推理程度。
这一波属于是"牢 Fable"干掉了"Mythos 圣"。

价格方面,Fable 5.1 把缓存读取价格降至每百万 token 0.25 美元,降幅 75%。
输入和输出价格与 Fable 5 一致,分别为每百万 token 10 美元和 50 美元。
看着好像只降了一项价格,但实际影响比较大,因为在智能体任务里,缓存读取占了成本的大头。
Anthropic 给出的数据是,典型工作负载成本比 Fable 5 降了大约 25%,如果是高度智能体化的任务,最多能省到 45%。

之所以能够做到这点,是因为它擅长处理多步骤任务。
这类任务中,假如第二步就出现一个微小错误,到第 40 步全盘就崩了,而 Fable 5.1 能够全程稳定输出。
如果遇到解决不了的难题,它会告诉你已经尝试过哪些方案、卡在了哪个环节。
研究员 Flix Rieseberg 还特别提到,写作方面 Fable 5.1 减少使用粗体,也更少使用标题、列表或引号,对风格提示词遵循得更好。
咱就是说,能不能顺便把您的风格提示词开源一下。

还是老规矩,Fable 5.1 面向所有用户开放,Mythos 5.1 仅通过受信访问计划提供给经过审核的网络安全和生命科学机构。
跑分之外,Anthropic 还展示了 Fable 5.1 和 Mythos 5.1 在科研领域的实战成果。
蛋白质设计方面,Anthropic 让 Mythos 5.1 使用开源蛋白质设计和折叠工具设计高亲和力结合蛋白,并将方案送至两家外部机构做实验验证。
在三个靶标上,Mythos 5.1 设计的结合亲和力是 Adaptyv Bio 蛋白质设计竞赛最佳方案的 10 倍。在全部 12 个靶标上,命中率接近 50%,而当前蛋白质设计领域的典型命中率在 10% 到 15% 之间。
高亲和力结合蛋白是许多常见药物开发流程中的第一步,直接决定了药物能否在较低剂量下发挥作用。
天文学方面,Fable 5.1 基于 NASA 麦哲伦号 30 多年前拍摄的雷达图像训练了一个神经网络,为金星三分之一的表面生成了新的高分辨率地形图。
此前已有的地形图仅覆盖金星五分之一的面积,分辨率在 10 到 20 公里之间。Fable 5.1 把分辨率提升到了 2 至 3 公里,高度精度比此前提高了 25%。这份地图已以 CC 协议开源发布,供即将到来的 NASA VERITAS 和 ESA EnVision 任务参考,帮助确定未来观测的重点地质特征。

计算生物学方面,Mythos 5.1 通过编写自定义 GPU 内核并缓存中间结果,将 7 个开源深度学习模型的运行速度提升了最高 2.5 倍,输出完全一致。

在实际研究中,生物学家可能需要对这些模型运行数千次,测试每个人类基因附近的所有可能突变,优化后的模型可将 GPU 成本降低 30% 到 60%。

这类优化通常需要一个性能工程团队花费数周完成,许多学术实验室根本无力负担,而 Mythos 5.1 仅用数天便做到了,且仅依赖公开源代码。
Anthropic 计划近期将这些优化开源。
伴随着 Fable 5.1 发布,还有一些特别的规定和 API 改动。
Fable 5.1 的网络安全误报率比 Fable 5 降低了 60%,现在允许用于发现软件漏洞,但仍禁止开发漏洞利用程序。渗透测试、漏洞利用生成、基于二进制的漏洞扫描等双重用途任务仍会被重定向到 Opus 系列模型。
基础生物学和医学问题的误报率降低了 85%,但涉及生命科学研发的查询仍路由到 Opus 模型处理,专业人员需通过 Mythos 5.1 的生命科学验证计划(LSVP)获取访问权限。
从今天起新注册的 API 账户无法在多轮对话中手动编辑 Claude 上下文的同时保留思维链记录。
之前有一种被公开记录过的常见手法:在多轮对话中,手动篡改 Claude 之前的上下文,但刻意保留思维链记录。这样一来就能在一组新的、可能带有对抗性的指令下,重放模型在另一组指令下产生的推理过程。

做法是给每个思维链区块都加上一个签名(signature)。
当用户在后续请求中把助手的回复发回 API 时,系统会用这个签名做两件事:验证当前模型是否有权读取这个区块,以及验证这个区块之前的整段对话(包括系统提示词、工具列表、所有历史消息)是否跟当初生成它时一模一样。
只要对话中有任何东西被动过,签名校验就会失败。
失败之后怎么处理,取决于开发者设的一个参数 prefix_mismatch_behavior:默认值是"error",直接返回 400 状态码,请求被拒;如果设成"drop_block",系统会静默丢掉这个区块以及它之后的所有思维链,请求本身照常执行。
被丢掉的部分不计费(人还怪好的嘞),并且会在响应里的 input_transformations 数组中列出来。

文档给了一份详细清单:编辑、重新排列或删除任何先前的用户/助手/系统消息,改动顶层系统提示词,对工具列表做任何增删改名操作,从对话历史中间抽掉某个思维链区块但保留后面的区块,以及引用了一个在两次请求之间返回了不同内容的图片或文档 URL。
以上任何一条,都会导致后续所有思维链区块失效。

在对话末尾追加新消息、从历史记录开头移除思维链区块、改 max_tokens 之类的请求参数、增减 cache_control 标记,以及服务端的压缩(compaction)或上下文编辑(context editing),这些都不会触发校验失败。
还有一个链式校验的设计,每个思维链区块会记录它前一个区块的信息,形成一条跨轮次的链条。可以从链条的头部摘掉区块,但如果从中间抽掉一个,那它后面的每一个区块都会跟着失效,整条链从断裂处往后全部作废。
为了不让开发者被卡住,Anthropic 同时提供了一系列替代方案,可以在不碰历史记录的前提下达到同样的效果。
需要中途改指令?用对话内系统消息(mid-conversation system message)替代直接改顶层提示词。
需要每轮加个临时提醒?用带 clear_at 参数的轮次级系统消息,替代"先插入再删除"的老办法。
需要中途增减工具?用 tool_addition 和 tool_removal 区块,替代直接编辑工具列表。
需要裁剪上下文?用服务端压缩和上下文编辑,替代客户端粗暴截断。
如果你用的是 Claude Code、claude.ai、Claude Managed Agents 或 Claude Agent SDK 这些官方产品,什么都不用改,它们已经自动保证对话前缀不会被篡改。
但如果你是直接调 Messages API 的开发者,Anthropic 的建议是:把 messages 数组严格当作只追加(append-only)来用,然后在 prefix_mismatch_behavior 设为"drop_block"的模式下跑一遍完整的多轮会话测试,看日志里有没有冒出 prefix_binding_mismatch 条目。
如果你维护的是一个工具或框架,用户拿自己的 API 密钥来调用,那新注册用户会更早撞上这个校验。因为开发者自己的密钥大概率是 8 月 31 日之前注册的,暂时还没被强制执行。
对于这种情况建议主动设好 prefix_mismatch_behavior 提前测试,别等用户先炸了你才发现。
A 社整这么大动静,隔壁 OpenAI 肯定坐不住啊。
但他们家新模型 Astra 是真还差一点没弄好,只好先象征性地发点预告。
还有 Ilya 在 Fable 5.1 和 OpenAI Astra 发布之际,也少见地出来喊话,呼吁加强网络安全。
参考链接:[1] https://www.anthropic.com/claude-fable-and-mythos-5-1
OpenAI 买几万台 Mac 搞强化训练!英伟达的活被苹果抢了 2026-08-31
不是 Demo!优必选把客户产线 1:1 搬进 WRC,解锁具身智能真落地路径 2026-08-22
写 2000 字提示词,不如先生成 3D 白模!AI 视频创作进入"预演时代" 2026-08-19
Eon 用 LIF"上传"果蝇脑,中国团队直接上精细神经元和跨身体平台 2026-08-22
提出系统提示学习新范式:模拟人类经验积累过程,将系统提示嵌入权重
量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备 17005886 号-1