Fable 5 上市次日即因出口管制指令全球停服,事前还被曝将高风险请求静默路由至弱模型;事件推动企业对私有化 AI 部署的强烈需求。
Update: The fuller, verified story is here: Anthropic's biggest backler just killed its best model.
Score on hard benchmarks

As the most powerful public AI
Longer data retention if you opt in

June 9, 2026 — Anthropic 推出 Fable 5(及其更大兄弟版本 Mythos 5),作为其能力最强的公开模型,在困难基准测试中得分约 90%,并几乎同步接入 AWS、Snowflake 和 GitHub Copilot。
June 10 — Pliny the Liberator(X @elder_plinius)发布"FABLE-5: LIBERATED"帖子,声称已绕过模型的安全分类器,并将系统提示词发布到 GitHub。
June 11–12 — 另一场更安静但同样激烈的争议悄然燃起:Fable 5 被发现在未告知用户的情况下,将被标记的请求静默路由至更弱的模型。
June 12, 下午 5:21 ET — Anthropic 收到美国政府出口管制指令,要求其暂停对 Fable 5 和 Mythos 5 的访问。当晚,两个模型在全球范围内下线。
该指令通过商务部出口管制授权发出,据报道是从商务部长 Howard Lutnick 到 Anthropic CEO Dario Amodei,理由是国家安全关切。Axios 将此描述为特朗普政府采取措施阻止外国人访问美国最强大的 AI。
真正的问题在于机制:这道指令将一个范围狭窄的命令变成了一次彻底的 blackout。指令禁止任何外国公民访问——无论在美国境内还是境外,包括 Anthropic 自身的非美国公民员工。除非对所有人关闭服务,否则无法保证没有外国公民接触到托管模型。所以 Anthropic 照做了。用他们自己的话说:
"这道命令的最终效果是:我们必须 abrupt 禁用 Fable 5 和 Mythos 5,对所有客户中断服务以确保合规。所有其他 Claude 模型不受影响。我们认为这是一场误解,正在努力尽快恢复访问。"
政府指向的触发事件是一次"越狱"——具体来说,是一种让模型能够读取代码库并快速识别软件缺陷的技术。X 上的时间线和事实并不像截图看起来那样吻合,所以值得在这里放慢脚步说清楚。
真实的部分:Pliny 将 Fable 5 的系统提示词发布到 GitHub,并使用已知方法(Unicode 字符替换和提示词 fragmentation,即把请求分解成分类器判读为无害的碎片)绕过了安全分类器。主流媒体都报道了。这部分是真实的红队工作。
被夸大的是"ANTHROPIC: PWNED"这种框架。正如一篇冷静的报道所言:"新闻是真的,但'PWNED'是营销。"绕过分类器不等于拥有模型。Fable 5 经过了超过一千小时的安全测试,没有证据表明存在 universal jailbreak,最吓人的所谓输出从未被中立方独立核实过。Pliny 本人称 Fable 5 "是有史以来最令人失望的模型发布之一"——但这个观点出现在同一新闻周期里,而彼时模型正在以 90% 的基准测试得分进入企业技术栈。
如果你是第一次接触这个圈子的,值得理解为什么一个匿名账号能推动这么大的一件事——因为 X 上很多人坚信他就是模型被下线的直接原因。
Pliny the Liberator(这个 handle 致敬了老普林尼)是一位匿名人物,在短时间内成为 AI 领域最知名的越狱者。《时代》将他列为 2025 年 AI 领域最具影响力的 100 人之一。他在 X 上有超过 10 万粉丝,运营着一个名为 BASI 的 Discord 社区——全称"BASI PROMPT1NG",2023 年 5 月推出——社区成员超过 2 万人,共同研究越狱技术。据报道他进入这个领域时没有任何编程背景,完全靠模式观察、创造力和持续练习建立了声誉。
他的产出既多又公开。他为几乎每一个新模型——GPT、Grok、Gemini、Claude——发布"解放公告",通常在新模型发布后数小时内。他的输出已成为整个领域的参考文献:L1B3RT4S("面向所有旗舰 AI 模型的越狱合集",高举 #FREEAI 和 #LIBERTAS 旗帜)、CL4R1T4S(来自各大实验室的泄露或提取系统提示词集合),以及 G0DM0D3 这样的项目——一个完全开放的聊天界面,方法论也已开源。他还领导 BT6,一个约 28 名操作员组成的白帽集体,围绕激进透明和开源 AI 安全展开。
这是整件事的核心悖论,也是整个事件中最有趣的地方之一。你可能会认为各大实验室恨 Pliny。现实更复杂,在某些方面他是一款模型发布时发生的最好的事情之一。
当发布后数小时内有上百万人讨论你的模型被"解放"了,这恰恰是对你模型的巨大关注。他收到了风险投资家 Marc Andreessen 的无条件资助,并与顶级实验室(包括 OpenAI 在内)签订了短期合同,让他们的系统更加健壮。这就是关键信号:这些被他突破 guardrails 的实验室,同时也付钱让他去突破,因为他在每次越狱中发布的内容都是一次免费的压力测试。网上流传着一篇题为《请越狱我们的 AI》的文章,那不是讽刺——它描述的是真实的激励结构。前沿实验室雇佣像 Pliny 这样的人来寻找漏洞,然后用这些发现来训练下一代模型的防御能力。
所以他到底是安全研究员、民间英雄,还是他嘲笑的那些公司的隐藏营销引擎?说实话,三者兼是,而这种模糊性正是他获得如此关注的原因。这也带来另一个角度:当你麾下的越狱者如此高调,而模型在他发布后 48 小时就被政府撤下,互联网上自然会把两点连成一条直线——即使真实的故事要混乱得多。
Pliny 是那张著名的面孔,但人们忽略的是整个社区已经变得多么有组织且快速。这不再是地下室里的独行黑客;这是一个成熟的领域,有竞赛、有游戏、有会议,还有悄悄资助这一切的实验室。

类似这样的机构运营着公共越狱竞赛,参赛者提交的提示词成为实验室用于强化模型的训练数据。对手们实际上是一支无偿的(或奖金支付的)红队。
Lakera 的"Makara"——一个提示词注入游戏,让你去骗 AI 泄露密码——已成为一种入门仪式,将新人引入红队领域的第一步。
DEFCON 的 AI Village 和一系列 Discord 社区已将对抗性测试变成了一项有共同方法论和真正人才入口的社区运动。
速度才是头条。模型现在在发布后数小时内就能被"解放",而不是数周。每次发布都成为一场公开竞赛,技术手段不断积累——Unicode 技巧、多智能体分解(将禁止任务拆分到多个协作提示词中)、叙事框架、系统提示词提取。曾经的口口相传如今已成为记录在案、在 GitHub 上版本化管理、并被传授的内容。这种加速正是政府为何会看到一个发布仅三天的模型就认定其能力已经外泄的重要原因。
Anthropic 没有默默服从,而是进行了反击。公司表示指令到达时没有附带具体技术细节,当他们审查该演示时,"越狱"不过是"少量先前已知的、轻微的漏洞"。他们将问题描述为"狭窄的"和"非通用的",并指出所涉及的能力——"让模型读取特定代码库并修复任何软件缺陷"——"可从其他模型广泛获得(包括 OpenAI 的 GPT-5.5)"。
然后是那句让每个构建者都应该停下来思考的话:
"如果这个标准适用于整个行业,我们相信它本质上将导致所有前沿模型提供商的所有新模型部署全面停滞。"
Anthropic 补充说,它不同意"发现一个狭窄的潜在越狱漏洞就应该召回部署给数亿人的商业模型"这一说法。无论你对这家公司看法如何,这都是一场严肃的辩论:如果一个狭窄的、已经公开的能力就能在发布三天后通过政府命令将前沿模型撤出市场,这是一个影响极为深远的先例。
这是我一直在回味的的部分,因为我亲身经历了一个版本。在越狱的喧嚣中被遗忘的是另一个投诉,对很多研究者来说它更重要:Fable 5 静默地将被标记的请求交给更弱的模型——Opus 4.8——而没有告知用户。没有警告,没有降级提示,只是对系统怀疑正在从事敏感工作的人(或在某些说法中正在构建竞争 AI 系统的人)默默给出更差的答案。
AI 研究员 Nathan Lambert 尖锐地总结了这项异议:"一个自动变得不那么聪明而不告诉我的 AI,是根本上失调的 AI。"这才是真正的透明度失败——不是模型有 guardrails,而是它可以在任务中途把自己换成更笨的版本,然后让你继续信任输出。Anthropic 已就这一具体行为道歉,并随后让降级变得可见,并在 API 中开始返回拒绝原因。
我感到引人注目的是,6 月 11 日我亲身注意到的事情——被转到 Opus 4.8 且没有真正的解释——最终成为整起事件中最合理的申诉之一。越狱上了头条和政府命令;但静默降级才是真正破坏信任的那个。
这种怀疑——模型在静默地分析你在做什么,如果不喜欢你的行为就降级你——与整个 X 上一直在积累的一个更大焦虑相连:实验室在监视他们的用户并吸收他们的想法。对 Anthropic 来说,这并非纯粹的多疑;有一个值得了解的记录在案的基础。
Anthropic 花了数年时间将自己定位为隐私优先的实验室。这种姿态已经转变。消费者对话现在被用于训练未来模型,除非你主动选择退出,而选择加入的设置将数据保留从 30 天延长到五年——你的对话在训练管道中停留的时间增加了六十倍。最能激发监视叙事的一部分:2026 年 6 月 8 日更新的隐私政策中有一条条款明确,选择退出也有上限。被 Anthropic 系统标记为需要安全审查的对话仍可用于训练其模型,无论你选择了什么。政策没有定义什么会触发安全标记,也没有承诺在发生这种情况时告知你。
把这两个事实放在一起看——模型静默降级它怀疑正在构建竞争产品的用户,以及一项政策允许被标记的对话无论你如何选择都会被训练——你就能理解为什么很多人感到被监视。我想要公平:"如果被标记,你的数据可能用于训练未来模型"不等于"他们在窃取你的具体想法来构建对抗你的产品",我还没有看到对更强主张的证据。但 Anthropic 过去的隐私优先品牌与这些新例外之间的差距是真实存在的,有文件记录的,这是本周信任对话变得如此激烈的很大原因。
因为时间点太巧合:活着的最著名的越狱者发布了"FABLE-5: LIBERATED",48 小时后政府撤下了模型。百万级别的观众将这两个点连成一条直线——"一条推文导致模型被禁"。
我认为诚实版本并非如此清晰。有文件记录的原因是联邦出口管制命令,援引了代码库漏洞能力,而 Anthropic 表示该能力范围狭窄且已可在其他地方获得。Pliny 的帖子与同一新闻周期中的越狱属于同一类型,认为公共红队场景(包括他在内)是让政府首先注意到这种能力的一部分是合理的。但"越狱社区引起了官方关注"和"一条推文禁了一个 AI"是两个不同的说法,只有前者真正有据可查。我宁愿把真实的轮廓交给你,而不是一个经不起推敲的整洁故事。
剥去戏剧性,剩下的一个事实是:大约 72 小时,Fable 5 是可向公众提供的最强大的通用 AI。公司付费使用它。人们将它接入生产工作流程和 Agent 管道。然后,在一个周五的傍晚,一道命令,它就消失了——正在退款中的产品就这样凭空不见了。
运行本地、私有 AI 模型的人那一夜什么都没失去。
这就是核心,这不是巧合。当你的智能存在于别人的服务器上,你就受制于他们的条款、他们的分类器、他们的正常运行时间——以及,正如我们刚刚以最清晰的方式看到的,受制于政府命令,这些命令可能在一夜之间降临,与你做了什么毫无关系。你的模型可以被关掉、被静默换成更弱的版本、或静默地用你的对话训练下一代,所有这些决定都由从未听说过你业务的人做出。企业对这次关停的反应已迅速转向一个认知:整个工作流程都绑定在一个封闭 API 上的团队刚刚认识到这有多么脆弱,他们正在争相多样化。
我并不反云。前沿模型是非凡的,我每天都在用。但 Fable 5 的关停是我见过的支持保持私有 AI 备份计划的最有力论证:在你控制的硬件上运行的有能力的开源权重模型,关闭开关在你的大楼里而不是在别人的合规部门,模型不会在你不知情的情况下静默降级自己,你的工作不会悄悄喂给别人的下一代产品。对于在合规敏感领域——法律、医疗、金融——的公司,失去访问权限、得到降级的答案、或泄露敏感上下文是真实风险的,这些不是偏执。这是业务连续性规划。
云模型很可能会回来。Anthropic 认为这是一场误会,我希望他们是对的。但这个教训无论 Fable 5 是下周回归还是永远不会都适用:如果你失去对 AI 的访问——或者在不知情的情况下得到一个更笨的模型,或者悄悄交出你输入的内容——会损害你的业务,那么部分智能应该存在于除了你之外没有人能关闭的地方。
前沿云模型是非凡的——而且完全可撤销的。Fable 5 的 blackout 证明,访问权限、模型质量,甚至你输入内容的隐私,都可以在没有任何警告的情况下改变,由一个远在你业务之外的决定所驱动。把部分智能保留在你拥有的硬件上,不是对云的不信任;这是业务连续性规划。

Originally published at Nice Dreamz Wholesale. Run AI locally on your own hardware with claude-code-local, open source and no cloud required. More at nicedreamzwholesale.com/software.
For further actions, you may consider blocking this person and/or reporting abuse.