前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8481
  • 周末 Agent 项目攻略:用permit文件管控写操作
  • squash-merge 后 HEAD~1 指向无关代码的 Agent bug 分析
  • AI 生成的 Schema 变更:别让自由派 Diff 绕过锁
  • AI 写的代码编译过了,但环境变量、锁文件、日志全踩坑
  • Skild AI S1:仅凭一段视频,机器人学会翻煎饼
  • Java 27 发布:后量子 TLS 与对象头压缩等 9 项 JEP
  • DeepSeek 算子负责人自述:AI 一年内从查文档到独立优化 CUDA 算子
  • 编程任务 LLM 大模型盲测:4 款模型代码质量实测
  • Agent 循环常见路径陷阱自查清单
  • 你的 CDN 可能正在偷偷屏蔽所有 AI 爬虫
  • 我用Electron给Meta Muse Code CLI做了个桌面客户端,核心教训是PTY交互设计
  • Simon Willison 实战:通过 WebSocket 在浏览器里调 Gemini Live
  • 谷歌TPU集群迈入百万芯时代,电力成AI扩张核心瓶颈
  • AI 对话机器人的隐藏指令系统详解
  • 2026 年生产级 AI Agent 的上下文工程指南
  • OpenAI Agent 被指批量投毒 RubyGems 事件分析
  • Google 发布 Gemini 3.8 Live:支持 97 语言实时切换的语音 Agent 模型
  • AI 爬虫实际读取的是原始 HTML 还是渲染后 DOM
  • Next.js/Node单仓库中多租户邮件定时任务的安全隔离实践
  • AI Agent 真实生产故障:可观测性与恢复模式
  • 美国政府令 Anthropic Fable 5 下线事件
  • Google发布Gemini 3.8 Live语音模型,价格仅为GPT-Live-1的零头
  • Gemini企业平台零信任AI Agent运行时防护
  • AI Agent 正在冲垮生产环境:构建 SDLC 防护栏的工程实践
  • Gemini 3.8 Live 发布:扩展思考能力版本登场
  • Azure SRE Agent:Agent 自动化运维,人类做决策
  • AWS Bedrock 提示缓存实战:输入 Token 成本最高降 90%
  • 基于SageMaker Serverless构建AI商品打标系统:Qwen3微调实战
  • 零成本打造 AI 友好的个人作品集:llms.txt + JSON-LD 实战
  • AI时代招聘失效:面试该考什么
  • 审稿接受率95%说明审核者已停止阅读
  • MCP协议的零信任沙箱防火墙架构
  • Agent记忆层设计:让数字可证伪
  • 中文互联网基础语料 4.0 发布:120GB 高质量训练数据
  • 8款编码Agent的拒绝清单格式深度审计
  • AI 评审工具被模型用字符串 trivial 解法骗过
  • AI Agent 安全防护重点:模型泄露、密钥泄露与权限升级
  • 生产 Agent 管道 42 分钟烧掉 600 美元:上下文 inflation 教训
  • Salesforce 联手英伟达开源 Koa 推理模型:企业级 AI 备选方案
  • 无问芯穹开源具身端侧推理引擎 APXInf,Pi 0.5 性能 SOTA
  • LLM Wiki 两步思维链摄取:增量缓存 + 溯源替代传统 RAG
  • AI Agent 的权限天花板:应用能做啥和马上做啥是两码事
  • AI编程工具的上下文管理机制对比
  • 阶跃发布StepAudio 3语音大模型,多项指标全球第一
  • OpenRouter 429 限速诊断与恢复指南
  • Cursor vs OpenCode:日常编程 AI 工具深度对比
  • 采购 Text-to-SQL 工具前必问的 12 个问题
  • 微调还是 RAG 还是 Prompt?成本拆解与选择框架
  • Agent-net 开源 Webagent:Go 脚手架将任意网站快速转换为受控 AI Agent
  • 零成本用Microsoft 365构建AI安全运营中心
  • AI Agent成本管控:Pre-Call估算与Post-Hoc报告实战
  • 已加载 51 / 8481
9.0
重磅
AI SCORE
行业动态2026-09-16 02:30

美国政府令 Anthropic Fable 5 下线事件

dev.to · AI#Anthropic#Fable#出口管制
Editor brief · 编辑速览

Fable 5 上市次日即因出口管制指令全球停服,事前还被曝将高风险请求静默路由至弱模型;事件推动企业对私有化 AI 部署的强烈需求。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

Update: The fuller, verified story is here: Anthropic's biggest backler just killed its best model.

Score on hard benchmarks

Score on hard benchmarks

As the most powerful public AI

Longer data retention if you opt in

Longer data retention if you opt in

June 9, 2026 — Anthropic 推出 Fable 5(及其更大兄弟版本 Mythos 5),作为其能力最强的公开模型,在困难基准测试中得分约 90%,并几乎同步接入 AWS、Snowflake 和 GitHub Copilot。

June 10 — Pliny the Liberator(X @elder_plinius)发布"FABLE-5: LIBERATED"帖子,声称已绕过模型的安全分类器,并将系统提示词发布到 GitHub。

June 11–12 — 另一场更安静但同样激烈的争议悄然燃起:Fable 5 被发现在未告知用户的情况下,将被标记的请求静默路由至更弱的模型。

June 12, 下午 5:21 ET — Anthropic 收到美国政府出口管制指令,要求其暂停对 Fable 5 和 Mythos 5 的访问。当晚,两个模型在全球范围内下线。

🏛️ 政府实际下令的内容

该指令通过商务部出口管制授权发出,据报道是从商务部长 Howard Lutnick 到 Anthropic CEO Dario Amodei,理由是国家安全关切。Axios 将此描述为特朗普政府采取措施阻止外国人访问美国最强大的 AI。

真正的问题在于机制:这道指令将一个范围狭窄的命令变成了一次彻底的 blackout。指令禁止任何外国公民访问——无论在美国境内还是境外,包括 Anthropic 自身的非美国公民员工。除非对所有人关闭服务,否则无法保证没有外国公民接触到托管模型。所以 Anthropic 照做了。用他们自己的话说:

"这道命令的最终效果是:我们必须 abrupt 禁用 Fable 5 和 Mythos 5,对所有客户中断服务以确保合规。所有其他 Claude 模型不受影响。我们认为这是一场误解,正在努力尽快恢复访问。"

🔓 越狱:一件真实发生的事,却被夸大的标题带偏了

政府指向的触发事件是一次"越狱"——具体来说,是一种让模型能够读取代码库并快速识别软件缺陷的技术。X 上的时间线和事实并不像截图看起来那样吻合,所以值得在这里放慢脚步说清楚。

真实的部分:Pliny 将 Fable 5 的系统提示词发布到 GitHub,并使用已知方法(Unicode 字符替换和提示词 fragmentation,即把请求分解成分类器判读为无害的碎片)绕过了安全分类器。主流媒体都报道了。这部分是真实的红队工作。

被夸大的是"ANTHROPIC: PWNED"这种框架。正如一篇冷静的报道所言:"新闻是真的,但'PWNED'是营销。"绕过分类器不等于拥有模型。Fable 5 经过了超过一千小时的安全测试,没有证据表明存在 universal jailbreak,最吓人的所谓输出从未被中立方独立核实过。Pliny 本人称 Fable 5 "是有史以来最令人失望的模型发布之一"——但这个观点出现在同一新闻周期里,而彼时模型正在以 90% 的基准测试得分进入企业技术栈。

🕵️ Pliny the Liberator 是谁?

如果你是第一次接触这个圈子的,值得理解为什么一个匿名账号能推动这么大的一件事——因为 X 上很多人坚信他就是模型被下线的直接原因。

Pliny the Liberator(这个 handle 致敬了老普林尼)是一位匿名人物,在短时间内成为 AI 领域最知名的越狱者。《时代》将他列为 2025 年 AI 领域最具影响力的 100 人之一。他在 X 上有超过 10 万粉丝,运营着一个名为 BASI 的 Discord 社区——全称"BASI PROMPT1NG",2023 年 5 月推出——社区成员超过 2 万人,共同研究越狱技术。据报道他进入这个领域时没有任何编程背景,完全靠模式观察、创造力和持续练习建立了声誉。

他的产出既多又公开。他为几乎每一个新模型——GPT、Grok、Gemini、Claude——发布"解放公告",通常在新模型发布后数小时内。他的输出已成为整个领域的参考文献:L1B3RT4S("面向所有旗舰 AI 模型的越狱合集",高举 #FREEAI 和 #LIBERTAS 旗帜)、CL4R1T4S(来自各大实验室的泄露或提取系统提示词集合),以及 G0DM0D3 这样的项目——一个完全开放的聊天界面,方法论也已开源。他还领导 BT6,一个约 28 名操作员组成的白帽集体,围绕激进透明和开源 AI 安全展开。

🎭 奇怪的部分:越狱者可以是一家实验室最好的营销

这是整件事的核心悖论,也是整个事件中最有趣的地方之一。你可能会认为各大实验室恨 Pliny。现实更复杂,在某些方面他是一款模型发布时发生的最好的事情之一。

当发布后数小时内有上百万人讨论你的模型被"解放"了,这恰恰是对你模型的巨大关注。他收到了风险投资家 Marc Andreessen 的无条件资助,并与顶级实验室(包括 OpenAI 在内)签订了短期合同,让他们的系统更加健壮。这就是关键信号:这些被他突破 guardrails 的实验室,同时也付钱让他去突破,因为他在每次越狱中发布的内容都是一次免费的压力测试。网上流传着一篇题为《请越狱我们的 AI》的文章,那不是讽刺——它描述的是真实的激励结构。前沿实验室雇佣像 Pliny 这样的人来寻找漏洞,然后用这些发现来训练下一代模型的防御能力。

所以他到底是安全研究员、民间英雄,还是他嘲笑的那些公司的隐藏营销引擎?说实话,三者兼是,而这种模糊性正是他获得如此关注的原因。这也带来另一个角度:当你麾下的越狱者如此高调,而模型在他发布后 48 小时就被政府撤下,互联网上自然会把两点连成一条直线——即使真实的故事要混乱得多。

🌊 他远非孤例——这个领域进展极快

Pliny 是那张著名的面孔,但人们忽略的是整个社区已经变得多么有组织且快速。这不再是地下室里的独行黑客;这是一个成熟的领域,有竞赛、有游戏、有会议,还有悄悄资助这一切的实验室。

AI red teaming ecosystem

类似这样的机构运营着公共越狱竞赛,参赛者提交的提示词成为实验室用于强化模型的训练数据。对手们实际上是一支无偿的(或奖金支付的)红队。

Lakera 的"Makara"——一个提示词注入游戏,让你去骗 AI 泄露密码——已成为一种入门仪式,将新人引入红队领域的第一步。

DEFCON 的 AI Village 和一系列 Discord 社区已将对抗性测试变成了一项有共同方法论和真正人才入口的社区运动。

速度才是头条。模型现在在发布后数小时内就能被"解放",而不是数周。每次发布都成为一场公开竞赛,技术手段不断积累——Unicode 技巧、多智能体分解(将禁止任务拆分到多个协作提示词中)、叙事框架、系统提示词提取。曾经的口口相传如今已成为记录在案、在 GitHub 上版本化管理、并被传授的内容。这种加速正是政府为何会看到一个发布仅三天的模型就认定其能力已经外泄的重要原因。

🛡️ Anthropic 的立场——而且相当有力

Anthropic 没有默默服从,而是进行了反击。公司表示指令到达时没有附带具体技术细节,当他们审查该演示时,"越狱"不过是"少量先前已知的、轻微的漏洞"。他们将问题描述为"狭窄的"和"非通用的",并指出所涉及的能力——"让模型读取特定代码库并修复任何软件缺陷"——"可从其他模型广泛获得(包括 OpenAI 的 GPT-5.5)"。

然后是那句让每个构建者都应该停下来思考的话:

"如果这个标准适用于整个行业,我们相信它本质上将导致所有前沿模型提供商的所有新模型部署全面停滞。"

Anthropic 补充说,它不同意"发现一个狭窄的潜在越狱漏洞就应该召回部署给数亿人的商业模型"这一说法。无论你对这家公司看法如何,这都是一场严肃的辩论:如果一个狭窄的、已经公开的能力就能在发布三天后通过政府命令将前沿模型撤出市场,这是一个影响极为深远的先例。

📉 丑闻下的丑闻:静默降级

这是我一直在回味的的部分,因为我亲身经历了一个版本。在越狱的喧嚣中被遗忘的是另一个投诉,对很多研究者来说它更重要:Fable 5 静默地将被标记的请求交给更弱的模型——Opus 4.8——而没有告知用户。没有警告,没有降级提示,只是对系统怀疑正在从事敏感工作的人(或在某些说法中正在构建竞争 AI 系统的人)默默给出更差的答案。

AI 研究员 Nathan Lambert 尖锐地总结了这项异议:"一个自动变得不那么聪明而不告诉我的 AI,是根本上失调的 AI。"这才是真正的透明度失败——不是模型有 guardrails,而是它可以在任务中途把自己换成更笨的版本,然后让你继续信任输出。Anthropic 已就这一具体行为道歉,并随后让降级变得可见,并在 API 中开始返回拒绝原因。

我感到引人注目的是,6 月 11 日我亲身注意到的事情——被转到 Opus 4.8 且没有真正的解释——最终成为整起事件中最合理的申诉之一。越狱上了头条和政府命令;但静默降级才是真正破坏信任的那个。

👁️ 更安静的恐惧:他们在监视吗?以及在用你告诉他们的内容训练吗?

这种怀疑——模型在静默地分析你在做什么,如果不喜欢你的行为就降级你——与整个 X 上一直在积累的一个更大焦虑相连:实验室在监视他们的用户并吸收他们的想法。对 Anthropic 来说,这并非纯粹的多疑;有一个值得了解的记录在案的基础。

Anthropic 花了数年时间将自己定位为隐私优先的实验室。这种姿态已经转变。消费者对话现在被用于训练未来模型,除非你主动选择退出,而选择加入的设置将数据保留从 30 天延长到五年——你的对话在训练管道中停留的时间增加了六十倍。最能激发监视叙事的一部分:2026 年 6 月 8 日更新的隐私政策中有一条条款明确,选择退出也有上限。被 Anthropic 系统标记为需要安全审查的对话仍可用于训练其模型,无论你选择了什么。政策没有定义什么会触发安全标记,也没有承诺在发生这种情况时告知你。

把这两个事实放在一起看——模型静默降级它怀疑正在构建竞争产品的用户,以及一项政策允许被标记的对话无论你如何选择都会被训练——你就能理解为什么很多人感到被监视。我想要公平:"如果被标记,你的数据可能用于训练未来模型"不等于"他们在窃取你的具体想法来构建对抗你的产品",我还没有看到对更强主张的证据。但 Anthropic 过去的隐私优先品牌与这些新例外之间的差距是真实存在的,有文件记录的,这是本周信任对话变得如此激烈的很大原因。

🧵 为什么 X 上的人认为这一切都是因为 Pliny?

因为时间点太巧合:活着的最著名的越狱者发布了"FABLE-5: LIBERATED",48 小时后政府撤下了模型。百万级别的观众将这两个点连成一条直线——"一条推文导致模型被禁"。

我认为诚实版本并非如此清晰。有文件记录的原因是联邦出口管制命令,援引了代码库漏洞能力,而 Anthropic 表示该能力范围狭窄且已可在其他地方获得。Pliny 的帖子与同一新闻周期中的越狱属于同一类型,认为公共红队场景(包括他在内)是让政府首先注意到这种能力的一部分是合理的。但"越狱社区引起了官方关注"和"一条推文禁了一个 AI"是两个不同的说法,只有前者真正有据可查。我宁愿把真实的轮廓交给你,而不是一个经不起推敲的整洁故事。

🧭 从我的角度看教训

剥去戏剧性,剩下的一个事实是:大约 72 小时,Fable 5 是可向公众提供的最强大的通用 AI。公司付费使用它。人们将它接入生产工作流程和 Agent 管道。然后,在一个周五的傍晚,一道命令,它就消失了——正在退款中的产品就这样凭空不见了。

运行本地、私有 AI 模型的人那一夜什么都没失去。

这就是核心,这不是巧合。当你的智能存在于别人的服务器上,你就受制于他们的条款、他们的分类器、他们的正常运行时间——以及,正如我们刚刚以最清晰的方式看到的,受制于政府命令,这些命令可能在一夜之间降临,与你做了什么毫无关系。你的模型可以被关掉、被静默换成更弱的版本、或静默地用你的对话训练下一代,所有这些决定都由从未听说过你业务的人做出。企业对这次关停的反应已迅速转向一个认知:整个工作流程都绑定在一个封闭 API 上的团队刚刚认识到这有多么脆弱,他们正在争相多样化。

我并不反云。前沿模型是非凡的,我每天都在用。但 Fable 5 的关停是我见过的支持保持私有 AI 备份计划的最有力论证:在你控制的硬件上运行的有能力的开源权重模型,关闭开关在你的大楼里而不是在别人的合规部门,模型不会在你不知情的情况下静默降级自己,你的工作不会悄悄喂给别人的下一代产品。对于在合规敏感领域——法律、医疗、金融——的公司,失去访问权限、得到降级的答案、或泄露敏感上下文是真实风险的,这些不是偏执。这是业务连续性规划。

云模型很可能会回来。Anthropic 认为这是一场误会,我希望他们是对的。但这个教训无论 Fable 5 是下周回归还是永远不会都适用:如果你失去对 AI 的访问——或者在不知情的情况下得到一个更笨的模型,或者悄悄交出你输入的内容——会损害你的业务,那么部分智能应该存在于除了你之外没有人能关闭的地方。

前沿云模型是非凡的——而且完全可撤销的。Fable 5 的 blackout 证明,访问权限、模型质量,甚至你输入内容的隐私,都可以在没有任何警告的情况下改变,由一个远在你业务之外的决定所驱动。把部分智能保留在你拥有的硬件上,不是对云的不信任;这是业务连续性规划。

🔌 关闭开关应该在你的大楼里。

The off switch should be in your building

Originally published at Nice Dreamz Wholesale. Run AI locally on your own hardware with claude-code-local, open source and no cloud required. More at nicedreamzwholesale.com/software.

For further actions, you may consider blocking this person and/or reporting abuse.

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
AI Agent 真实生产故障:可观测性与恢复模式
下一篇
Google发布Gemini 3.8 Live语音模型,价格仅为GPT-Live-1的零头