OpenAI GPT-6 Astra 与 Anthropic Claude Fable 5.1 在 48 小时内相继发布;Claude 同期推出 Mythos 5.1 受限版,面向网络安全与生命科学领域;欧盟将 ChatGPT 纳入搜索引擎监管范畴。
GPT-6 Astra 和 Claude Fable 5.1 在 48 小时内先后发布。基准测试排行榜是这两次发布中最无趣的部分。
2026年9月第一周,用五天时间压缩了一整年的 AI 行业走向。周一,欧盟委员会正式将 ChatGPT 指定为"超大型在线搜索引擎",这是聊天机器人首次被纳入与 Google 搜索相同的监管类别。周二,Anthropic 发布了 Claude Fable 5.1。周四,OpenAI 发布了 GPT-6 Astra。
相关报道大多是得分排行,而排行到明年春天就会过时。三件更安静的事情与它们一同发布,而这些东西两年后仍将重要:前沿模型现在带上了锁、标签,以及一位新的裁判——正在回答那些从未听说过这两个模型的企业所面临的问题。
Anthropic 的发布实际上是两次发布。Fable 5.1 是已普遍可用的模型。Mythos 5.1 是同一模型但 Safeguard 更宽松,仅提供给通过审核的网络安全和生命科学领域组织。在能力方面,Anthropic 报告其在 Terminal-Bench-Science 上达到 52.6%,大约是其前代 24.7% 的两倍,Artificial Analysis 将其测量为 Intelligence Index 的 66 分,是该机构记录的最高分。商业层面的亮点是缓存输入定价降低了 75%,从每百万 token 1.00 美元降至 0.25 美元,VentureBeat 指出,这意味着典型工作负载成本降低约 25%,长时间运行的 Agent 任务成本降低高达 45%。
然后是大多数报道跳过的内容:Fable 5.1 和 Mythos 5.1 是首批文本输出携带不可见水印的 Claude 模型。
Astra 是 OpenAI 一年多来首次完整的版本号跃升,公司对此毫不谦虚。计算机使用、浏览器使用和软件工程方面的最新技术水平。OpenAI 总裁 Greg Brockman 在接受 Axios 采访时被问及这是否等同于 AGI,他说:"我确实认为我们达到了。"
它也是 OpenAI 首款在其 Preparedness Framework 下被评定为网络能力"Critical"的模型。在 OpenAI 内部测试中,它解决了利用开发基准测试中的所有任务,并且在给定 20 个近期高危漏洞进行处理时,独立发现并利用了其中两个此前未知的漏洞。发布是分阶段的:首先面向少量组织,然后是 ChatGPT Plus、Pro、Business 和 Enterprise 账户,随后几天是 API 和 AWS。企业管理员默认关闭此功能。
注意两家公司在同一周独立选择的形态。Anthropic 将其旗舰模型分为公开版本和审核访问版本。OpenAI 将其旗舰模型评定为 Critical,将高级网络能力限制在小型测试组之后,并通过审核的安全计划提供更广泛访问。两家公司都没有放慢发布速度。都给它加上了门。
这是一种新的模式,它改变了这个生态系统中一个微妙的东西:你能够购买的最强版本模型不再是实际存在的最强版本。价格表之上还有一层,而进入那一层需要申请流程,而不是一张信用卡。对于大多数团队来说,明天这并不会改变什么。但对于任何计划中假设公共前沿访问总是等同于前沿能力的人来说,这周它悄悄地就不再成立了。
Fable 5.1 的水印值得更多关注。它是一种嵌入文本本身的统计信号,用于估计 Claude 参与撰写某段文字的可能性。它不携带任何关于用户的信息,不改变输出内容,而且如果没有面向监管机构、媒体组织、事实核查人员、研究机构和类似机构的检测 API,这种水印就是不可见的。
Anthropic 并不是心血来潮这么做。7月,它签署了欧盟 AI 法案关于 AI 生成内容透明度的实践守则,该守则要求在 8 月 2 日之后发布的模型必须加水印。Google 自 2024 年起就在 Gemini 的文本中运行 SynthID。各个厂商正在逐步为 AI 文本加上凭证。
如果你是靠发布内容谋生的,实际的解读比标题党要平静。没有搜索引擎将文本水印作为排名信号,而 Google 自家模型输出已加水印两年,如果真有人这么做,这相当于每天都在降低自家产品的排名。Google 的垃圾政策实际针对的是大规模的、未经编辑的、为填充空间而发布的内容。正在结束的时代的定义更窄也更公平:发布原始模型输出之所以有效,是因为没有人能够证明什么,而现在各个厂商本身正在签署放弃这种可推诿性的文件。携带只有你拥有的知识并经过编辑的内容从来都不是目标。
这就是本周三件事汇聚成一个故事的交汇点。
欧盟的指定是由一个数字触发的:欧洲每月有 1.591 亿人使用 ChatGPT 搜索,是定义超大型搜索引擎阈值的 3 倍多,而且这个数字仅计算搜索功能本身。人们向这些系统询问该买什么、该雇谁,规模已达到受监管基础设施的水平。而从本周起,在他们之下运行答案的模型正在被替换。
AI 回答不是存储的排名。当有人询问他们城市里最好的会计师时,不是从排行榜中检索任何东西;候选名单是由当天运行的模型即时生成的。更改模型就更改了判断:它选择读取什么、信任哪些来源、哪些名字出现在答案中。一家企业的可见度可以在其网站没有任何文字改变的情况下发生变动。
我们已经测量过这些系统判断的差异。当我们对四个助手运行相同的 50 个购买问题时,ChatGPT 每个答案大约提到 8.9 家企业,26% 的引用来自目录网站而非企业自己的网站。Gemini 提到 9.1 家,只有 13% 使用目录,且它引用的来源中有 62% 是其他助手都没有使用的。相同问题,四组不同的陪审团。Astra 是本周正在就座的第五组陪审团,面对的是所有陪审团中最大的听众。
这个层级的移动速度有最近的先例。8月,ChatGPT 改变了收集来源的方式,Reddit——互联网上被引用最多的网站之一——在那里失去了大约 86% 的引用量。那是一次对一个模型的调整。全量模型替换是更大的事件,而且它不会给任何人发邮件。
在发布仍在进行中时,有两个检查值得做。首先,那个无聊的:确认你的网站没有意外阻止这些系统读取的爬虫。robots.txt 文件中的一行多余内容会抵消其他一切,而一个免费检查工具可以在几秒钟内告诉你哪些 AI 爬虫能够访问你。其次,向一个助手提出你的客户在知道你名字之前会问的问题,记下谁被提到,然后在 Astra 到达你的账户时再问一次。多问几次,因为答案每次运行都有所不同。重要的不是波动,而是完全消失的名字。
从这两次发布中值得抽出的三个面向开发者的细节。Fable 5.1 的缓存读取降价对任何运行 Agent 或长时间会话的人来说都是重要的:缓存输入每百万 token 0.25 美元改变了保持大上下文驻留的经济学,而 Anthropic 自己估计在高度 Agent 化的工作负载上可节省 45% 是可信的算术而非营销。Astra 随 ChatGPT 发布一同在 API 和 AWS 上线,现有订阅配额内使用,额度之上还有积分。此外,水印不需要你做任何事情:它不改变输出,没有标志位要设置,检测 API 也未公开可用。
到明年春天,会有其他模型登上这两个目前领先的排行榜,届时本周的得分表将成为 trivia。另外三件事不会过期。审核访问层级将仍位于公共模型之上。水印基础设施将出现在更多厂商的输出中,而不是更少。而决定哪些企业被发现的答案,将再次被最新的裁判重新生成。
观察这最后一层,就是 Greater Than Services 业务的全部:用相同的购买问题,在五个引擎上周复一周地提问,以便企业在停止成为答案之前就发现它,而不是等收入下滑之后才发现。这是该层级有史以来最繁忙的一周。
前沿模型本周不只是变得更智能了。它有了门、凭证和一个新裁判。这些都不会随着下一份基准测试排行榜而消失。
Sources: Anthropic on Fable 5.1 and Mythos 5.1 · OpenAI, Path to Astra · TechCrunch on the Astra launch · Axios, Brockman on AGI · VentureBeat on Fable pricing · European Commission designation notice · Search Engine Journal on the 159.1M figure · Artificial Analysis on Fable 5.1