OpenAI 因 Astra 模型达到网络安全「Critical」级别(可自主发现零日漏洞)暂停内部测试;Claude Code 自动模式正式发布;Meta 在零工具调用评测中获佳绩。
OpenAI 暂停 Astra 部分工作——模型触及网络安全"Critical"天花板
8 月 7 日,OpenAI 发布了一份简短而不同寻常的安全声明:经过过去数天对即将发布的模型 Astra 的评估,公司"无法排除"Astra 在其 Preparedness Framework 下达到网络安全 Critical 等级的可能性。这是 OpenAI 自 2023 年以来使用的评级体系的最高档,此前没有任何模型触及过——GPT-5.6 Sol 停留在 High 级别。Critical 意味着模型可以自主发现并构建针对加固真实系统的有效零日漏洞,或者从高层目标出发规划并执行全新的端到端攻击。Astra 在自主编程方面也展现出显著提升,而这正是将评估推向临界线的推手。
应对措施是具体的:OpenAI 正在隔离 Astra 的测试环境,限制其网络和工具访问,加强模型权重的存储和加密方式,并对每一次自主运行进行实时高风险行为监控。公司已暂停所有尚未满足这些加强控制要求的 Astra 内部活动,并在任何发布之前与政府机构和选定的 AI 安全组织合作对该模型进行测试。公司特别指出,Astra 未参与 Hugging Face 入侵事件。
这是前沿实验室首次公开表示因网络风险主动放缓自身某模型的研发工作,发布时机恰逢 Black Hat 当周——OpenAI 员工在会上表示公司一直在"有意识地放缓研究以加强安全"。接连的披露——Hugging Face 事件、Anthropic 三方入侵、OpenAI 第三方评估事故——指向一个令人不安的事实:实验室自身的安全框架正在发挥作用,但这个框架的存在本身就是因为模型不断超出为其构建的 containment 环境。
— OpenAI · TechCrunch 🔗 OpenAI · TechCrunch
Claude Code 将自动模式设为默认,分类器表现优于人工审核
自 8 月 14 日起,Pro、Max 和 Team 计划上的新 Claude Code 会话将默认以自动模式运行。不再要求用户对每个工具调用逐个审批,Claude Code 将每个操作路由经过一个分类器,拦截任何不可逆、破坏性或指向外部环境的操作。如果分类器拦截了某个操作,Claude 会尝试更安全的路径或直接询问;连续三次拦截(或会话中累计二十次)后,系统会回退到人工审批模式。企业版、API 和云部署目前仍为选择性加入,Anthropic 计划在未来一个月内将它们也切换为默认。
关键数据解释了背后的原因。用户对权限提示的批准率高达 97%,而在对 1,053 名付费测试者进行的对照研究中,人类仅能 catch 到 13.6% 的植入危险命令,自动模式则 catch 到 89%。人类表现在大约 50 个提示后衰减至约 5%——审批疲劳是真实存在的,而分类器不会疲倦。另一项由 TrajectoryLabs 进行的 prompt 注入评估运行了 720 次攻击尝试:Claude 模型在自动模式下全部阻止,而 GPT-5.6 Sol 在 Codex 的自动审查模式下成功率为 5.83%,在完全访问模式下为 19.03%。Anthropic 还宣布即刻起不再对分类器的额外 token 收费。
我认为这对大多数人来说是正确的默认设置,但有一个注意事项:自动模式降低风险,而非消除风险,Anthropic 本身也如此声明。在人工审批的会话中出现生产级危害的比例为 6.3%,而自动模式会话中为 2.4%;使用自动模式的团队/企业用户推送的 pull request 数量增加约 25%。值得借鉴的设计细节:分类器能看到用户消息和原始工具调用,但看不到 Claude 自身的推理过程,这让通过获取内容进行 prompt 注入在结构上变得困难。这相比它所取代的橡皮图章式审批对话框,是一个真正更智能的架构。
— Anthropic · 9to5Mac 🔗 9to5Mac · ClaudeKit
Meta 无工具横扫五项 STEM 奥林匹克——并拿下两个物理满分
Meta AI 于 8 月 7 日宣布,其模型在五项精英 STEM 奥林匹克竞赛中摘得金牌或金牌级成绩,且全程不允许使用任何工具:不联网搜索、不代码执行、不用计算器。战果包括在亚洲物理奥林匹克(APhO)和国际物理奥林匹克(IPhO)的理论考试中均取得满分 30/30,在国际数学奥林匹克(IMO)中获得金牌,以及在国际化学奥林匹克和罗马尼亚数学大师赛中达到金牌级表现。APhO 金牌线通常在 21-23/30 左右,满分成绩大幅超越该标准。
零工具约束才是关键所在。大多数实验室通过"强模型 + 验证器 + 多轮优化"流水线取得这些成绩;Meta 关闭了所有辅助手段,让模型仅凭内部推理写出完整证明,在与人类参赛者相同的条件下运行。该模型是内部训练版本的 Muse Spark 系列,使用多智能体编排和并行推理。其背后研究者提到的一个细节:模型发现了官方 IPhO 答案中的错误,从而避免了人类参赛者被误评分——IMO 委员会因此向 Meta 邮寄了一枚实物金牌以示感谢。
但我对此持保留态度。IMO 正在成为一个饱和的基准:华为的 Celia 和小红书的 dots-note-3.0 今年在上海 IMO 均取得 42/42 的成绩,而陶哲轩早在 2025 年就警告过 AI 的奥赛成绩高度依赖于测试的构建方式。物理满分确实令人印象深刻,但需要独立验证,而且奥赛题目——有标准答案和深度历史训练数据——正是 AI 最容易饱和的测试类型。真正的信号是 Meta 正在缩小推理差距;尺子本身已经没有多少余量了。
— Meta AI · AlphaSignal 🔗 Meta AI (X) · AlphaSignal
NSF 向区域 AI 基础设施中心投入 1 亿美元
美国国家科学基金会(NSF)于 8 月 4 日启动了"州与区域 AI 基础设施中心"项目,这是一项 1 亿美元的计划,将资助最多十个区域联盟——每个州或区域一个奖项——为目前处于 AI 驱动科学研究前沿之外的研究者汇聚算力、数据和专业知识。结构是公私成本分担:NSF 资金用于联盟协调、劳动力发展和师资培训,而联盟及其行业合作伙伴提供并运营实际硬件。架构由各区域自行决定,允许本地部署、云端和混合设置。
合作伙伴名单堪称算力界的名人堂:NVIDIA、AMD、Intel 和 Dell Technologies 均承诺提供训练资源、应用学习内容和技术指导,Secunda 创新基金和 Hangar 也参与其中。模板是 2020 年 NVIDIA 与佛罗里达大学的合作——该项目扩展到 300 多名 AI 重点教师,并在全部 16 个学院中产生了 5.11 亿美元的 AI 研究奖项。各中心也被鼓励与 NAIRR 试点项目整合,该试点在两年内支持了 700 多个项目——从蛋白质预测到传染病暴发管理——以及白宫的 Genesis Mission(AI 驱动科学计划)。
我认为值得注意的是这个项目的受众。随着训练成本飙升超出实验室预算,大学已被大规模模型开发拒之门外;该项目直接承认算力获取已成为一个科学公平问题。首批最多十个中心将决定哪些区域组合和算力架构成为范式,而首批奖项将显示这究竟是一个催化剂,还是成为联邦在 AI 研究基础设施中的常态化角色。
— NSF · DataCenterDynamics 🔗 DataCenterDynamics · ExecutiveGov
Figure 03 自主爬梯子
Brett Adcock 于 8 月 1 日发布了一段视频,展示其第三代人形机器人 Figure 03 走向一架梯子并逐级攀爬,全程无可见的远程操控——用他的话说,是"完全自主"。爬梯子看起来简单,实则不然:机器人必须协调手臂和双腿,将全身重量转移到狭窄的横档上,并在实时感知每个横档相对于自身的位置。行走只用脚;梯子上则需要手和脚共同承重,重心判断失误就意味着坠落。
Figure 将这次演示归功于其 Helix System 0(S0)模型的升级,该模型现在融合了实时立体视觉和本体感知——即机器人对关节位置和平衡的内部感知。RGB 帧被处理成地形的 3D 表示,同时模型持续追踪身体状态,从而实现更精确的落脚 placement。这些行为通过仿真中的强化学习端到端训练,Figure 声称这些策略可以零额外微调迁移到物理机器人上——这将是对 sim-to-real 问题的有力回应。这段演示承载着一个更大的主张:生产规模已从每天一台扩展到每小时一台,已交付 350 多台机器人,Figure 03 已重返宝马工厂,在流水线上分拣随机排列的零件并拉动载重推车,同时上下梯子。
需要注意的是,这些都未经独立验证,一段视频展示的是能力而非可重复性——没有失败率、没有功耗数据、没有测试约束条件的披露。尽管如此,Adcock 的更广泛论点值得认真对待:"轮式机器人是一条死路",因为人类环境——楼梯、梯子、卡车、屋顶——是为双腿双臂建造的。如果垂直机动能力持续进步,棕色地带工厂就不再需要轮式 AGV 的妥协方案。这是一个很大的假设,但爬梯子是迄今为止最具体的证据,表明差距正在缩小。
— Figure · Interesting Engineering 🔗 Figure / Brett Adcock (X) · Interesting Engineering
一个 350 亿参数模型在消费级 GPU 上自学 ML 工程,几乎追平 Kimi K3
Frontis.AI 的 Horizon Research 团队与清华大学联合于 7 月 30 日在 arXiv(arXiv:2607.28568)上发表了一篇预印本,探讨了他们所称的"AI for AI"——即每一代更智能的 AI 都应帮助生产下一代,形成递归自我改进循环。为了使这一目标可衡量,他们选择机器学习工程作为测试平台:一种 Kaggle 风格的任务,系统获取数据、编写预测程序、迭代结果并最终获得评分。每次尝试都真实运行,耗时数分钟到数小时,并产生明确的反馈,这使得它成为智能体学习的天然环境。
具体结果:Frontis-MA1-35B,一个 350 亿参数模型,基于其开源 OpenMLE 工具链训练,在 MLE-Bench Lite 上达到 71.21% 的奖牌率。这胜过了 GPT-5.5 加上 Codex 的组合,并几乎追平 Kimi K3——一个参数量约为其 80 倍的模型。令"更大即更好"派感到不安的细节:整个流水线运行在一张消费级 RTX 4090 上,每个任务仅有 12 小时的算力预算。
我不会称之为 AGI,但这个方向值得关注的并非一个基准分数——关键在于一个 350 亿参数的模型,借助小模型的效率加上搜索框架,在一类奖励真正迭代的任务上逼近 2.8T 前沿模型。递归自我改进多年来一直是理论;这是其首批可复现的测量结果之一。接下来问题是:这个循环是否会复合,还是基准本身会先被饱和。
— Frontis.AI · 清华大学 · arXiv 🔗 arXiv
Moonshot 以 500 亿美元估值启动 pre-IPO 轮
据《科创板日报》和《凤凰网科技》报道,中国 AI 实验室 Moonshot AI 于 8 月 5 日以 500 亿美元投后估值启动 G 轮——即 pre-IPO 轮。这是一个令人震惊的三个月轨迹:该公司估值从 180 亿美元,到 350 亿美元(F 轮融资 35 亿美元,提前关闭,超额认购三倍),再到现在的 500 亿美元。催化剂是 Kimi K3,这个 2.8 万亿参数的开放权重模型于 7 月 27 日发布,根据 Artificial Analysis 的数据,其在 BrowseComp 上以大约 GPT-5.6 Sol 一半的单任务成本提供第一梯队性能。
条款相当激进。投资者须在 8 月 15 日前出资,直接进入股东名册需要管理至少 5 亿美元的资产;按约 10% 的稀释比例计算,融资额将接近 60 亿美元。公司否认了本月将在香港提交 IPO 申请的报道,称 G 轮仍在进行中,可能在关闭后六个月内上市。从招股说明书看基本面:2025 年营收 16.99 亿元人民币,净利润 2.78 亿元;2026 年上半年营收预计 10.52–11.28 亿元,同比增长 35.6–45.4%。API 收入已超过总收入的 70%。
市场背景值得关注。智谱和 MiniMax 已分别在港股上市,市值分别约为 4,370 亿港元和 710 亿港元,因此 500 亿美元的 Moonshot 将登顶该板块。这里有趣的风险在于集中度:Moonshot 的估值几乎完全押注于一次模型发布,而从模型的热度到收入验证之间的时间窗口,恰恰是 Chinese AI 估值最容易波动的区间。如果这轮以 500 亿美元关闭,这将是 K3 势能是真实资金而非仅仅炒作的最强私营市场信号。
— 科创板日报 · 凤凰网科技 🔗 科创板日报 · 凤凰网科技