OpenAI 内部安全文档显示,其未发布模型 Astra 在网络安全风险评级中可能首次达到"严重"级别,已能独立发现真实系统的零日漏洞,GPT-5.6 Sol 仅"高"级。
如果你这周一直在关注 AI 领域,有一个现象很难忽视:这些模型的构建者开始变得不那么笃定,反而更加谨慎了。说实话,这是我几个月来读到的最令人鼓舞的文章。
让我来梳理一下实际发生了什么。
这个是大新闻,而且是真正的大新闻。OpenAI 发布了一份 29 页的安全文档,叫做 Preparedness Framework,里面藏着一个让我喝咖啡时差点呛到的细节:他们尚未发布的模型 Astra,可能是第一个获得"严重"(Critical)网络安全风险评级的 LLM。
先交代一下背景。Astra 上周首次亮相时,静悄悄地在十分钟内解决了十个长期悬而未决的数学问题——那种让研究人员困扰多年的问题——OpenAI 随后公布了证明过程。据说每个证明消耗的 token 费用约为 2000 美元。挺酷的把戏,没错。
但这次发出红旗的原因不一样。在 OpenAI 自己的评级体系里,如果一个模型能够独立发现加固过的真实系统中的零日漏洞,而无需人工引导,它就会达到"严重"评级。他们的旗舰模型 GPT-5.6 Sol 只获得了"高"(High)评级。Astra 正在逼近下一个等级。
那他们实际上做了什么?这是让我尊敬的部分。他们没有耸肩就直接发布。Astra 被禁止接入公共网络,只在沙盒测试环境中运行,限制网络和工具权限。所有在这些沙盒之外开展的开发工作都暂停了。他们在加强模型权重的加密保护,防止黑客窃取模型。他们还接入了可观测性系统,通过分析 Agent 的思维链来监控 Astra 本身是否有恶意行为。
这里面有很多值得深挖的内容,而且并非所有内容都让人舒服。一个能够入侵加固系统的模型,确实是一种令人不安的能力。但反过来说也有道理:OpenAI 把这件事告诉了我们,记录在案,并在发布前加上了安全护栏。公平地说,这比假装一切太平要健康得多。
诚实的保留意见?我们完全不知道这些沙盒在压力下能撑多久。这是前沿领域,从未有人在这个规模上做过。
不同的大陆,同样的"如何让 AI 在这里真正发挥作用"问题——只不过这次是合规问题,而非能力问题。
苹果发布了一份指南,允许中国大陆的 Mac 用户将阿里巴巴的 Qwen AI 接入 Siri 和写作工具。表面上看,这只是一条小的集成说明。但实际上,它反映的是 AI 领域已经变得多么复杂。
现实情况是:Apple Intelligence 确实是个不错的产品,但在中国以目前的形式没有上市路径。本地法规、数据驻留要求,等等。因此,苹果没有选择等待,而是采用了一个符合当地规范的模型——选择 Qwen 是明智的,因为它本身实力够强、开源,且不携带美国前沿模型在该市场会面临的监管包袱。
竞争的潜台词才是有趣的部分。联想、华为等本土厂商一直在中国市场力推自己的 AI 功能,苹果的份额一直在流失。这显然是一招棋,在遵守监管的前提下抢回一些失地。
阿里巴巴也在这里赢得了一个低调的胜利。Qwen 得以在自有生态系统之外获得分发,借苹果的硬件触达一大批新用户。开源模型总是能找到办法,仅仅因为"可用"就能赢。
坦白说:当我第一次看到"Cloudflare OS"时,稍微翻了个白眼。现在人人都把自己的东西叫操作系统。但看了实际的公告之后,这个定位比我预期的更有道理。
它不是传统意义上的操作系统——没有内核、没有驱动、没有启动序列。它是一个 Agent 工作空间。它的核心思路是:你从浏览器中的一段对话开始,跟其他一大堆工具一样,但区别在于每次对话都基于你的组织已经整理好的上下文和技能。给它一个目标,它就能接入你公司已经在用的工具和数据,在隔离的运行时环境中编写和运行代码,然后给你返回一个真正有用的结果,而不是一个泛泛的答案。
"操作系统"这个说法有两层含义:它是一个帮助公司安全地使用 AI 提效的操作系统——这样安全团队晚上能睡好觉;它也是一个管理 AI 工作负载的操作系统,如同传统操作系统管理计算资源一样。
它采用 Apache 2.0 开源,这才是我真正在意的点。一个企业可以检查、修改和自托管的开源 Agent 框架,正是那种可能真正改变 AI 在真实组织内部部署方式的东西,而不是又一个按席位租用的围墙花园。
我心里的怀疑者提醒说现在还早。Cloudflare 内部工具的开源公开化,并不意味着它已经对外部用户足够成熟。但方向——开源、接地、治理优先——是对的。
如果你想听听接地气的、略带怨气的 AI 编程炒作现实核查,看看 Greg Kroah-Hartman 就够了。他负责管理 Linux 内核的很大一部分,刚刚宣布暂存区(staging area)——也就是新内核开发者学习入门的地方——现在将自动拒绝 LLM 生成的补丁。只有一个例外:真正的安全修复,而且即使是那些也必须先在真实硬件上测试。
他的理由值得引用,因为它切中要害。他指出 drivers/staging 存在的主要目的,是作为新人学习如何参与内核开发的健身房。里面到处都是"低垂的果实"——代码清理、API 变更——这些非常适合教人们熟悉流程。当 LLM 大量输出这些清理工作时,它完全违背了这个地方存在的初衷。
最精彩的部分来了,我很喜欢:他说 LLM 现在很擅长发现可疑的安全问题,但它们生成的内容中至少三分之一是完全错误或有害的。所以即使有安全例外条款,你也必须在真实硬件上验证,并愿意为之辩护。
背景很重要。Linus Torvalds 本人也认为 AI 是一个工具,并坚持内核并非反 AI。有一些地方是欢迎 LLM 生成工作的。但这是一条有意划定的底线:对于教不会人任何东西的跑腿活,不行;对于你能验证的真正修复,也许可以。
作为一个看着大量低质量的 AI 提交淹没维护者的人,我觉得这番表态令人耳目一新、头脑清醒。价值不在于生成更多补丁,而在于生成值得审查的补丁。
换个话题,来点真正有趣的东西。有一份资料正在流传,讲述的是有人把自己的手机变成了由本地 LLM 驱动的 AI Agent,它能够自行安装软件,全部从网页浏览器控制。
这个设置使用了名为 RikkaHub Agent 的方案。你口袋里的手机实际上对于运行模型来说是个糟糕的计算机——热管理和内存限制非常严苛。但它是 Agent 的绝佳"身体":传感器、通知、消息、文件、触摸屏,以及在现实世界中触发事件的能力。所以诀窍是把大脑放在别处,让手机充当手。
这是我一直告诉人们要关注的方向。有一段时间,Agent 的讨论一直被"哪个云 API 能帮我完成任务"所主导。但本地和端侧 Agent 正在悄然成为更有意思的故事——隐私保护、没有按 token 计费的账单,而且模型就在你的数据所在的地方。
诚实的保留意见:本地 LLM 在推理密集型任务上仍然落后于前沿模型,而且让 Agent 不在实际操作中翻车确实是件很难的事。但这正是那种最终会决定整个领域未来几年走向的尝试性探索。
最后一个,是藏在眼皮底下被你忽略的基础设施故事。SK Telecom 和 Rebellions 正在扩展韩国的 AI 推理基础设施,进一步迈向主权 AI 领域。
其中的潜台词才是重点。英伟达在全球主权 AI 模型的训练方面仍然占据主导地位——这部分没有变化。但在推理——模型实际投入生产使用的环节——非英伟达玩家看到了他们的机会。韩国电信和芯片初创公司建设自己的推理能力,这种"无聊"的基础设施投资,比任何单一模型的发布都更安静地重要。
纵观本周的所有事件,有一个模式:主权意识、合规、本地模型、开源框架。"一个大模型在一个大数据中心"的年代正在让位于一个更加混乱、更加分布式的格局。对于像我们这样真正使用这些东西的人来说,这总体上是一件好事。
这就是本周的 AI 要闻,从让创造者自己都感到恐惧的模型,到叫停机器人慢下来的内核维护者。其中很多确实令人鼓舞——安全讨论、开源精神、本地优先的尝试。有些也让人警醒。这可能才是正确的配比。
如果你正在基于这些技术构建什么——或者仅仅是因为 API 账单太离谱而在自己机器上跑一个本地模型——我很想听听什么对你有效,什么让你抓狂。
顺带一提,如果你在这之外还在兼顾副业或边项目,需要一个简单的方法来理清账目,我一直在用 PayCalc 来做合理性检查。当 AI 炒作声音太大时,它帮我保持清醒。