Kimi K3 和 GLM-5.3 在性能上已接近美国最佳模型,西方实验室指责蒸馏,但无论是否成立,模型领先优势已难以维持,需要寻找新的差异化路径。
Kimi K3 和 GLM-5.3 现已逼近美国最顶尖的模型。西方实验室将其归咎于蒸馏,而且确有证据支持这一说法。但无论是否属实,结论都是一样的:模型领先优势无法防守。本期就来探讨还有什么可以依仗。
每年六次,《THE DECODER》编辑团队会在"Frontier Radar"中深入探讨一个核心 AI 话题。它以通讯形式发布,仅面向《THE DECODER》订阅用户,在网站上独家提供。本期是迄今为止规模最大的一期,耗时也超出了预期。怪这个话题吧:我们探讨中国 AI 模型如何赶上、西方实验室还能在哪里突围、为什么行业护城河已经转移,以及为什么欧洲正在同时输掉两场竞赛。第一期涵盖 AI 智能体现状。第二期审视 AI 对生产力的可衡量影响。第三期涵盖新兴的 AI 代币经济。
一年半前,DeepSeek R1 引发了震动。一家中国实验室突然在商业推理模型领域与 OpenAI 的 o1 展开竞争——据报道,其投入的资金要少得多。市场紧张起来。短短几天内市值蒸发数十亿。计划中的基础设施建设是否被过度夸大了?
当时的实际情况比标题新闻所呈现的更加模糊。在 DeepSeek 自己的报告中,R1 在 AIME 2024 等单项测试中超越了 o1,但在其他测试(如事实知识 SimpleQA)上明显落后。后续的基准测试暴露了更多差距。中国模型仅在个别学科达到顶尖,而非全面领先。
就在六月底我们开始本期工作时,Z.ai 的 GLM-5.2 仍然呈现相同的模式。随后最新一批中国开源权重模型问世:Moonshot 的 Kimi K3、阿里巴巴的 Qwen3.8-Max 以及 GLM-5.3。
中国模型如今几乎在所有广泛且高要求的评估中都接近榜首。它们处理长知识任务、多步骤代码编写,以及协调工具的能力都比前辈可靠得多。
以常用基准衡量,人们常引用的几个月差距已经缩小到开始成为投资者的难题。据《华尔街日报》报道,Anthropic 在即将 IPO 前正面临棘手的问题,并在防御中指出其仍位居榜首的领先地位。在该层级之下,市场主要由来自中国的开源、低价模型占据。
投资者担心,纯粹的模型性能已难以支撑业务。无论模型今天能独家做什么,几个月后一个可免费下载的模型就能做到。
目前存在两种指控:中国实验室涉嫌以西方模型为师——这种做法被称为蒸馏;以及他们涉嫌针对高基准分数调优模型,却不具备相应的广泛能力——即所谓的 benchmaxzing。
美国的领先优势并未消失。但它已退缩到所谓前沿——技术可能性的前沿——中几个越来越狭窄的领域。这种领先还剩什么,其经济价值几何,是本期的第一个问题。
第二个问题随之而来。如果单凭模型已无法形成明显差异,那领先优势建立在什么之上?我们的论点:越来越不靠模型本身,而越来越靠围绕它的整体系统,也就是持续产出下一代模型的工作系统所在之处。
剩余的领先优势
发布时,Artificial Analysis 的智能指数将 K3 排在第三位,得分 57,紧随当时的领先者 GPT-5.5 和 Opus 4.8 之后。K3 在智能体任务上提升最大,而这正是企业应用中真正重要的实操工作。在 AutomationBench-AA 上,K3 甚至一度位居榜首,直到 Anthropic 以 Opus 5 回应。
在 CEO-Bench 上——智能体运营一家虚构软件公司模拟 500 天——K3 创下了 2215 万美元的最佳公开单次运行成绩。中国模型,包括其前身 K2.7,在这些长期任务中经常失败。Qwen3.8-Max 达到了类似的高整体水平。仍有一个警告:较新的中国模型有时消耗的 token 远多于西方模型,这侵蚀了部分价格优势。每任务成本计算仍然适用。
当前模型能力的前沿一直在以不均匀的速度扩展,研究人员称之为"锯齿状前沿"。各项能力以不同速度推进,这就是为什么被广泛引用的几个月差距总是取决于谁测量了什么。新的变化在于西方领先优势仍然可衡量的领域。三个方面依然存在。
首先是抽象专业测试。K3 发布后不久,Opus 5 以 61 分重新夺回指数榜首,领先 K3 的 57 分。在 ARC-AGI-1 上——使用小 puzzle 网格测试抽象模式识别——K3 和 Fable 5(Anthropic 面向编码和智能体工作的旗舰系列)几乎持平,分别为 94.5% 和 98.5%。只有在 ARC-AGI-2 上,差距才扩大:60.4 对比 89.2。但 ARC-AGI 有意测量的是与日常任务相去甚远的抽象模式识别。这个差距能否预测实际差异尚无定论。在大多数情况下,它可能 simply 在经济上无关紧要。
其次是可靠性。8 月 12 日发布的 AA-AnalystAgent 基准测试,在真实表格和文档上测试智能体数据分析。它 only counts a task as solved if a model gets it right in five out of five independent runs,运营商称之为 pass^5。Opus 5 以 54% 领先, ahead of GPT-5.5 at 50。K3 是表现最好的开源模型 at 39%。
差距几乎完全来自可重复性差。K3 在五次尝试中至少一次解决 73% 的任务,与 Opus 5 的 74% 几乎持平。可靠性并不遵循通常的智能指数排名。即使是 GPT-5.6 Sol 在这方面也落后于自己的前代产品。
在商业上,可靠性权重很大,正如运营商在发布文章中所解释的。分析师智能体 only saves work when its answers hold up without review。多次运行和检查器可以弥补,但它们会增加每个被接受结果的成本。
第三个是网络安全。差距在这里有据可查。英国 AISI 和美国 CAISI 的联合评估发现,K3 在进攻性网络能力方面远落后于美国领先模型。
在 ExploitBench 上——测试漏洞利用开发——K3 得分为 32%。美国顶级模型平均约为 76%。K3 在所有需要目标系统上执行代码的 41 项任务中都失败了;美国领先模型平均解决 20 项。在模拟攻击中,K3 到达了 32 步中的第 17 步,美国领先者平均到达 28.5 步。
但这个差距也在缩小。8 月 14 日发布的 GLM-5.3,在 Z.ai 自己的测量中 ExploitBench 得分为 54.4%,是其前身 GLM-5.2 的两倍多。这将与美国领先者的距离大约缩小了一半。在源代码中查找和验证漏洞方面(CyberGym),GLM-5.3 甚至略微超越了美国领先模型。
与此同时,网络安全是提供商不会公开销售其最强能力的唯一领域。Anthropic 最好的网络模型 Mythos 5 在 ExploitBench 上达到 78%,仅通过 Project Glasswing 在受控条件下提供。其公开兄弟模型 Fable 5 实际上保持在较老的 Opus 4.8 水平 at 40%,因为上游安全措施拦截了 410 个测试集中的 407 个。
OpenAI 对 Daybreak 和专用网络变体采取类似方法。GPT-5.6 Sol 在 OpenAI 自己的评估中 ExploitBench 达到 73.5%,但保持在 Critical 以下——OpenAI 风险等级的最高级别。对于即将推出的 Astra,OpenAI 首次无法排除其自有模型跨越该阈值的可能性。如果真的跨越,准备框架将更加严格地启动,直至完全停止开发。OpenAI 已经暂停了一些内部 Astra 工作。
而通过 GLM-5.3,一家中国实验室首次采用了这种模式。Z.ai 将权重发布延迟约两周以进行额外的安全工作,并计划将最敏感的网络功能限制在经验证的用户范围内。
剩余的领先优势可以这样总结:抽象专业测试中的差距可衡量,但其经济价值不清楚。可靠性差距在商业上最重要,但最不稳定——当较新的模型在同一实验室中落后于自己的前代产品时(GPT-5.6 Sol 对比 GPT-5.5),该排名显然在波动。
网络安全差距涉及的能力几乎没有任何客户可以通过常规渠道购买,而且即使是这个差距最近也急剧缩小。只有少数危险能力可以被隔离。商业上有价值的其余部分——如编码、研究、智能体工作——必须通过 API 保持可访问,否则就没有业务可言。而这正是领先优势在几个月内缩小的地方。
The obvious suspicion is that the two are connected. Chinese labs could be using Western models as teachers through their APIs (the distillation mentioned earlier) and the lead would then hold exactly where that access is missing. There are good reasons for this suspicion, and we'll get into how Chinese labs might profit from the knowledge inside Western models below.
明显的怀疑将两者联系在一起。中国实验室可能正通过 API 使用西方模型作为老师(即前文提到的蒸馏),而领先优势恰好就存在于那些缺乏 API 访问权限的地方。这种怀疑有充分的理由支持,下面我们将深入探讨中国实验室如何从西方模型的知识中获益。
But first, for the strategic assessment, the question of guilt is almost secondary. If the suspicion is true, every capability sold eventually migrates to the competition, because there's still no reliable way to prevent the skimming. If it's not true, Chinese labs caught up on their own, and the lead was worth even less.
但首先,从战略评估的角度看,责任的归属几乎是次要的。如果怀疑属实,所有售出的能力最终都会流向竞争对手,因为目前仍没有可靠的方法来防止这种"揩油"。如果怀疑不实,中国实验室是自主赶超的,那领先的价值就更低了。
Both readings lead to the same place. A model lead only holds where the product isn't broadly offered in the first place, and you can't build a business on that. A close look at distillation is still worthwhile, because its mechanics decide whether any defensible model capabilities exist at all.
两种解读殊途同归。模型领先只存在于产品本身就没有被广泛提供的地方,而这无法支撑起一项业务。仔细审视蒸馏仍然是值得的,因为其机制决定了是否存在任何可防御的模型能力。
蒸馏解释的是速度,而非广度
OpenAI and Anthropic accuse Chinese companies of using their models at scale to build their own. According to Anthropic, industrial campaigns by DeepSeek, Moonshot, and MiniMax ran more than 16 million interactions through around 24,000 fraudulent accounts. The campaign attributed to Moonshot targeted agent reasoning, tool use, coding, and reasoning traces with more than 3.4 million interactions. That fits with Together AI finding a 0.72 correlation between the task-level success rates of K3 and Fable 5 on real software problems, and with a style analysis by Typebulb placing K3 closest to Fable 5.
OpenAI 和 Anthropic 指控中国公司大规模使用他们的模型来构建自己的模型。据 Anthropic 称,DeepSeek、Moonshot 和 MiniMax 的工业级活动通过约 24,000 个欺诈账户运行了超过 1600 万次交互。归因于 Moonshot 的活动以 AI 智能体推理、工具使用、编码和推理痕迹为目标,交互量超过 340 万次。这与 Together AI 发现 K3 和 Fable 5 在真实软件问题上的任务级成功率存在 0.72 相关性的结论吻合,Typebulb 的风格分析也将 K3 判定为与 Fable 5 最接近的模型。
Critics counter that the window between Fable 5's release and K3's was too short to influence training. But Opus 4.8, a closely related model, was available much longer, and the same studies show clear overlaps there too. OpenAI describes a similar pattern with DeepSeek in its memorandum to the US Congress. None of the labs has published verifiable evidence, though, and our inquiries with OpenAI and Anthropic turned up nothing new.
批评者反驳称,从 Fable 5 发布到 K3 发布的时间窗口太短,不足以影响训练。但 Opus 4.8——一个高度相关的模型——在更早之前就已经可用了,同样的研究在那里也显示了明显的重叠。OpenAI 在其提交给美国国会的备忘录中描述了与 DeepSeek 的类似模式。然而,没有一家实验室发布过可验证的证据,我们对 OpenAI 和 Anthropic 的询问也没有发现新内容。
Still, the known accusations and several research papers make it possible to reconstruct how Moonshot, DeepSeek, and others could benefit from distillation during training.
不过,已知的指控和多篇研究论文使得我们可以重建 Moonshot、DeepSeek 等如何在训练中从蒸馏中获益。
In pretraining, a model learns basic capabilities from massive amounts of text. Midtraining switches to less but higher-quality data, and post-training shapes behavior through supervised fine-tuning and reinforcement learning. Distilled data can plug in at almost any of these stages.
在预训练阶段,模型从海量文本中学习基本能力。中训练阶段转向更少但质量更高的数据,而后期训练通过监督微调和强化学习来塑造行为。蒸馏数据可以插入到几乎任何一个阶段。
A leading Western model answers tens of thousands of selected tasks, complete with solution paths and tool calls. The best answers flow into midtraining or fine-tuning, and the student model picks up the teacher's solution patterns.
一个领先的西方模型回答数以万计的精选任务,并附上完整的解决路径和工具调用。最佳答案流入中训练或微调阶段,学生模型从中习得老师的解题模式。
For reinforcement learning, the teacher doesn't even need to be live anymore. The collected data can be used to build reward models.
对于强化学习,老师甚至不需要在线了。收集到的数据可用于构建奖励模型。
Anthropic's report shows this is no thought experiment. In the campaign attributed to DeepSeek, Claude processed grading tasks at scale using predefined rubrics, effectively serving as a reward model for someone else's reinforcement learning. Research on multi-teacher on-policy distillation and reward model distillation shows how the method works across entire training pipelines.
Anthropic 的报告显示这不是思想实验。在归因于 DeepSeek 的活动中,Claude 使用预定义的评分标准大规模处理评分任务,实际上充当了他人强化学习的奖励模型。关于多教师同策略蒸馏和奖励模型蒸馏的研究表明,这一方法如何贯穿整个训练流程发挥作用。
The hard limit is access: Anyone distilling through a foreign API only sees what the interface returns. Weights, internal evaluations, and search processes stay hidden. Research on black-box distillation describes exactly this constraint.
硬性限制在于访问权限:任何通过境外 API 进行蒸馏的人只能看到接口返回的内容。权重、内部评估和搜索过程都是隐藏的。黑盒蒸馏研究描述的正是这一限制。
The rise of reasoning models opened another door, however: reading out the reasoning chains. Labs deliberately restrict that visibility. OpenAI provides only summaries of the chains of thought, Anthropic shows extended thinking in limited form, and xAI transmits reasoning encrypted.
然而,推理模型的兴起打开了另一扇门:读取推理链。各国实验室有意限制这种可见性。OpenAI 只提供思维链的摘要,Anthropic 以有限形式展示延伸思考,而 xAI 则以加密方式传输推理过程。
The extraction was never fully preventable, though. A study published August by a team led by security researcher Alexander Panfilov shows that the encrypted reasoning traces of top models could be read out through an API vulnerability. The providers have since closed the gap.
但提取从未被完全阻止。安全研究员 Alexander Panfilov 领导的团队在 8 月发表的一项研究表明顶级模型的加密推理痕迹可以通过 API 漏洞被读取。相关提供商此后已封堵了这一漏洞。
The same paper delivers the most specific evidence yet for the distillation thesis. When K3's reasoning is prefilled with a few tokens from decrypted Opus reasoning traces, its answers shift measurably toward Opus. And individual Claude and GPT reasoning passages could be extracted from K3 up to six orders of magnitude more easily than from the next-most-similar model. The team also reads K3's weak cyber results as a clue: a strong teacher was hard to reach there, because Anthropic shields those capabilities with extra safeguards.
同一篇论文提供了迄今为止蒸馏论题最具体的证据。当用解密后的 Opus 推理痕迹中的几个 token 对 K3 的推理进行预填充时,其答案明显向 Opus 靠拢。Claude 和 GPT 的个别推理段落从 K3 中提取的难度比从下一个最相似模型中提取容易多达六个数量级。该团队还将 K3 较弱的网络战结果解读为一个线索:在那一领域难以触及强大的老师,因为 Anthropic 用额外的安全措施防护了那些能力。
The Chinese labs' own substance argues against distillation as the full explanation. Moonshot's report documents a training pipeline built entirely in-house, and DeepSeek regularly publishes architecture improvements at the deepest level. GLM-5.3 also puts the cyber clue in perspective. Z.ai attributes its own jump to post-training effects - its own training environments, in exactly the area where a Western teacher is hardest to reach.
中国实验室自身的实质性成果也反驳了蒸馏作为完整解释的说法。Moonshot 的报告记录了一条完全自主开发的训练流程,DeepSeek 定期在最深层发布架构改进。GLM-5.3 也将网络战线索置于更合理的视角。Z.ai 将自身的跃升归因于后期训练效果——他们自己的训练环境,恰好在西方老师最难触及的领域。
Distillation isn't a Chinese specialty either. Elon Musk confirmed under oath that xAI used OpenAI models for it. ByteDance, meanwhile, claims to have post-trained Doubao-1.5-pro without data from other models.
蒸馏也不是中国的专利。Elon Musk 在宣誓后证实 xAI 使用了 OpenAI 模型进行蒸馏。与此同时,ByteDance 声称在后期训练 Doubao-1.5-pro 时没有使用其他模型的数据。
The targeted labs are calling for government protection, and Washington seems willing to deliver. The White House has declared distillation campaigns against US models a national security threat by memorandum, the Deterring American AI Model Theft Act cleared committee unanimously, and senators followed up with the BLADE Act. Anthropic's Mythos 5 and Fable 5 are now under export controls - the first time the US government has controlled access to a model itself.
被针对的实验室正在呼吁政府保护,华盛顿似乎愿意提供。白宫通过备忘录宣布针对美国模型的蒸馏活动为国家安全威胁,《阻止美国 AI 模型盗窃法案》无异议通过委员会,参议员随后又提出了《BLADE 法案》。Anthropic 的 Mythos 5 和 Fable 5 现已处于出口管制之下——这是美国政府首次对模型本身的访问进行管控。
The broader step of restricting open models or distillation in general lacks wide support, though. In late July, 25 companies including Nvidia, Microsoft, and Meta warned against premature restrictions. OpenAI and Anthropic didn't sign.
然而,限制开放模型或全面限制蒸馏的更广泛举措缺乏广泛支持。7 月底,包括 Nvidia、Microsoft 和 Meta 在内的 25 家公司警告不要过早限制。OpenAI 和 Anthropic 没有签署。
Mark Zuckerberg then even declared learning from everything observable, including distilling competing models, a principle worth protecting. That's self-serving - Meta trails on closed models and wants to take on China with American open-weights models. But it shows something. When a company with these resources elevates learning from other models' outputs to a principle, it considers this one of the fastest ways to catch up.
Mark Zuckerberg 随后甚至宣称,从一切可观察的事物中学习,包括从竞争模型的蒸馏中学习,是一条值得保护的原则。这是自利的——Meta 在封闭模型上落后,想用美国的开放权重模型与中国竞争。但这说明了一些东西。当一家拥有如此资源的公司将学习其他模型输出提升为一项原则时,它认为这是赶超最快的途径之一。
In short: distillation can explain much of the pace, and the clues are plentiful. But as long as Anthropic and OpenAI don't disclose more, clues are all they are.
简言之:蒸馏可以解释大部分的速度,线索也很充分。但只要 Anthropic 和 OpenAI 不披露更多,它们就仍然只是线索。
Either way, everything US providers' APIs put out currently migrates to the competition within months. What they hide may only buy time, and no law makes outputs unobservable.
无论如何,美国提供商 API 当前输出的所有内容都会在几个月内迁移到竞争对手那里。他们隐藏的东西可能只是争取时间,没有法律能让输出变得不可观察。
The only thing that holds is what's never offered in the first place - and you can't sell any of that. If the American lead is going to last, it has to live somewhere other than the model.
唯一站得住脚的是最初就根本不提供的东西——但这些东西无法变现。如果美国的领先要持续下去,它必须存在于模型本身之外的地方。
Dean Ball, co-author of the American AI Action Plan and now at OpenAI, argued before his move that systems acting autonomously for days raise entirely different questions than chatbots, like about liability, oversight, and control of running processes.
Dean Ball 是《美国 AI 行动计划》的合著者,现任职于 OpenAI,他此前曾指出,能自主运行数天的系统引发的 问题与聊天机器人完全不同,涉及责任、监督和对运行中流程的控制。
What applies to responsibility applies equally to competition. Once value comes from workflows that run for days, it's no longer just models competing but the systems that carry those workflows: the control software around the model, the compute it gets, and the environment where it works with tools, permissions, and restore points.
适用于责任的逻辑同样适用于竞争。一旦价值来自运行数天的工作流,竞争的就不只是模型本身,而是承载这些工作流的系统:围绕模型的控制系统、它获得的算力,以及它使用工具、权限和还原点运作的环境。
How much this scaffolding matters can be measured, at least partly. The UK AI Security Institute shows that software engineering results rose about 25 percent when a model got ten million tokens per task instead of one million. Some cyber tasks only became solvable above that threshold.
这种脚手架的重要性至少可以部分量化。英国 AI 安全研究所的研究表明,当模型每任务获得一千万 token 而非一百万 token 时,软件工程结果提升了约 25%。一些网络任务只有超过该阈值才能解决。
The harness, meaning the control software, has an even bigger effect. When OpenAI merely kept the reasoning state between steps and compressed context differently in an ARC-AGI-3 evaluation, Sol's score nearly tripled, from 13.3 to 38.3 percent, at a sixth of the output tokens. Same model, different system, triple the performance.
而控制软件(即线束)的影响更为巨大。当 OpenAI 在 ARC-AGI-3 评估中仅是在步骤之间保留推理状态并以不同方式压缩上下文时,Sol 的分数就几乎增加了两倍,从 13.3% 升至 38.3%,而输出 token 仅为原来的六分之一。同一个模型,不同的系统,三倍的性能。
But the control software only goes so far as a moat. Anyone who queries a foreign agent system intensively sees the tool calls alongside the answers and can learn orchestration patterns from them. And the harness is software in the end, as Anthropic learned this spring. In the Claude Code leak, an accidentally shipped source map exposed roughly 513,000 lines of source code, and the takedowns went nowhere because clones had long since preserved the architecture in public. Comparable harnesses are open anyway. OpenAI's Codex is open source, as are DeepSeek's agent tools.
但控制软件作为护城河的作用是有限的。任何密集查询境外 AI 智能体系统的人都能在答案中看到工具调用,并从中学习编排模式。而线束终究是软件,Anthropic 今年春天就领教了。在 Claude Code 泄露事件中,一个意外发布的 source map 暴露了大约 513,000 行源代码,而删除请求毫无作用,因为克隆版本早已将架构保存在了公开场合。类似的线束本来就是开放的。OpenAI 的 Codex 是开源的,DeepSeek 的 AI 智能体工具也是。
只有一个部分的智能体系统无法被复制:其运行中的操作。锚定在客户系统中的凭证、测试环境、日志、干预权限——这些无法被查询或泄露。竞争对手只能靠自己来构建,需要自己的基础设施和自己的客户。
为什么这个位置比模型领先更有价值?智能体能力的最大推动力是在专门构建的训练环境中的强化学习,即带有测试的编程任务、模拟工具、可验证结果的任务,加上购买的专家知识——这早已是一个数十亿美元的市场。
两者对任何愿意付费的人都是可用的,包括中国的实验室,这在一定程度上解释了中国是如何追赶上的。无法买到的是知道哪些任务实际出现在真实公司中、模型在哪里失败,以及客户能接受什么样的结果。
OpenAI 部署子公司 DeployCo 的 CTO Arnaud Fournier 在接受我们编辑团队采访时,描述了这个反馈通道是如何运作的。他说,OpenAI 不会"除非有人明确要求"在客户数据上进行训练,而且这种研究合作很罕见。
相反,这个通道是通过模型弱点和工具需求来运转的。如果客户团队发现文档理解效果不佳,研究部门就会获取有针对性的数据并修复它。这就是为西班牙对外银行(BBVA)构建的解决方案从 GPT-5.0 到 5.5 显著改进的方式。而客户的编排需求首先产生了开源仓库 Swarm,然后是 Agent SDK。
因此,这个通道携带的原始数据比关于下一步该构建什么的知识要少。这正是蒸馏无法复制的东西。它复制的是已发布的模型,而不是下一代从中学习的通道。谁拥有那个通道,谁就能构建匹配真实工作的训练环境。谁只是在复制,就永远是从昨天的状态学习。关键的合作条款问题变成了:提供商可以从客户部署中把什么迁移到他们的模型和训练环境中。
不过,这个反馈通道不应该被高估。大多数进展仍然发生在实验室内部,而不是在客户那里。它值多少钱取决于一个开放的研究问题:部署经验究竟如何转化为模型能力。
Dwarkesh Patel 认为,真正能工作的智能体的核心障碍在于模型缺乏持续学习——即能够将经验即时整合进权重,而不是只在模型生成到模型生成的过程中学习。因此,Andrej Karpathy 认为智能体距离真正的同事身份还有大约十年的时间。
Nathan Lambert 认为那些权重更新并非不可或缺的,因为扩展加上更好的记忆系统实际上也能达到同样的效果。如果他是对的,积累的经验将存在于客户控制的数据中,对运营商的锁定就会更弱。
对于本期的问题,这并没有区别。智能体承担的真实工作越多,谁能够访问那些工作就越能决定谁能构建正确的模型。一个完成的模型可以被复制。下一代从中成长的访问权则无法被复制。
美国实验室将模型、算力和平台绑定在一起
没有人比那些模型领先优势正在缩小的实验室更努力地锁定这种访问权。GPT-5.6 在其最高努力级别下默认协调四个智能体,OpenAI 的 Codex 在云端完全运行多个并行任务,Anthropic 在 Claude Code 和 Claude Cowork 中也有类似的产品。OpenAI 对 Ona 的收购增加了安全的执行环境,客户可以在其中自己控制访问权限、凭证和安全边界。
DeployCo 的结构展示了 OpenAI 对这个反馈通道的重视程度。这家公司是一个真正的剥离实体,与 19 家私募股权公司共同推出,并将前沿部署工程师直接嵌入企业——明确目的也是将经验教训带回到产品和研究中。与此同时,与埃森哲、凯捷、BCG 和麦肯锡合作的前沿联盟(Frontier Alliance)扩大了销售端。
就连英伟达也在从硬件端推动同样的发展。新的 Vera Rubin 系列集成了工具调用沙盒环境、长期运行智能体的上下文记忆,以及作为平台一部分的编排。芯片供应商越来越多地销售的是智能体系统,而不仅仅是加速器。
在这些和其他硬件之上,实验室正在构建第二条物理防线:计算基础设施。
OpenAI 联合创始人兼总裁 Greg Brockman 最清楚地阐述了这一计算逻辑。开模型并不会神奇地变便宜,一切最终都运行在相同的硬件上,而 OpenAI 正在构建芯片和数据中心,以使每项任务都能获得最便宜的报价。
因为如果模型变成商品,谁能在每个接受的结果上提供更低的价格就成为决定因素,而从能源到自己设计的芯片再到模型的垂直整合,会把那个价格压低。
如果赌注成功,即使一个完美的模型复制品在商业上也会失败,因为原版能以更低的规模成本提供相同的能力。但这仍然是一个目标,而非现实,从中国模型的价格优势可以看出。
基础设施只有在结合反馈通道的情况下才能成为护城河。它提供训练能力将部署知识转化为下一代,并提供推理能力来并行运行智能体集群。
这个建设仍然是一场赌注。只有当智能体需求的增长速度快于模型变得更高效的的速度时,它才能获得回报。Sam Altman 本人展示了这项数学有多开放——他称企业的使用成本是一个巨大的问题。
中国既无法蒸馏这一层,也无法通过常规渠道租用它,因为美国出口管制阻止了获取最新硬件的途径。这留下了变通方案。一个是走私——仅"门卫行动"(Operation Gatekeeper)就查获了价值至少 1.6 亿美元的 GPU。另一个是在国外租用算力。
两者都不能替代主权堆栈,所以中国必须工业化自己的堆栈,迄今为止是靠用更多的硬件来解决问题。华为的 CloudMatrix384 连接了 384 个昇腾加速器,根据 SemiAnalysis 的数据,它提供的内存和峰值算力超过了英伟达的 GB200 NVL72,但功耗大约是后者的四倍,加速器数量是五倍。物理基础正在增长。中国的能源管理部门已在统计 2025 年的 42 个 AI 集群,每个集群至少有 10,000 张加速卡。
但更多的能源既不能替代内存芯片,也不能替代软件质量。SemiAnalysis 目前将 HBM 视为昇腾生产中的主要瓶颈。而华为的 CANN——作为英伟达 CUDA 的对应物——在软件质量和生态系统成熟度上仍存在显著差距。
因此,竞争格局的核心不对称性是这样的:中国在模型能力上正在迎头赶上,但美国在智能体工作通道和主权算力基础设施上建立了更深的两条护城河。第一条护城河赋予下一代训练数据;第二条赋予将这些数据转化为能力所需的规模。
任何关于西方 AI 领先剩余部分的讨论,都必须从承认这种多层结构开始。模型是起点,但不是终点。