斯坦福团队测评显示本地 SLM(Qwen3、Gemma3 等)在 81% 真实工作负载上具竞争力,成本降低 50-85%,推理任务两年从 50% 提升至 85-92%。
斯坦福一个研究团队刚刚发表了一篇论文,这篇论文应该会让每一个超大规模云服务商的投资人都坐立不安。他们对小型语言模型(SLM)——也就是可以在高端笔记本或台式机上运行的模型——与基于云的前沿 LLM 进行了基准测试。结果令人震惊。
"如果他们的结果是真实的,那我们将来几乎不需要任何数据中心,超大规模云服务商正在浪费数百亿美元的投资。"
该团队(Saad-Falson et al., 2026)在本地硬件上运行 SLM(Qwen 3、Gemma 3、GPT-OSS、Granite 4.0)——Nvidia 和 Apple M4 芯片——并与 ChatGPT 5、Claude Sonnet 4.5 和 Gemini 2.5 Pro 进行对比:
这是两年内覆盖的大量领域。
超大规模云服务商——AWS、Azure、Google Cloud——建立在一个假设之上:AI 推理需要大规模集中式计算。数以百亿美元计的资本支出都依赖于这个假设。
如果 SLM 能够在本地处理 80% 以上的真实世界工作负载,那么这个假设在结构上就站不住脚了。这些新数据中心应该服务的需求可能永远不会完全实现。
连锁反应是实质性的:
Nvidia 的利润率故事发生改变。 如果更便宜的桌面芯片处理大多数推理,高利润率的数据中心 GPU 细分市场就会受到挤压。Nvidia 新的 PC AI 芯片可能会蚕食其最盈利的产品。
基础模型估值看起来过于扩张。 OpenAI、Anthropic 等公司将面临来自更便宜 SLM 的 margin 压缩——以及来自 Qwen、Granite 等已经在该领域的激烈竞争。如果单位经济效益走势不利,就很难证明 pre-IPO 估值是合理的。
赢家可能很无聊。 如果本地推理成为默认设置,Dell、Apple 和其他设备制造商可能比任何云服务商捕获更多 AI 价值。
SLM 的优势领域仍然存在:agentic AI(SLM 在那里的成功率低于 50%)和最困难的推理任务。但这些是两年前人们对通用推理提出的相同警告。
如果你在构建 AI 驱动的产品:开始分析哪些 LLM 调用实际上需要前沿模型。许多可能并不需要。在本地或近边缘运行 SLM 如今就可以显著降低推理成本——不是最终。
如果你在评估云 AI 支出:按类型分解你的工作负载。聊天 vs 复杂推理 vs agentic 任务具有截然不同的 SLM 适用性特征。
如果你在关注 AI 基础设施:斯坦福论文(Saad-Falson et al., 2026)值得全文阅读。推理任务性能轨迹是最重要的图表——改进速度才是故事本身,而不仅仅是 SLM 目前的水平。
超大规模云服务商不会一夜之间变成 toast。但如果这项研究站得住脚,它就预示着"不惜一切代价建设数据中心"这一趋势面临严重的结构性逆风——以及价值向边缘和设备端计算的重大重新分配。
Source: If this is true, the hyperscalers are toast — Klement on Investing Research: Saad-Falson et al. 2026 via arXiv
✏️ Drafted with KewBot (AI), edited and approved by Drew.