量子位报道AI推理框架可能在10小时内突破CUDA生态壁垒,暗示NVIDIA CUDA多年技术优势正面临挑战。
听雨 发自 凹非寺 量子位 | 公众号 QbitAI
一家成立仅一年的小公司,用 AI 编程 Agent,只花 10 小时,就搭出了一套「类 CUDA 软件」。

你是说这套英伟达花了近 20 年搭起来的软件帝国,就这么被复刻了??

不止如此。DeepSeek 也在尝试少写一点底层 CUDA。
他们已经开源了一套名为 TileKernels 的 GPU 算子库,用 TileLang 来编写,省去了大量手写底层 CUDA 代码的工作。
不过类似的「CUDA 危机」,咱也不是第一次听了。
每隔一段时间,CUDA 都要被拎出来鞭打一番,动辄替代了、击穿了、护城河又被颠覆了…
H100、Blackwell、Rubin,靠着一代代性能更强的芯片,英伟达吃下了这一轮 AI 浪潮的最大红利。
但英伟达真正难以撼动的优势,其实不是硬件,而是软件。
芯片可以买,参数可以追,制程也会迭代。真正让客户用了英伟达之后很难再换走的,是围绕 GPU 建立起来的整套软件生态。
CUDA 全称 Compute Unified Device Architecture,由英伟达高管 Ian Buck 带队,花了近 20 年打造。

它常被叫作编程语言,但更准确地说,CUDA 是一整套围绕英伟达 GPU 建立的软件平台。
如果简单拆成三层,最底下是内核层,直接让芯片干活的 Kernel、编译器和运行时。
中间是库层——cuBLAS、cuDNN 等经过高度优化的计算库,以及调试、验证和性能分析工具。
最上面,则是 PyTorch、TensorFlow 等开发框架,企业积累的海量代码和工作流,以及围绕 CUDA 成长起来的开发者生态。

这么说可能有点抽象,但你可以把英伟达 GPU 想象成一家工厂。
CUDA 最底层负责告诉机器每一步怎么干,中间层提供现成的生产工具,最上层则是一整套已经运转多年的生产体系。
所以,对客户来说,买到的不只是英伟达的一块卡,而是一座开箱即用的工厂。
现在,一位名叫 Jeremy Nixon 的老哥,带着 AI Agent 来了。

Nixon 是 AI 软件初创公司 Infinity 的创始人,此前也在 Google Brain 当研究员。
他的团队开发了一套名为 Ignition 的 AI 研究 Agent,专门给不同 AI 芯片编写底层软件。
它可以生成 GPU Kernel、运行测试、寻找错误、测量性能,再根据结果自动改写代码。
人类工程师负责给出高层方向,剩下那些琐碎又费脑子的工作,就交给 Agent 反复循环。
就这样,Infinity 用 Ignition 为 AI 芯片初创公司 d-Matrix 搭建了一套类 CUDA 软件。
那些过去需要芯片软件工程师反复调试的底层代码,现在真能交给 AI 了?

AI Agent 确实很适合这种具有明确反馈的编程任务。
代码能不能编译,结果算得对不对,性能有没有提高,都可以通过实际运行得到答案。
写代码→编译→运行→测试正确性和性能→根据反馈继续修改
不过,Infinity 主要攻入的是 CUDA 的第一层:为不同芯片生成和优化推理 Kernel,并围绕这些 Kernel 搭建底层软件能力。
它正在开发一套面向多种芯片的通用推理库,但这不等于它在 10 小时内复制了 CUDA 近 20 年积累的完整生态。
你实际上并不需要复制一个 CUDA,就可以拿下 1500 万美元的融资。

有没有威胁到英伟达不知道,反正资本是相当买账的。(doge)
如果说 AI Agent 是攻城的武器,那推理市场就是城墙上的缺口。
训练是造模型,需要上万块卡协同跑几个月;推理是用训好的模型回答问题,小集群甚至单卡就能跑。
大规模训练对性能、稳定性和集群协同极为敏感。芯片之间的通信、显存的调度、程序出错后如何恢复,任何一点效率损失,放大到数千乃至数万块芯片上,都会变成真实的时间和成本。
其他芯片即使纸面参数不错,只要软件不够成熟、集群不够稳定,省下来的硬件成本,很可能从开发和试错成本里加倍偿还。
韩国 AI 芯片公司 Rebellions 首席商务官 Marshall Choy 就认为:
在推理侧,CUDA 不再是决定因素。这将是一场开源软件的竞争。

因为训练在乎「极致性能」,而推理在乎的是「每个回答的成本」。
训练需要上万块卡协同,推理可以拆分到小集群甚至单卡;训练不敢换芯片,但推理可以。
更关键的是,推理软件可以跨芯片运行。如果推理框架能支持多种芯片,用户就能在不同硬件之间切换,不用重写代码——
推理任务并不都需要 CUDA 从训练到集群协同的全部能力。针对特定模型、特定场景重新设计的芯片,只要能够跑得更快、更便宜或者更省电,就有机会从英伟达手里切下一块市场。
比如 d-Matrix,本身就是一家主打推理的芯片公司。

这家公司成立于 2019 年,主攻生成式 AI 推理芯片。
联合创始人兼 CEO Sid Sheth 曾回忆,他们很早便判断,AI 推理带来的机会最终会超过训练。
Infinity 用 AI Agent 花 10 小时搭建的类 CUDA 软件,服务的正是 d-Matrix 的推理芯片。
于是,「10 小时事件」的完整故事就连起来了:
新芯片想进入推理市场,但缺少成熟软件;AI Agent 快速生成和优化底层 Kernel,把原本可能耗费数月乃至数年的适配工作压缩到小时或天。
虽然英伟达在训练领域保持主导地位,但在推理方面,护城河有所削弱。

盯上这个缺口的,也不止 d-Matrix 一家。
主攻推理的 Rebellions、d-Matrix,押注晶圆级芯片的 Cerebras,亚马逊的 Inferentia、谷歌的 TPU、AMD 的 MI300X……
各路芯片厂和云计算巨头,早已在推理市场排兵布阵,准备从英伟达手里抢下一块肉。
对这些公司来说,他们不需要立刻替代英伟达。
他们只需要证明,在某些推理任务中,不依赖英伟达的全套硬件和 CUDA 生态,也能跑得更快或者更便宜。
前面也说了,10 小时重写的是「一块芯片的适配代码」,而 CUDA 生态还有 20 年积累的库、调试工具、社区、几百万开发者。
INT21 创始人 Bing Xu,上一家 AI 芯片软件公司 HippoML 被英伟达收购,他本人今年 4 月才离开英伟达。

他的判断是:Agent 能在短时间内生成大量代码,但验证才是最大瓶颈。
AI 生成一万行代码很快,但「证明这一万行在各种边界情况下都算得对、跑得稳」极慢。
CUDA 最深的资产恰恰是它的验证工具链——所以他认为,Agent 时代,验证生态会成为 CUDA 的下一道护城河。
Modular 联合创始人兼 CEO Chris Lattner,也泼了盆冷水。

他认为编码 Agent 带来的改进是渐进式的,「炒作被严重夸大」。
理由有三:第一,写代码只是软件工程的一小部分,生产级优化才决定芯片性能,直接决定跑 AI 的成本;
第二,芯片软件是小众精英领域,公开代码远少于应用开发,AI 在这块能学的训练数据本来就少;
第三,几百万行存量代码的迁移成本还在,这不是技术能解决的,属于组织决策。
还有一点容易忽略的是:英伟达自己也在使用 AI。
英伟达开发者生态副总裁 Ankit Patel 表示:
我们也在使用 AI Agent 来更快地开发 CUDA,并在更大规模上进行验证。
以己之矛,攻彼之盾,进攻方的相对优势也会打折。
Bing Xu 总结下来:这场仗的胜负,取决于竞争对手追赶英伟达的速度,能否快过英伟达自我迭代的速度。
但很显然,这家全球最大的芯片制造商,「并没有在睡觉或原地踏步」。
总的来说,短期内英伟达的护城河安然无恙,但变化会先在推理侧悄悄发生。
长期的真正悬念是:护城河正在从「代码的存量」迁移到「验证和优化的生态」。
参考链接: [1]https://www.businessinsider.com/nvidia-cuda-new-threats-ai-coding-agents-2026-8
微软叫停 Tokenmaxxing!预算卡死,超限自负 2026-08-05
AI 顶会现场,见到了一家美妆巨头 2026-08-01
GPT-5.6 今起大降价,最大幅度 80%!2026-07-31
一年连融三轮数亿元!字节+清华姚班,重构企业软件工程 2026-07-30
量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备 17005886 号-1