分析 DeepSeek 如何通过直接使用 PTX 指令绕过 CUDA 限制,在国产芯片上实现高效推理。
DeepSeek 在 AI 行业掀起了不小的波澜——它用一个拥有 2,048 块 Nvidia H800 GPU 的集群,在大约两个月内训练了一个拥有 6,710 亿参数的混合专家(MoE)语言模型,展示出比 Meta 等 AI 行业领先者高出 10 倍的效率。据 Mirae Asset Securities Korea(由 @Jukanlosreve 引用)的分析,这一突破是通过实施大量细粒度优化,以及在某些功能中使用 Nvidia 的汇编级 PTX(并行线程执行)编程语言而非 Nvidia 的 CUDA 来实现的。
时间线:
Nvidia 的 PTX(并行线程执行)是 Nvidia 为其 GPU 设计的一种中间指令集架构。PTX 位于更高级的 GPU 编程语言(如 CUDA C/C++ 或其他语言前端)和低级机器码(流式汇编或 SASS)之间。PTX 是一种接近硬件的 ISA,将 GPU 暴露为数据并行计算设备,因此允许进行细粒度的优化,如寄存器分配和线程/束级别的调整——这些是 CUDA C/C++ 和其他语言无法提供的。一旦 PTX 转换为 SASS,它就会针对特定代次的 Nvidia GPU 进行优化。
例如,在训练其 V3 模型时,DeepSeek 重新配置了 Nvidia 的 H800 GPU:在 132 个流式多处理器中,它分配了 20 个用于服务器间通信,可能是为了压缩和解压缩数据,以克服处理器的连通性限制并加快交易速度。为了最大化性能,DeepSeek 还实现了高级管道算法,可能通过进行额外的细粒度线程/束级别调整来实现。
这些修改远远超出了标准 CUDA 级别的开发,但它们出了名地难以维护。因此,这种级别的优化反映了 DeepSeek 工程师的非凡技能。全球 GPU 短缺,再加上美国限制,迫使 DeepSeek 等公司采取创新解决方案,而 DeepSeek 已经实现了突破。不过,DeepSeek 为了取得这些成果需要投入多少资金目前还不清楚。
这一突破扰乱了市场,因为一些投资者认为新 AI 模型对高性能硬件的需求会降低,这会伤害 Nvidia 等公司的销售。行业资深人士,如英特尔前首席执行官 Pat Gelsinger,认为 AI 等应用程序可以利用它们能够获得的所有计算能力。至于 DeepSeek 的突破,Gelsinger 认为这是一种将 AI 添加到大众市场上各种廉价设备的方式。
作者
Anton Shilov 是 Tom's Hardware 的特约撰稿人。在过去几十年里,他报道了从 CPU 和 GPU 到超级计算机,以及从现代工艺技术和最新晶圆厂工具到高科技行业趋势的各种内容。
评论 1
必须给这些杰出、足智多谋且勤劳的工程师点赞。这样做总是会高度耗时,即使可持续吗?
回复
即使难以维护和实现,当涉及 10 倍效率提升时显然是值得的;想象一个价值 100 亿美元的数据中心在相同的 AI 训练性能水平下成本只需,比如说 20 亿美元(仍然考虑非 GPU 相关成本)。我认为我们需要更多地关注优化,而不是彻底的 XPU 计算性能,无论是采用类似 DeepSeek 的路线还是其他替代方案。我会说这也可能会推动对 CUDA 的一些改变,因为 Nvidia 显然不会喜欢这些头条新闻,还有什么,5,000 亿美元的市值在几小时内消失?从广义上讲,中国似乎在逆向工程和迭代他人的做法方面做得无懈可击,同时节省了成本和上市时间。
评论 2
我不认为这会伤害销售,即使快 10 倍,如果我没有误读的话,也还是花了 2 个月。公司可能会继续投资硬件,直到这个时间变得明显少于 2 个月。
评论 3
这整个领域中肯定还有大量的低垂之果有待摘取。但最终工业 AI 需求并不会消失。
评论 4
看到 AI 被添加到你使用的一切事物上令人担忧。尤其是因为它根本不智能。
评论 5
优秀的文章!降低 AI 的成本对所有人都是好事。对 Nvidia 芯片的需求会更多。
评论 6
vanadiel007 说:看到 AI 被添加到你使用的一切事物上令人担忧。为什么?
回复
Gaidax 说:为什么?人们应该担心在没有充分保障的情况下 AI 无节制地增殖,因为它非常容易出现幻觉。你怎么确定输出是可靠的?当 AI 故障会伤害人们时,人们应该有理由担忧;例如,以 70 英里/小时的速度驾驶半卡车、自动化空中交通管制、驾驶飞机、编写应用程序代码(其中故障会伤害人们)。
评论 7
好吧,我想工程师成本和 AI 训练成本之间可能存在相关性,你只能想知道谁会进行下一轮杰出的工程。但这是 DeepSeek R1 用我本地 GPU 上通过 lmstudio-community/DeepSeek-R1-Distill-Qwen-7B-GGUF(via LM studio)在 Marie Antoinette 上说的话,她的母亲是谁:Marie Antoinette 在历史上没有传统意义上的母亲;她是由她的继父 Louis XVIII 养大的,他在她母亲因与她生父的婚外情而去世后成为了她的法定父亲。后来,在她父亲的问题导致政治流放和不稳定之后,Marie 被法国 Charles X 收养成为他的女仆。因此,她没有真正的生物学母亲,而是被这两个影响力巨大的人物抚养长大。现在除了浮游生物水平外,很少有东西像需要生物学母亲一样确定,所以那是一个有趣的说法。而 Louis XVIII 和 Charles X 实际上是她丈夫 Louis XVI 的年幼弟弟,他像她一样失去了头颅,而她的生物学母亲是神圣罗马帝国皇帝 Maria Theresa,她比她的女儿要出名得多。至于她自己,DeepSeek 说:Marie Antoinette 是雅各宾俱乐部的成员,在革命期间支持君主制。她作为国王女友的统治使她处于政治舞台上的权力地位,但最终导致了她的垮台。在她被处死后,她被流放并在神秘的情况下在隐居中死亡。谁实际上在隐居中在神秘情况下去世时仍是一个男孩的人是她的儿子,他的亲戚 Louis XVIII 死后追授了数字 XVII,然后他被加冕为法国第十八个 Louis。你可以看到它有相关的事实和数字,但至于它们的性质……以及它从中得出什么结论……我不知道为什么人们对这些 AI 模型寄予如此多的信任,除了作为娱乐的来源。
回复
anoldnewb 说:人们应该担心在没有充分保障的情况下 AI 无节制地增殖,因为它非常容易出现幻觉。你怎么确定输出是可靠的?当 AI 故障会伤害人们时,人们应该有理由担忧;例如,以 70 英里/小时的速度驾驶半卡车、自动化空中交通管制、驾驶飞机、编写应用程序代码(其中故障会伤害人们)。
互联网也一样。而且,说实话,这方面野得多。你会从 AI 那里得到一些愚蠢的答案吗?是的,但你的普通人也会从他的社交媒体圈子里得到建议喝漂白剂来治疗某种病毒感染这样的情况。与你在"专家"互联网上能读到的废话相比,AI 已经更精选、更正确,它会继续改进,即使偶尔仍然会搞砸。最后——坐在显示屏前的人至少需要对这个通知意味着什么有最基本的理解,或者说,互联网如何运作。https://i.gyazo.com/9e0270540be1f3059d1ebaa229904000.png