法国创业公司Kog认为GPU不适合Agent工作流是误解,通过底层优化榨取更多GPU推理性能,提升Agent场景吞吐量。
AI 推理的速度竞赛正在进行中,市场也在今年 5 月 Cerebras 及其定制芯片 IPO 首秀时给予了热烈欢迎。但法国初创公司 Kog 押注的是,现有 conventional GPUs 上还有大量算力可以进一步压榨。
这家初创公司在 5 月登上了 Hacker News 头条,当时他们发布了一个技术预览,旨在证明"在企业已有的标准数据中心 GPU 上实现极快的单请求解码是完全可能的"——他们用于演示的正是 AMD MI300X 和 Nvidia H200 GPU。
有人对这项技术无法惠及笔记本电脑中的 GPU 感到失望,但也有人看到了其中的潜力。如今推理速度和成本已成为关键瓶颈,Kog 承诺通过软件优化在现有硬件上释放新能力,这吸引了不止是围观者。"我们收到了 200 个实质性的商业询盘,"CEO Gaël Delalleau 告诉 TechCrunch。
基于早期反馈,这位 solo 创始人预计软件工程将是第一个落地的用例。Claude Code 的资深用户都很清楚,他们有时需要等待数小时才能得到结果。Anthropic 本身也明白速度是有价值的,因此为 Claude 的 Fast Mode 设定了多倍价格。
Kog 希望吸引那些因上述延迟而被劝退的客户——他们通常依赖 AI 工作流来完成专业任务。但 Delalleau 表示,这家初创公司也有设计合作伙伴,用户可以通过 prompt 生成游戏和应用,对他们来说,有了 Kog Inference Engine(KIE)带来的更快结果意味着更多收入。
公司意识到这个市场还不够成熟。在观察需求的过程中,Kog 发现其潜在客户并不打算微调小模型。"正因为如此,自发布以来,我们全力专注于加速大模型的开发,以满足我们所看到的需求。"
这意味着 Kog 要兑现"30 倍更快 LLM 推理"的承诺,还有很长的路要走。其演示展示了一个令人印象深刻的每秒 3000 个请求 token(TPS)——但使用的是仅为约 20 亿参数的定制小模型,也就是如今已开源的 Laneformer 2B。
面对质疑者,Delalleau 信心满满,认为同样的方法同样适用于 LLMs——尽管其规模对推理芯片来说是一大挑战。"GPU 的前景是光明的,"他说。对 Kog 的 CEO 而言,GPU 不适合解码的想法已经成为一种误解;新一代 GPU 拥有越来越大的内存带宽,正等待着被解锁。
Kog 并非唯一认为软件优化可以帮助 GPU 实现超出标称性能的公司。同样来自法国的 ZML 发布了一款硬件无关的软件,跳过 Nvidia 的 CUDA 以支持跨竞品芯片的快速推理。但 Delalleau 表示,Kog 更接近于斯坦福大学实验室 Hazy Research,甚至在更底层层面专注于 GPU 加速。
Delalleau 本人并非研究人员,他的第一家创业公司 TechCrunch50 2009 年校友 Stribe 与他现在的事业毫无关联——唯一的纽带是他曾经的联合创始人、如今转型 VC 的 Kamel Zeroual,其创立的基金 Varsity VC 领投了 Kog 的种子轮。但这家初创公司的深层专注源自他独特的背景。
在法国巴黎高等理工学院学习固体物理后,他转而从事进攻性网络安全——也就是白帽黑客。据 Delalleau 所说,这塑造了他如今正在鼓励团队采纳的思维方式。在科学方面,"存在着一种理解物理定律、理解 GPU 运作原理的思维方式,以便最大限度地利用它们。"
至于黑客技术,这位 DEFCON CTF 锦标赛四次决赛选手表示,黑客教会了他"在极底层逆向工程事物——深入到汇编语言和二进制代码——去理解它是如何工作的,并尝试利用它来实现并非为其设计的目标。"
这种方法的缺点在于它非常依赖人工且耗时。"对于每一款新 GPU,我们会投入数周甚至数月的时间,真正深入细节,在该硬件上进行 GPU 工程研究。"团队仅有 11 人,这在至少可预见的未来限制了 Kog 能着手的芯片数量。
从长远来看,Kog 希望将其方法论融入基于 agent 的管道,从而支持更多芯片和模型。在欧洲寻求在这两个领域建立自身能力的背景下,这可能为这家已获得 Scaleway 支持、并被法国 Bpifrance 和 French Tech 2030 计划背书的初创公司带来主权层面的顺风。
不过就目前而言,Kog 需要向世界证明其方法在 LLMs 上同样有效。这也将是获得更多融资的关键。"一旦我们在 9 月实现了首个主要模型 10 倍加速的落地,我就能够开始展示客户吸引力,并从那里开始融资 Series A,"Delalleau 说道。