llama.cpp b10330 将 rms_norm、mul、rope 等操作融合为单一 CUDA 内核,减少内存拷贝与内核启动开销;同时修复了 ROCm/AMD GPU 量化 bug。
Local AI & Open Models
本周本地 AI 推理领域在核心库方面取得了重要进展。llama.cpp 为 CUDA 带来融合优化,PyTorch 修复了 ROCm 上的关键量化 bug,还有一款名为 Kimi-K3 的新开放模型凭借高效压缩张量技术日益受到关注。
llama.cpp 为关键操作引入 CUDA 融合 (llama.cpp)
llama.cpp 的 b10330 版本为 CUDA 用户带来了重要的性能优化。具体来说,它将 rms_norm、mul 和 rope 操作,以及 view 和 set_rows 融合为一个单一的 CUDA kernel。这种融合减少了内存传输和 kernel 启动开销,从而为在 NVIDIA GPU 上运行的模型带来了更快的推理速度。
摘要中明确提到为 rms_norm_mul_rope 测试添加了广播权重用例,并在融合前检查内存范围,表明这是一次稳健的集成。这种底层优化对于在大容量消费级硬件上本地运行大语言模型时最大化吞吐量和最小化延迟至关重要。使用 llama.cpp 在启用 CUDA 的 GPU 上进行 GGUF 模型推理的用户将直接受益于这些速度提升,从而提升整体本地 AI 体验。
这种对常见操作的直接融合是如何从消费级 GPU 中榨取更多性能的典型范例,使本地 LLM 推理对于 GGUF 用户而言更加迅捷和高效。
PyTorch 修复 ROCm/AMD GPU 量化 bug (PyTorch)
PyTorch trunk 的一个重要更新(bbf14e4716f51901fe49058e0ad0f04c0be56800)修复了一个关于 ROCm 平台上"量化 CUDA Embedding 中 bfe() 位域提取"的特定 bug。此修复对于在 AMD GPU 上运行量化模型的开发者和用户至关重要,因为它直接影响量化嵌入的正确性和可靠性。
量化是减少内存占用和在消费级硬件上加速大模型推理的关键技术,确保其在 ROCm 等不同 GPU 架构上的正常运行对于"本地 AI"生态系统至关重要。此补丁提高了 AMD 用户量化操作的稳定性和准确性,进一步扩大了 PyTorch 在多样化本地推理环境中的可访问性和实用性。
修复 ROCm 上的量化嵌入对于 AMD GPU 用户而言是一件大事,确保他们高效模型的本地推理工作流程既正确又可靠。
Moonshot AI 的 Kimi-K3 模型凭借压缩张量登上热门 (Hugging Face Trending)
来源:Hugging Face Trending
moonshotai/Kimi-K3 模型在 Hugging Face 上迅速走红,其图-文-到-文本能力以及值得注意的是对"compressed-tensors"的使用吸引了大量关注。这个开放权重模型支持 transformers 和 safetensors 格式,使其非常易于本地部署。
compressed-tensors 的提及与 PatentLLM Blog 对本地 AI 和消费级 GPU 的关注尤为相关,因为它表明了针对减少内存占用和潜在更快推理的优化,这对于在数据中心外高效运行大模型至关重要。Kimi-K3 获得了超过 140 万次下载和 10,000 次点赞,显然在社区中引起了共鸣,提供了一个强大的会话能力模型的实用范例,其设计考虑了面向 diverse applications(包括特征提取)的效率。
Kimi-K3 的热门地位加上其 compressed-tensors 特性,使其成为任何希望针对本地消费级 GPU 推理优化开放模型的人的必试之选。
Full Local AI & Open Models archive
GPU, CUDA & Autonomous Driving
今日科技要闻涵盖了解决 ROCm/CUDA 量化嵌入问题的关键 PyTorch 更新。AMD 的 ROCm 博客重点介绍了面向 AI 教育的新款 Learning Cloud,而 NVIDIA 即将推出的 RTX 5090 GPU 出现在台湾一个不寻常的零售捆绑套餐中。
PyTorch 修复 ROCm/CUDA 量化嵌入位域提取 (PyTorch)
一个官方 PyTorch trunk 发布版本(bbf14e4716f51901fe49058e0ad0f04c0be56800)修复了量化 CUDA embedding 操作中位域提取(bfe())的一个关键 bug,具体影响了 ROCm 后端。此修复对于在 NVIDIA 和 AMD GPU 上处理量化模型的开发者至关重要,因为不正确的位域提取可能导致复杂数值计算中的精度错误或完全失败。
该修正确保了位级操作的精确处理,而这些操作是优化的低精度 AI 模型的基础。通过纠正这个问题,PyTorch 显著提高了量化嵌入在不同 GPU 架构上的可靠性和性能一致性。对于那些将 AMD 的 ROCm 平台与启用 CUDA 的系统结合用于 AI 工作负载的人来说,这尤其有益,确保了先进的量化技术可以更稳健地应用于多样化硬件。此更新对于维护依赖于高效量化表示的深度学习模型的完整性至关重要。
这是一个底层但重要的修复。不正确的位域操作可能在量化模型中静默损坏数据,因此在 PyTorch 中为 CUDA 和 ROCm 都打上此补丁提高了高效 AI 推理的跨平台可靠性。
AMD ROCm 博客聚焦 AUP Learning Cloud,简化 AI 教育 (AMD ROCm Blog)
来源:AMD ROCm Blog
AMD ROCm 博客最近重点介绍了 AUP Learning Cloud,这是一项旨在简化 AMD 平台上 AI 教育并培育其开源软件生态系统的倡议。这一公告凸显了 AMD 对于扩大学生和教育工作者对其强大的 Instinct 加速器和 Ryzen 处理器的访问的承诺。
AUP Learning Cloud 提供了一个实践环境,用户可以直接使用 AMD 硬件来训练先进的机器学习模型、开发复杂的 AI agents,并进行大语言模型(LLMs)实验。这种实践方法有助于弥合理论理解与现实世界 GPU 加速 AI 开发之间的差距。对于 PatentLLM 博客优先关注 ROCm 发布和 GPU 硬件新闻的读者而言,此倡议尤其相关,因为它直接推动了 AMD AI 计算堆栈的实践应用和可访问性,使新用户更容易入门,使有经验的开发者更容易探索 ROCm 平台。
对于任何努力上手 AMD AI 堆栈的人来说,这款 AUP Learning Cloud 可能是一个改变游戏规则的存在。它降低了 ROCm 的入门门槛,使在 AMD 硬件上原型开发和实验 LLMs 变得更加容易。
NVIDIA RTX 5090 出现在台湾不寻常的 8 主板捆绑套餐中 (Tom's Hardware)
来源:Tom's Hardware
Tom's Hardware 报道了 NVIDIA 即将推出的 RTX 5090 GPU 在台湾的一种奇特捆绑策略,有零售商据报将这款高端显卡与八块主板、入门到中端 GPU 以及其他组件打包销售。虽然不是官方产品发布,但这条新闻提供了关于 RTX 5090(NVIDIA GPU 系列中备受期待的新成员)零售动态的早期洞察。
这种捆绑策略让人想起过去的加密货币挖矿热潮,引发了对人为稀缺和价格虚高的担忧。对于关注 GPU 硬件和 NVIDIA 产品路线图的读者而言,这预示着下一代 GPU 的即将到来,提供了对其市场引入策略的一瞥,无论多么不寻常。该报告强调了以标准价格获得这些显卡的潜在挑战,并表明了对 NVIDIA 最新加速器的强烈需求。
在官方发布之前就看到 RTX 5090 被卷入此类捆绑套餐中,这是一个警示信号。它暗示着高需求和潜在的哄抬价格,使开发者和爱好者更难获得尖端 NVIDIA 硬件。
Full GPU, CUDA & Autonomous Driving archive
Compiled daily from official release feeds, vendor changelogs and engineering blogs. Archive: https://media.patentllm.org