Ollama v0.32.6 利用 MLX 和模型 MTP 头进行推测解码,提升 Qwen3.5 在 Apple GPU 上的本地推理速度,并改善 OpenAI 流式接口兼容性。同期还有 llama.cpp、TensorRT、PyTorch 和 Mesa 的相关更新。
今天的摘要带来了多项本地 AI 领域的重要更新:Ollama v0.32.6 提升了 Qwen3.5 在 Apple Silicon 上的性能,并增加了对 OpenAI 流式传输格式的兼容。此外,Mesa 26.2 新增 NVK Mesh Shader 支持,llama.cpp 修复了 Vulkan 错误,KataGo 解决了关键的 TensorRT Bug,新版 PyTorch 也已发布;同时亮相的还有面向高级 AI 应用的 NVIDIA Alpamayo 2 Super。
本周的头条新闻为本地 AI 推理带来了多项重要更新:Ollama v0.32.6 提升了 Qwen3.5 在 Apple GPU 上的性能,KataGo 的 TensorRT 后端和 llama.cpp 的 Vulkan 集成也都迎来了关键 Bug 修复。
Ollama 已发布 0.32.6 版本,为本地大语言模型推理带来了显著的性能改进和 API 兼容性提升。其中一大亮点,是通过 MLX 引擎自动利用模型的 MTP head 进行 speculative decoding,从而提升 Qwen3.5 模型在 Apple GPU 上的运行速度。这项优化直接加快了 Apple Silicon 设备上的本地推理,让 Qwen3.5 成为 M 系列 Mac 用户更加高效的选择。
除了性能提升,此版本还让 Ollama 的 /v1/chat/completions 流式传输格式与 OpenAI 的 wire protocol 更加一致,尤其是确保 role 字段只出现在流式响应的第一个 chunk 中。这项变更简化了针对 OpenAI API 设计的开发者工具和应用的集成过程,无须大范围修改代码,就能更轻松地在本地 Ollama 实例与云端 OpenAI 服务之间切换。此次更新进一步巩固了 Ollama 作为易用、高性能本地 AI 工具的领先地位。
对于 Apple 用户来说,这次 Ollama 更新是一项重大利好:speculative decoding 为 Qwen3.5 带来了实实在在的速度提升,而 OpenAI 流式传输兼容性修复,也让它与现有工具的集成顺畅了许多。
热门围棋 AI 引擎 KataGo 已发布 1.17.2 版本,这是一项针对性很强的 Bug 修复更新,专门解决其 TensorRT 后端中的问题。对于使用 NVIDIA GPU 加速推理的用户来说,此版本至关重要,因为它修复了多个可能影响棋局分析和 self-play 训练的稳定性及正确性问题。KataGo 的强大棋力高度依赖高效的神经网络评估(NNUE),因此,确保 TensorRT 这类 GPU 推理后端的完整性与性能极为关键。
此次 v1.17.2 更新仅聚焦于 TensorRT 可执行文件,这意味着核心模型及其他后端与此前的 1.17.1 版本保持不变。对于使用 KataGo 的竞技围棋棋手、研究人员和开发者,强烈建议升级至此版本,以维持准确、可靠的高性能 GPU 推理。这些修复增强了引擎的整体稳健性,确保搜索与评估之间的权衡以及网络架构变更,都能在最佳硬件加速条件下按预期运行。
对于依赖 TensorRT 的 KataGo 重度用户来说,这是一个必须安装的补丁。要进行顶级的围棋分析和训练,稳定且正确的 GPU 推理是不可妥协的基础。
广受欢迎的 LLM C/C++ 推理引擎 llama.cpp 已发布 b10291 版本,解决了使用 Vulkan 后端的用户所遇到的关键问题。此次更新主要修复了与 Vulkan 提交批处理大小有关的问题,更重要的是,它还引入了新的调试工具,用于帮助诊断 DeviceLost 驱动错误的成因。对于依靠 Vulkan 加速运算的用户来说,这类 DeviceLost 错误会严重干扰消费级 GPU 上的本地推理,导致崩溃或运行不稳定。
新增的专用调试工具(详见 issue #26371)是故障排查方面的一项重要进展,可以提供有关设备故障根本原因的更细粒度信息。此版本还修复了提交阈值的应用问题。越来越多的开发者和爱好者开始使用 llama.cpp 与 Vulkan,在消费级 GPU 上运行量化模型;对他们而言,此次更新不仅提高了稳定性,还提供了解决常见硬件相关推理问题的实用工具,让本地 LLM 实验变得更加可靠。
遇到 Vulkan 的 DeviceLost 错误非常令人头疼,因此这次 llama.cpp 发布带来了切实的改善。新调试工具对于诊断和预防消费级 GPU 上的崩溃将极具价值。
本地 AI 与开放模型完整归档
今天的头条包括:改进 NCCL2 的新版 PyTorch trunk、用于提升自动驾驶汽车开发效率的 NVIDIA Alpamayo 2 Super,以及带来 NVK Mesh Shader 支持的 Mesa 26.2 开源图形驱动更新。这些更新为 GPU 计算和自动驾驶提供了实用工具与性能提升。
作为深度学习领域的基石框架,PyTorch 发布了新的 trunk 更新,对应 commit 128340f53ba183f9628216c435d48515d463fcc7。此次正式发布包含与分布式通信后端有关的重要增强。其中一项关键变更位于 c10d(Caffe2 Distributed)模块,该模块负责在多个 GPU 和节点之间进行分布式训练所需的核心通信原语。具体而言,本次更新涉及 nccl2(NVIDIA Collective Communications Library)集成。
这些改进主要关注拆分后的子通信组如何管理和记录其 world rank,以及至关重要的资源借用处理方式。这项优化旨在防止复杂分布式训练环境中可能出现的死锁或状态管理错误,尤其是在使用 NCCL 进行高性能 GPU-to-GPU 数据传输时。对于开发大规模 AI 模型的人员而言,这些底层优化对构建稳定、高效且可扩展的 CUDA GPU 训练工作流至关重要,可以增强分布式训练的稳健性,并让通信问题更易于调试。
这次 PyTorch trunk 更新,尤其是针对 c10d 和 nccl2 的修复,对所有运行分布式 GPU 训练的用户都十分重要。它直接解决了多 GPU 或多节点环境中可能出现的稳定性问题,让大规模模型开发变得更加可靠。
来源:NVIDIA Developer Blog
NVIDIA 宣布推出 Alpamayo 2 Super,这是一项旨在简化并加速自动驾驶汽车(AV)开发工作流的新产品。传统的 AV 开发需要分别使用不同模型来完成轨迹生成、高层意图预测、场景理解和全面的数据标注,这往往会形成相互割裂的 pipeline,并增加整体复杂度。Alpamayo 2 Super 将这些关键功能整合进了一个统一平台。
这套 NVIDIA 解决方案让 AV 开发者能够为不同驾驶场景生成逼真的轨迹,创建用于解释车辆决策的详细 reasoning trace,并自动完成繁重的数据标注工作。Alpamayo 2 Super 提供了一套端到端解决方案,显著减少了准备数据和测试 AV 算法所需的人工投入与时间。它利用 NVIDIA 在 AI 和仿真领域的深厚积累,提高 AV 感知和仿真工作的效率与准确性,最终加速构建更加安全、稳健的自动驾驶系统。这款工具直接支持 NVIDIA DRIVE 平台生态,进一步增强了下一代自动驾驶能力的开发。
对于已经投入 NVIDIA 生态的 AV 团队来说,Alpamayo 2 Super 看起来可能会彻底改变游戏规则。自动完成轨迹生成和 auto-labeling,可以大幅缩短开发周期,让工程师把精力集中在核心算法改进上,而不是耗费在繁琐的数据准备工作中。
Mesa 26.2 已正式发布,这是 Linux 系统上至关重要的开源 OpenGL 和 Vulkan 图形驱动的最新季度功能更新。该版本为多种 GPU 架构带来了大量重要改进和新能力,同时增强了性能,并进一步缩小了与专有驱动之间的功能差距。
Mesa 26.2 最引人注目的新增功能之一,是对 NVK Mesh Shader 的支持。NVK 是 Mesa 中面向 NVIDIA GPU 的开源 Vulkan 驱动,而集成 mesh shader,则意味着在 Linux 下运行的 NVIDIA GPU 向现代渲染技术迈出了关键一步。Mesh shader 可以实现更灵活、更高效的几何处理,从而在支持该技术的应用和游戏中提升性能并呈现更细致的图形效果。除了 NVK,Mesa 26.2 还为各类驱动组件带来了大量其他 Vulkan API 改进、Bug 修复和性能优化,其中包括 Intel ANV、AMD RADV 以及其他开源 GPU 驱动。对于追求前沿图形性能与稳定性的 Linux 用户,特别是希望探索 Vulkan 应用能力边界并利用现代 GPU 特性的用户来说,此次更新至关重要。
Mesa 26.2 对 NVK Mesh Shader 的支持,是 NVIDIA GPU Linux 用户的一项重大利好:这一关键的现代 Vulkan 功能终于进入了开源驱动。它将为游戏和专业应用解锁更出色的性能与视觉保真度。
GPU、CUDA 与自动驾驶完整归档
每日内容由官方发布 Feed、厂商 changelog 和工程博客汇编而成。归档:https://media.patentllm.org
如需采取进一步措施,你可以考虑屏蔽此人和/或举报滥用行为。