英伟达联合微软推本地AI加速,RTX Spark Win PC十月上市,配1 Petaflop算力芯片和开源PAIR推理路由技术。
前沿智能正在走向本地化。在 IFA 2026 上,NVIDIA、微软及其合作伙伴携手合作,提供更快的推理能力以及新的工具,使 Agent 更容易在 NVIDIA 硬件上本地设置和运行。全新的紧凑型 NVIDIA RTX Spark Windows PC 也将于 10 月上市,让 AI 爱好者、开发者和创作者有更多方式安全地在本地运行强大的 Agent。
今天的公告包括:
此外,8 月也是本地 AI 繁忙的一个月:
Nemotron 3.5 Lightning — 可运行在 NVIDIA RTX PC、RTX PRO 工作站、DGX Spark 和 Jetson 上 — 这是一款 300 亿参数模型现已发布。立即开始使用 Nemotron 3.5 Lightning。
Z.ai 的 GLM-5.3-Flash 是一款多模态混合专家(MoE)模型,正在将 Agentic AI 带到 DGX Station。
Qwen 发布了 Qwen3.8-Flash-Next,这是一款开源多模态 MoE 模型,可在 DGX Spark 和 DGX Station 上本地运行,同时还有 Qwen3.8-27B,这是一款 270 亿参数的开源模型,针对 NVIDIA GPU 上的本地 Agent 工作和编码工作负载进行了优化。
LTX 的 LTX 2.5 是一款针对 NVIDIA RTX GPU、DGX Spark 和 DGX Station 优化的开放世界视频生成模型,具备全新的 NVFP4、FastVideo 和 ComfyUI 增强功能,可实现更快、更省内存的本地生成。
MiniMax-H3 是一款开源视频生成模型,具备同步音频功能,可通过 ComfyUI 在 NVIDIA GPU 上本地运行。FastVideo 与 NVIDIA 研究人员合作,发布了 FastH3 — 这是一款开源的四步蒸馏版本,性能提升 7 倍。针对 NVIDIA RTX GPU 和 DGX Spark 优化的 FastVideo 配方即将推出。
Meta 的 Muse Glimmer 是一款 300 亿参数的开源模型,适用于编码和 Agent 工作负载,可本地运行在 GeForce RTX PC、DGX Spark、DGX Station 和 Jetson 上。NVIDIA 还发布了支持 DGX Spark 的 NVFP4 量化,可在本地部署时更高效地使用内存。
DeepSeek v4 Flash 是一款 2840 亿参数的 MoE 模型,具有 130 亿个活跃参数,可在 2 台 DGX Spark 集群和 DGX Station 上本地运行。
使用本地模型搭建本地 Agent 需要付出不少努力 — 选择模型、找到兼容的推理服务器、调优量化设置、保持一切更新。这种阻力正在从 RTX 和 DGX 系统中消失。
三款使用最广泛的 Agent 应用将在 Windows 上提供简化的本地模型设置,均基于 llama.cpp 构建,并整合了 NVIDIA 最新的推理优化。全新的设置体验旨在减少手动配置,让本地 Agent 更容易启动运行。
上个月,Perplexity 推出了 Portable Computer Agent,为用户提供了一种简单的方式在 Linux 系统(如 NVIDIA DGX Spark)上本地运行 Perplexity,将模型、编排和工具打包成单一的应用体验。
Perplexity Portable Computer 适用于配备至少 24GB VRAM、在 Linux 上运行的 NVIDIA RTX GPU,Windows 支持即将推出,让更多 PC 用户也能享受这一流畅的设置体验。用户可以在本地运行完整的工作流,而不消耗积分,同时在需要额外研究或推理时,有选择地将部分任务升级到云端 15+ 个前沿模型。Portable Computer 在将内容发送到云端之前会请求权限,帮助用户将敏感信息保留在设备上。以下是一些示例用例:
立即体验 Portable Computer。
Hermes Agent — 由 Nous Research 开发 — 是一款通用 Agent,被数百万人使用,以可靠性和自我改进能力见长。Hermes 与模型和提供商无关,设计为可在本地系统上全天运行,这使 RTX PC、RTX PRO 工作站和 DGX Spark 成为天然适配的选择。
在 Hermes 中配置本地模型将帮助用户在 Windows 上的 RTX 和 DGX 系统中获得一键设置体验。Agent 会自动检测 NVIDIA GPU,选择合适的模型和配置,并通过集成的 llama.cpp 运行它,而 NVIDIA 推理优化已经就位,无需手动下载和调优模型。Linux 支持即将推出。
一旦运行起来,Hermes 的工作方式与在其他地方一样。它使用工具、跨任务维护上下文、在会话之间记住信息,并随着时间创建可重用的技能,让 Agent 在持续使用中变得更加能干。在 GPU 上本地运行模型既保持了高性能,又确保了数据留在系统中。
Windows 平台的一键本地模型设置现已可用,Linux 支持即将推出。了解更多关于 Hermes Agent 的信息。
OpenClaw 已成为开源 Agent 运动中最具定义性的项目之一 — GitHub 上最大的 AI 项目,拥有超过 38 万星标,以及一个快速成长的社区,正在构建涵盖研究、工程、项目管理和日常生产力等方面的工具和技能。
NVIDIA、微软和 OpenClaw 一直在合作,让在 Windows PC 上设置这种体验变得更加容易。为了减少上手阻力,OpenClaw Windows App 简化了在任何配备至少 24GB VRAM 的 RTX GPU 上设置优化本地模型的过程。
在 OpenClaw 博客中了解更多。
推理性能对于保持本地 Agent 的响应能力至关重要。NVIDIA 继续与开源 llama.cpp 和 vLLM 社区合作,加速本地 NVIDIA 平台上的 Agent 工作负载。

llama.cpp 通过 GeForce RTX 5090 上的内核优化、增强的投机解码技术和更快的预填充,实现了最高 1.9 倍的吞吐量提升。
vLLM 在 RTX PRO 6000 Blackwell Workstation Edition 上实现 1.2 倍提升,在两台 DGX Spark 集群上实现最高 1.4 倍提升。FlashInfer 中的全新 XQA 注意力内核和后端优化有助于加速两个平台的推理。
这些提升在 llama.cpp 和 vLLM 推理后端上均可使用。
用户也可以通过 LM Studio 和 Ollama 应用体验这些提升。
超过一半的美国家庭拥有两台或更多 PC,而这些计算能力在一天中的大部分时间都处于闲置状态。NVIDIA Personal AI Router(PAIR)是一款免费的开源软件工具,可将这些系统整合起来用于本地 AI。
Agent 工作流通常将复杂任务分解为可并行运行的小型作业,但当每个请求都在争用同一个 GPU 时,性能可能会变慢。PAIR 可自动发现本地网络上兼容的 PC,并将独立的推理请求路由到有空闲容量的系统。它与 Ollama 和 LM Studio 配合工作,并可适应设备加入或离开网络的情况。
例如,用户可以让 Hermes 创建一个"Sunday Reset"计划,通过整理混乱的收件箱并确定哪些需要立即处理、哪些可以等一等、哪些可以跳过来优先级排序。Hermes 可以将这项工作分配给多个子 Agent,而 PAIR 则将这些作业分布到可用的 PC 上,而不是让它们都在单个 GPU 上等待。
其结果是本地 Agent 获得了更多算力支持,更多任务可以并行运行,并且可以在主系统用于游戏、创作或其他工作时灵活地将 AI 工作负载转移到另一台 PC 上。
NVIDIA PAIR 测试版可通过图形界面和终端界面在 Windows、macOS 和 Linux 上使用,支持 NVIDIA GeForce RTX 20 系列及更新的 GPU、NVIDIA RTX PRO 工作站 GPU(Turing 架构及更新)、NVIDIA DGX Spark 和 Apple M4 或更新的芯片。
查看 NVIDIA 技术博客,开始使用 NVIDIA PAIR。
开放图像和视频模型使艺术家能够在 PC 上尝试 Creative AI 模型。这让艺术家能够迭代和探索概念与想法,而不必担心令人头疼的 token 消耗问题,并让更多创作工作保留在设备端和私密环境中。
CyberLink 的全新 PhotoDirector AI PC Mode 是首批将这些扩散模型直接集成到创意软件中的应用程序之一,并将它们转化为艺术家指尖的创意工具。即将登陆 PhotoDirector 365,并在 NVIDIA RTX Spark 上市时对其进行优化,AI PC Mode 用户将获得 AI 驱动的编辑工具,用于生成式编辑、图像增强、对象和干扰物去除、背景去除和替换、人像优化以及全新视觉创作 — 灵活性在于可根据任务选择本地或云端处理。
在 NVIDIA GPU 上,PhotoDirector 使用 TensorRT-RTX 和 FP8 来加速本地 AI。
开始使用 Cyberlink 的 PhotoDirector 365 照片编辑软件,并了解更多关于 PhotoDirector AI PC Mode 的信息,该功能将于 10 月随 RTX Spark 一起发布。
NVIDIA RTX Spark 将于今年 10 月上市 — 在 IFA 2026 上,合作伙伴正在展示他们的硬件。在 IFA 上,新公布的设计加入了现有六家 OEM 的 10 月上市阵容。宏碁展示了一款紧凑型台式机 RTX Spark 概念产品,联想发布了 Yoga Pro 9n 和 Yoga 9n 二合一。
RTX Spark 是 Windows PC 的全新起点。一台为创作者、游戏玩家和 AI Agent 打造的 PC。配备强大的 1 Petaflop RTX Blackwell GPU、最高 128GB 统一内存和高效的 20 核 Grace CPU,RTX Spark 带来了令人难以置信的性能和能效。这款超级芯片使高性能轻薄笔记本具备全天电池续航能力,紧凑型台式机则为永不停歇的 Agent 提供动力。配合全新的 Windows Agent 框架,实现可在 OS 级别控制下安全地在后台运行的 Agent。
上周在 Gamescom 上,艺电、Embark 和育碧是最新的将旗下大作带到 NVIDIA RTX Spark Windows PC 的游戏发行商和开发商。他们加入了在 5 月 COMPUTEX 上宣布支持 RTX Spark 的发行商行列,包括 KRAFTON、网易、拳头游戏和 XBOX。阅读更多。
注册以获取 RTX Spark 笔记本和台式机上市通知。
🎮 NVIDIA 在 Gamescom 上带来全新 RTX 技术和游戏 — NVIDIA 发布了 DLSS 4.5 Ray Reconstruction,采用全新的第二代 Transformer 模型,改善光线追踪和路径追踪游戏的图像质量。Gamescom 还为包括 007 First Light、CONTROL Resonant 和 Gears of War: E-Day 在内的游戏带来了新的 RTX 公告,并为即将推出的 NVIDIA RTX Spark 扩展了游戏支持。
🐋推出 DeepSeek Harness — DeepSeek 的全新开源 Harness 与 DeepSeek-V4-Flash 配对,为 NVIDIA DGX Station 和多 DGX Spark 配置上的本地 Agent 编码工作流提供动力。
📊MLPerf Client v2.0 扩展 AI PC 基准测试 — MLCommons 与 NVIDIA 和其他行业领导者合作发布了 MLPerf Client v2.0。更新增加了 Agent AI 和图像生成的新基准测试,以及针对真实本地 AI 工作负载的扩展 LLM 测试。
在 X、Instagram、TikTok 和 Facebook 上关注 NVIDIA RTX Spark — 并通过订阅 NVIDIA Local AI 简报保持信息更新。在 LinkedIn 和 X 上关注 NVIDIA Workstation。
查看关于软件产品信息的通知。