NVIDIA列出八月开源生态合作伙伴,涵盖最新开源模型、应用及工具,帮助开发者在本地构建和运行更强能力的AI Agent。
开源生态正在让 AI 爱好者和开发者越来越容易在本地构建、定制和运行能力更强的 Agent。
整个八月,NVIDIA 正在表彰推动本地 AI 前进的合作伙伴和开源社区,以及在整个生态中涌现的模型、应用和工具。这包括 NVIDIA 最新的开源模型、软件和开发者工具,以及帮助用户入门的加速计算、库和教育资源。
这将是一个 Agent 的大月。请持续关注本期 NVIDIA Local AI 博客系列的最新进展,接下来几周会有新的更新。
在 X、Instagram、TikTok 和 Facebook 上关注 NVIDIA RTX Spark——并通过订阅 RTX AI PC Newsletter 保持信息畅通。在 LinkedIn 和 X 上关注 NVIDIA Workstation。
NVIDIA 日前发布了 Cosmos 3 Edge,这是一款 40 亿参数的开源世界模型,适用于机器人、自动驾驶车辆和视觉 AI。其参数量是 Cosmos 3 Nano 的四分之一,可以运行在 NVIDIA DGX Spark 和 NVIDIA Jetson 的设备上。
MiniMax-H3 是一款 330 亿参数的开源权重模型,能够从文本、图片、视频、音频或四者的任意组合生成视频,以及原生同步的立体声音频。创作者可以通过 ComfyUI 访问它,并使用针对 NVIDIA GPU 优化的检查点在本地运行。
Poolside AI 发布了 Laguna S 2.1,这是一款 1180 亿参数的开源权重 Agent 编程模型,可以处理长达数小时的任务。NVFP4 检查点使开发者能够在单台 NVIDIA DGX Spark 上本地运行该模型,同时降低计算和内存需求,且不牺牲精度。
DeepSeek 日前更新了 DeepSeek-V4-Flash,这是一款 2840 亿参数的 MoE 模型,包含 130 亿活跃参数和 100 万 token 的上下文窗口。开发者可以使用社区构建的 GGUF 版本在 NVIDIA DGX Station 上本地运行。
Thinking Machines Lab 的 Inkling-Small 是一款前沿级别的开源权重多模态模型,具备跨文本、图片和音频的原生效推理能力,并支持可调节的思考努力程度。该 2760 亿参数模型在 NVIDIA GB300 NVL72 上训练,每个 token 仅激活 120 亿参数,可以在单台 DGX Station 或两台 DGX Spark 系统上运行。针对 NVIDIA Blackwell 优化的 NVFP4 检查点已在 Hugging Face 上提供。
Unsloth 将于周一发布 Unsloth Desktop。该产品将本地模型推理、图片和视频扩散、微调、Agent 集成、网络搜索和代码执行整合到一个完全开源的桌面应用中。发布材料将其定位为首款在本地训练和运行 AI 模型的桌面应用。
Unsloth Desktop 将本地 AI 训练和推理整合到一个完全开源的桌面应用中。这是首款在本地训练和运行 AI 模型的桌面应用。
阿里巴巴日前发布了 Wan-Animate-2,这是一款 140 亿参数的开源权重模型,可以将驱动视频中的动作和面部表情迁移到静态角色图像上——无论是人类、卡通、机器人还是动物。通过 ComfyUI 的 day-zero 支持,在 NVIDIA RTX PRO 5000 Blackwell(48GB)上生成速度快至 16 倍,在 NVIDIA RTX 5090 上比 Apple M3 Ultra 快 26 倍。
LTX-2.5 是 LTX 领先研究团队推出的最新前沿开源世界视频生成模型,为媒体娱乐、机器人技术和实时生成等跨场景应用提供基础,能够生成更高质量的视频、更强的提示词遵循性,以及在多轮生成中保持更一致的角色、场景和声音。
新增的多镜头支持使创作者能够生成跨多个镜头的序列,同时保持连贯性;升级后的扩散视频解码器则提升了视觉保真度并减少了伪影。创作者还可以对现有素材进行生成式编辑来精修细节,保持成品外观而无须从头开始。
新的提示词增强器采用 Gemma4 E2B 和定制的 Gemma4 12B 文本编码器,提供卓越的提示词遵循性,从而对输出结果实现更精细的控制。
新的扩散视频解码器与变分自编码器视频解码器互补,通过第二条解码路径来提高视频质量,从而获得更高质量的最终渲染效果。
LTX-2.5 针对 NVIDIA RTX GPU、DGX Spark 和 DGX Station 系统进行了优化。在 NVIDIA RTX 6000 PRO GPU 上,LTX-2.5 可实现最高快 20% 的性能和 40% 的内存节省。创作者可以通过即用型 ComfyUI 工作流在本地使用这些 NVFP4、FastVideo 和 ComfyUI 增强功能,进行文本、图片和视频转视频生成。
了解更多关于 LTX-2.5 的信息,开始在 NVIDIA 硬件上实现高质量本地视频生成。
今日,Meta 发布了 Muse Glimmer,这是一款 300 亿参数的密集型开源权重模型,上下文窗口超过 12 万 token。它专为编程和本地 Agentic AI 而构建。
Muse Glimmer 针对 NVIDIA GeForce RTX PC、NVIDIA DGX Spark、DGX Station 和 NVIDIA Jetson 进行了优化,在 RTX 5090 上可实现每秒超过 200 个 token 的生成速度,使常驻 Agent 能够在单个系统上本地处理数据并完成复杂的多步骤任务。
其密集型架构和混合注意力机制有助于在 Agent 处理更长任务、使用工具并在多个步骤中保持上下文时,将处理和内存需求保持在可控水平。
Muse Glimmer 是一款 300 亿参数模型,针对常驻本地 Agent 工作流进行了优化。它足够小,可以在配备单块消费级 GPU 的 PC 上运行,用例涵盖本地 Agent 和函数调用、本地编程以及 LLM-as-a-judge 评估。
AI 爱好者和开发者可以使用 NemoClaw 构建 Agent,并使用 NVIDIA NeMo Automodel 在本地对 Muse Glimmer 进行微调,使用私有或专业化数据,同时将其保留在系统上。Muse Glimmer 适用于:
开发者可以使用流行推理框架运行 Muse Glimmer,包括用于文本生成、图片、推理和工具使用的 vLLM,或使用 BF16 和量化 GGUF 检查点的 llama.cpp 进行文本和图片工作负载。llama.cpp 还支持 DFlash 投机解码来加速生成。
在单块 NVIDIA RTX 5090 上运行,Muse Glimmer 使常驻 Agent 能够跨私有文件、应用和通讯工作,同时减少对云端推理的依赖。

了解更多关于 Meta Muse Glimmer 的信息,并查阅 NVIDIA 技术博客,了解如何在 NVIDIA 硬件上开始使用本地 AI 和微调。

GLM 5.2 和 DeepSeek V4 Flash 等新型开源模型正在将云级别的智能带到本地系统,使编程和研究 Agent 等高级工作负载成为可能。然而,运行这些更大的模型可能需要多块 GPU 或多个 DGX Spark 系统协同工作。
NVIDIA Sync 应用更新使将多个 DGX Spark 系统轻松聚类成为可能,提供运行更大模型、更快推理所需的内存容量、推理性能和训练吞吐量。
NVIDIA Sync 提供 Windows 和 macOS 版本,可以自动检测已连接的系统,通过 Tailscale 提供私密安全的远程访问,并让开发者无需手动组网或复制终端命令即可在单个或多个 DGX Spark 系统上启动应用程序。
NVIDIA Sync 中的 Cluster Assistant 可以将两个或多个 DGX Spark 系统自动配置为高速集群。开发者通过 NVIDIA ConnectX-7 端口连接系统,NVIDIA Sync 会配置网络、在节点间路由工作负载并监控系统健康状况。
要开始在 DGX Spark 上构建 Agentic AI,请查阅 NemoClaw、OpenClaw、Hermes Agent 和 OpenShell 的 playbook。
本月晚些时候还将为开发者带来两个令人兴奋的新功能。
DGX Spark 将获得 Google Chrome 的原生 ARM64 Linux 构建——只需从 DGX Dashboard 点击一次即可安装。这意味着 Google 账户同步、完整的扩展生态系统、跨设备连续性,以及在其他所有平台上标准配备的所有功能,现在都可以在你的 DGX Spark 上使用了。登录一次,浏览器环境就会从笔记本跟随到 Spark。
新的 NVIDIA Sync Resource Monitor 将提供单个 DGX Spark 或整个集群的 CPU 和 GPU 使用情况的实时和历史视图——无需额外的监控软件或设置。一目了然的可视化帮助用户跟踪工作负载进度、在添加作业或模型前检查可用容量,并快速识别瓶颈或异常行为。 Marquee 缩放功能让用户可以从全局概览深入到工作负载中的特定时刻,帮助他们更快地排除故障并充分利用系统。
今日,NVIDIA 扩展了 Nemotron 3 模型系列,推出 Nemotron 3.5 Lightning,这是一款可定制的开源 30B MoE(混合专家)模型,适用于常驻 Agent。
Nemotron 3.5 Lightning 相比同级别的开源模型,token 生成速度提升至快 4 倍,完成时间缩短 30%。
由于 Nemotron 3.5 Lightning 是开源权重,AI 爱好者和开发者可以用自己的示例对其进行微调,以更好地匹配特定任务、兴趣和工作流程。例如,他们可以训练模型:
配合对应用程序、文件和其他工具的访问,这些微调后的模型可以为更个性化的本地 Agentic AI 体验提供动力——从帮助管理邮件和日历的助手,到处理日常事务的智能家居 Agent,再到与开发者在本地代码库上协同工作的编程伴侣。
NVIDIA 与 vLLM、Ollama、llama.cpp 和 LM Studio 合作,为 Nemotron 3.5 Lightning 模型提供最佳本地部署体验——为开发者提供 NVFP4 和 GGUF 格式的模型选择。Unsloth 还通过 Unsloth Studio 提供优化和量化模型的第一天支持,实现高效的本地部署。
Nemotron 3.5 Lightning 可以在 NVIDIA RTX PC、NVIDIA DGX Spark 和 OEM GB10 系统以及 NVIDIA Jetson 上本地运行,并可扩展到 RTX PRO 工作站、NVIDIA DGX Station 和 GB300 台式系统、数据中心和云环境。 NVIDIA Blackwell 系统现已通过宏碁、华硕、戴尔科技、Exxact、技嘉、惠普、联想、微星和超微提供,用户可以从广泛的设备和小大屏形态中选择满足需求的产品。
随着生成式 AI 采用率的增长,企业正在寻找在不牺牲前沿智能访问的前提下控制不断上升的 token 成本的方法。NVIDIA NeMo Switchyard 是一个开源路由库,可根据准确性、速度和成本自动将 Agent 工作流的每个步骤路由到最合适的模型。它还赋予开发者跨模型和跨提供商处理不同任务的灵活性。
内部基准测试表明,NeMo Switchyard 通过跨模型系统路由每个步骤,在保持前沿级任务完成度的同时,将基准测试完成成本降低到 Opus 4.8 单独运行的大约三分之一。NeMo Switchyard 可在 GitHub 上获取。
访问 Nemotron 3.5 Lightning、NeMo Switchyard 和 Jetson AI 技术博客开始入门。在边缘构建,请从 Jetson AI Lab 教程开始,并探索真实的 Jetson 项目。 Nemotron 3.5 Lightning 也可通过 OpenRouter、build.nvidia.com 上的 NVIDIA NIM 微服务,以及广泛的 NVIDIA 云合作伙伴、训练后平台、推理平台和云服务提供商获取。NeMo Switchyard 可在 GitHub 上获取。