Nvidia开源工具PAIR可将局域网内多台设备(RTX 20系以上显卡、M4芯片等)联合调度,支持Ollama/LM Studio等本地模型,适合程序员在本地跑大模型推理。
Nvidia 对开源模型和本地 AI 的布局已经持续了一段时间。收购 Hugging Face 会进一步加速这一进程,而在产品层面,公司也在努力让更多潜在用户能够在自己的机器上运行 AI 模型。
周四,Nvidia 推出了 Nvidia Personal AI Router(PAIR),这是一款开源软件路由器,运行在家庭网络上,可以让闲置的 Mac 和 PC 按需运行小模型,并通过子 Agent 加速 agentic 工作流。
PAIR 的核心目标是加速 NemoClaw、OpenClaw 或 Hermes 等 Agent,允许它们并行使用更多子 Agent。思路是让主 Agent 将任务拆分给子 Agent,子 Agent 的模型请求可以在这些闲置机器上运行。
PAIR 被称为"虚拟推理路由器",Nvidia 明确表示这不是一个新的推理引擎。它利用机器上已有的 Ollama 或 LM Studio 来运行模型。在每台机器上安装 PAIR 后,它可以通过 mDNS 发现本地网络中的不同系统,并检查它们是否能够处理请求。
需要注意的是,PAIR 不会将单个推理请求拆分到不同机器上运行。Nvidia 强调它不能合并 GPU 或将显存聚合成单一加速器,也不能跨机器拆分推理请求。
"Agent 可以通过熟悉的本地接口发送请求,"Nvidia 解释道。"PAIR 通过代理接收请求,识别其引擎和模型要求,并选择一个符合条件的节点。该节点从头到尾执行请求,再通过 PAIR 发回响应。Agent 继续看到一条连接,而 PAIR 在背后处理调度。"
PAIR 支持配备兼容 GPU 的 Windows、macOS 和 Linux 机器。实际上,这指的是 Nvidia GeForce RTX 20 系列及更新 GPU(Nvidia 表示这是最低配置)、搭载 M4 芯片或更新芯片的 Mac,或者 Nvidia DGX Spark(以及今年晚些时候上市后的 RTX Spark PC 和笔记本电脑)。
很高兴看到 Nvidia 在这里支持 Mac——Mac 运行本地模型和 Agent(如 OpenClaw)显然已经非常流行,尽管它们并不使用 Nvidia GPU。
每台机器可以托管不同的模型,但 PAIR 只会在具备所需引擎且有所请求模型可用的机器上路由请求。在多台机器上安装相同模型可以为路由器提供更多分配并发请求的选项。
PAIR 会持续监控哪些计算机可用,一旦用户回到某台机器上工作(或游戏)并重新占用 GPU,本地推理引擎就会停止。
在 Nvidia 的示例中,使用 PAIR 配合两台搭载高端 RTX 5090 GPU(32 GB RAM,尽管原价 2000 美元但目前标价 5000 美元)的 PC 和 Qwen3.6 35B A3B 模型,通过五个子 Agent 将工作速度提升约 1.6 倍。
很少有人家里有多张 RTX 5090 显卡(可能也只有几台 DGX Spark 台式机),所以在 Mac Studio、几台 Mac mini 和一台游戏 PC 这样的场景下会是什么样子,还有待观察——但即便如此,也应该能加速本地 Agent 工作流。
Nvidia PAIR 现已提供 beta 版。要开始使用,只需在每台要加入网络的机器上安装它,让它发现并配对这些系统,并确保已在其上安装 Ollama 或 LM Studio(以及下载的模型)。
PAIR 还可以帮助完成设置,在配对机器上安装 Ollama 或 LM Studio 并启动模型下载。