NVIDIA发布开源虚拟推理路由工具PAIR,可将本地AI请求分发到RTX、DGX Spark、Mac等节点,Ollama/LM Studio无需改动。
多智能体工作流改变了本地推理的形态。一个主导 Agent 分解任务并生成子 Agent。本来一次用户请求,变成了数十次独立的模型调用。如果只指向单个本地引擎,这些调用会在同一个执行槽位上竞争。队列不断增长,而同一网络上的工作站、笔记本或 DGX Spark 却处于空闲状态。
NVIDIA Personal AI Router(PAIR)正是针对这个瓶颈。PAIR 于本周发布,是一个虚拟推理路由器。它能发现家庭网络上的兼容机器,并在它们之间调度独立的推理请求。它不是一个新的推理引擎——Ollama 或 LM Studio 仍然在 PAIR 选择的节点上执行模型。
它可以部署吗?可以。PAIR 今日以公开 Beta(v0.1.1)发布,提供面向 Windows、macOS 和 Linux 的签名安装包,完整源代码托管在 GitHub 上,采用 Apache 2.0 许可。它完全运行在本地网络内,仅在下载模型时需要互联网连接。
最重要的设计决策是:PAIR 不引入任何集群 API。它代理的是 Agent 已经在使用的 Ollama 兼容接口和 LM Studio 兼容接口,并接管每个引擎使用的默认端口。如果某个 harness 在其他端口监听,PAIR 的引擎设置中可以对代理端口进行配置。仓库还暴露了 OpenAI 兼容的代理端点。
结果:现有的 Agent harness 无需任何修改。Agent 决定请求什么工作,PAIR 决定工作在哪里运行。
发现、配对与传输
PAIR 使用 mDNS 自动发现附近的系统。当发现失败时,可以通过 IP 地址手动添加节点。信任通过六位 PIN 建立——邀请方机器上显示 PIN,被邀请方在本地输入。在配对完成之前,所有节点间通信都会被阻止。配对节点之间的流量随后使用生成的证书通过 mTLS 加密。
每个节点运行 Ollama 或 LM Studio。PAIR 可以在配对系统上安装引擎并开始下载模型,消除大部分跨机器的设置工作。
调度器如何选择节点
只有当所需引擎已启用且精确请求的模型存在时,节点才有资格接收请求。集群中的模型不需要完全相同——不同系统可以持有不同模型,PAIR 根据模型所在位置进行路由。在更多节点上加载相同标签只是扩大了候选池。
对于每个请求,调度器会综合考虑五个信号:节点是否在线且就绪、是否启用了支持的引擎、精确请求的模型是否存在、当前节点和引擎的作业负载如何、现有的 GPU 利用率是多少。
这是工作负载级别的并发,且边界是明确的。PAIR 为每个请求分配一个符合条件的节点,请求在其整个生命周期内保持在那个节点上。它不会 pooling VRAM,不会将多块 GPU 合并成一块更大的加速器,也不会将单个请求分片到多台机器上。
演示数据及其注意事项
NVIDIA 的演示将 PAIR 与 Hermes Desktop 配对,后者在一个合成的家庭收件箱上创建了一个五子 Agent 工作负载。Ollama 在每个选中的节点上执行 Qwen 3.6 35B A3B。
在一台 RTX Spark 笔记本上,工作负载平均耗时 18 分钟。在一个由 RTX Spark 笔记本 + DGX Spark + RTX 5090 组成的三设备 PAIR 集群上,平均耗时 8 分 48 秒。
支持的硬件与系统要求
PAIR 支持 GeForce RTX 20 系列及更新版本、Turing 及更新架构的 RTX PRO 工作站 GPU、DGX Spark 以及 Apple M4 或更新版本的硅芯片。Windows、Linux 和 macOS 节点之间可以相互配对,涵盖 x64 和 arm64 架构,不过 Windows on ARM 仍处于实验阶段。验证过的配置要求至少 8 GB 内存,推荐 20 GB 磁盘空间。其他 Linux 发行版需要从源码构建。
PAIR 将每个独立请求路由到一个节点;它从不 pooling VRAM 或对模型进行分片。
它代理现有的 Ollama 和 LM Studio 端点,因此 Agent harness 无需任何修改。
资格取决于节点就绪状态、启用的引擎、精确匹配的模型存在性、作业负载以及 GPU 利用率。
NVIDIA 的五子 Agent 演示从单台笔记本的 18 分钟降至三台设备的 8 分 48 秒(非官方数据)。
Apache 2.0 与 Beta 版本:目前仅有一种调度策略,不感知 VRAM、GPU 等级和模型预热状态。