本地多设备推理路由开源工具,通过mDNS发现节点并用mTLS配对,将独立Agent请求分发至多台机器并发执行,3设备集群较单机提速约2倍。
Route the jobs, keep the API familiar
2026 年 9 月 3 日,NVIDIA 详细介绍了 Personal AI Router(PAIR)——一个开源 beta 版虚拟推理路由服务,它可以将独立的本地 Agent 请求分发到运行着 Ollama 或 LM Studio 的 Windows、macOS 和 Linux 机器上,无需修改 Agent 适配层。PAIR 通过 mDNS 发现节点,使用 mTLS 配对,并依据就绪状态、引擎状态、模型存在情况和 GPU 利用率进行调度。支持硬件包括 GeForce RTX 20 系列+、RTX PRO、DGX Spark 和 Apple M4+。在一项非官方的五子 Agent Hermes + Ollama 演示中,三设备集群在 8 分 48 秒内完成,而单台 RTX Spark 笔记本则需要 18 分钟——这是工作级并发,而非 GPU 池化或模型分片。RTX Spark N1X PC 也计划于 2026 年 10 月推出,进一步扩展本地芯片阵容。
Why product and eng teams should care
本地多 Agent 是 UX 与基础设施协同设计的问题。用户看到一个 Agent;PAIR 的 Jobs 视图展示推理运行在哪里。在开发者工具中暴露路由健康状态,谨慎地也可以在高级用户设置中展示。
无需新 API 是采用的关键特性。代理熟悉的 Ollama/LM Studio 端口意味着移动和桌面 Agent 产品可以在家庭/办公室集群上水平扩展而无需重写客户端——对于在本地 Agent 测试的隐私敏感型 MENA 企业很有价值。
弹性家庭集群 ≠ 数据中心。笔记本会休眠;游戏会抢占 GPU。设计能够容忍节点变动、当只有一台机器持有模型时能优雅降级的 Agent。
PAIR 使本地多 Agent 吞吐量成为一个可以调度的产品,而不是用户归咎于你应用的单 GPU 队列。原型化那些能暴露放置遥测数据并优雅降级的 Agent 体验——然后决定哪些工作负载留在设备上、哪些放到 Bedrock/Foundry 上。
Originally published on iFynx.