Perplexity 推出 Portable Computer,在 NVIDIA DGX Spark 工作站上本地运行其 Computer Agent,将推理能力与云端权威解耦。
本周 Perplexity 发布了 Portable Computer,这是其 Computer agent 的本地优先版本,运行在 Nvidia DGX Spark 工作站上,价格不菲:一台 DGX Spark 起售价 4,700 美元,而一块已经有些年头的 24GB RTX 3090 也能轻松卖到 1,500 美元以上。
但真正值得关注的,是价格标签背后的架构选择:大多数平台在构建 agent 时,通过更强的智能来提升可靠性。这通常意味着更大的编排模型、规划模型,或者用于审查工作的批评模型。
概率推理负责提议下一步行动,而确定性软件来决定是否执行。
Perplexity 选择了将这两项工作分离,而不是堆叠在一起。概率推理负责提议下一步行动,而确定性软件来决定是否执行。
Perplexity 用"编排器"(orchestrator)一词来指代运行时控制器,而非规划模型。这个控制器负责组装上下文、执行策略,并在 OS 级沙箱内执行已批准的工具调用。公司表示,它是确定性代码,而非又一个模型。本地模型负责提议下一步行动,包括调用哪个工具以及何时向云端顾问求助。这种分工类似于控制平面架构——推理负责建议,而可审查的软件保留决策权。Perplexity Computer Enterprise 与基础设施副总裁 Nate Kupp 告诉 The New Stack,这个 harness(控制框架)占据了大部分工程工作。
Perplexity 保持基础模型和硬件不变,在同一台 DGX Spark 上对三个 agent 技术栈测试 Qwen3.8-27B。在其内部 Local Knowledge Work Bench 上,针对一组 53 项保留任务,公司报告 Computer 得分为 82.6%,Pi 为 77.6%,Hermes 为 74%。
在 ParseBench-100(涵盖图表、布局、表格和格式的子集)上,差距明显扩大。Perplexity 报告 Computer 为 65.1%,而 Hermes 为 34.6%,Pi 仅为 13.9%。
由于基础权重保持不变,这个差距衡量的是模型周围的系统,而非更好的模型。但这并不意味着权重不再重要。Perplexity 对 Qwen 进行了后训练得到 PPLX 27B,报告得分为 85.4%,高于其自身基础模型的结果。Harness 工程和后训练是这一方法的重要因素。
"harness"这个词涵盖的范围很广,包括 prompt、工具 schema、上下文管理、验证钩子和文档处理。编排代码只是其中一部分。
沙箱是边界,而非确定性本身。Perplexity 表示,沙箱限制了进程、文件系统路径和网络访问。如果沙箱不可用,harness 会在执行任何工具调用之前自行禁用。在这种场景下,确定性代码很有价值,因为它使策略易于审查,并帮助系统安全失败。确定性代码仍然可能存在漏洞,或者忠实地执行一个被允许的错误。
关键区别不在于模型编排和代码编排之间,而在于权限是否通过"用普通英语请求模型配合"以外的方式来执行。
Perplexity 报告称,Qwen3.8-27B 标称 260,000 token 的上下文窗口,但超过 100,000 token 后就开始表现下滑。因此,harness 保持核心 prompt 和工具集较小,并按需加载技能。常用连接器被做成命令行工具,而不是完整保留在上下文中的 Model Context Protocol 定义。
确定性执行无法挽救超出本地模型能力的推理。在 Terminal Bench 2.1 上,Perplexity 报告本地运行得分为 59.6%。让本地 agent 咨询 Claude Opus 5 将分数提升至 73.0%,而 Opus 5 单独工作时为 82.4%。所有这些仍然是供应商在该公司尚未开源的基准上报告的证据。
对于评估本地 agent 的企业来说,需要仔细审视的是授予和拒绝权限的那一层,因为这是平台工程体现最明显的地方。