NVIDIA为开源Pi编码Agent引入SoL-Pi四种harness机制,在EdgeBench上实现token流量减少44.7%-49%、API成本降低约33%,同时保持94%的原始性能。
Coding agents 现在能连续运行数小时,而非几分钟。每次编辑、测试运行和日志读取都会回流到模型的上下文窗口中。NVIDIA、NTU 和 MIT 的研究团队发布了 SoL-Pi,这是为开源 Pi coding agent 设计的一套 4 项效率机制。AI 通过在 harness 层运行 auto-research loops 发现了这些机制。在 51 个任务的 EdgeBench 评估中,SoL-Pi 相比 Pi 将记录的 token 流量减少了 44.7% 至 49.0%,API 成本降低约 33%。在 GPT-5.6 Sol 和 Opus 5 上,其得分均接近 Pi。
能否部署?答案是肯定的。SoL-Pi 以 MIT 许可证发布在 GitHub 的 NVlabs 下,是一个无需修改 Pi 原版即可运行的扩展。已在 Pi 0.85.1 和 Node.js 22.19 或更高版本上通过测试。
大多数效率工作通过更快的内核、量化或更便宜的模型来降低每 token 的成本。而 SoL-Pi 则是减少任务消耗的 token 数量。Harness 是处理工具调用、上下文、观察和委托的层级。
手工调优 harness 很慢,而且各部分耦合紧密:一处修改可能会将成本推到后续步骤中。Meta-Harness 及类似系统可以自动化这项工作。然而,最近一项研究发现,进化后的 harnesses 可能会过度拟合搜索任务,在未见过的任务上仅带来边际收益。
一个研究 AI 观察来自运行原生 Pi 的独立 agent 的执行轨迹,然后提出 harness 修改建议并测试。搜索覆盖了:
每次搜索都是一次性的、隔离的循环。它遵循 autoresearch 周期,并增加了 Ralph Loop 实现步骤和独立审查环节。
接受规则在搜索开始前是固定的,优化器不能改变它们。每项能力指标必须保持在预先声明的容差范围内。候选方案还必须至少改进 1 项效率指标。EdgeBench 始终留出不被搜索污染。其中 51 个公开任务中,11 个用于单向接受已冻结的候选方案,40 个用于最终评估。留出结果永远不会反馈到搜索中。
Action Fusion:Base Pi 通常先编辑一个文件,然后发出单独的命令来测试、构建或运行它。Action Fusion 将两者合并为 1 次工具请求,并在 1 次观察中返回两个结果。这减少了一次模型往返。
Online Context Compact:计划步骤通过 update_plan 跟踪。当一个步骤完成后,harness 估计还剩多少次请求。然后将预计的输入节省量与重写 prompt 缓存的额外成本进行比较。当这个门控通过或上下文接近窗口限制时,调用 Pi 原生的压缩机制。
ObservationPack:超过 10 KiB 的工具输出在本地归档,并在接下来 2 次 provider 请求中完整发送。从第 3 次请求开始,模型看到一个稳定的句柄、原始大小以及头尾行的简短摘要。精确的页面可以通过句柄检索。
Evidence-Preserving Reducer:至少 4 KiB 的构建和测试日志发送给更便宜的模型 GPT-5.6 Luna at high,由它写出一份紧凑的收据。确定性验证器检查收据的 schema、源哈希、退出状态、精确引用和大小。在三种情况下 harness 回退到原始日志:验证失败、疑似凭证问题,或收据不比原始日志小。
| Backend | Harness | Tokens (B) | API Cost | Avg. Score | GPT-5.6 Sol |
|---|---|---|---|---|---|
| GPT-5.6 Sol | Codex | 3.05 | $1,787 | 34.7 | - |
| GPT-5.6 Sol | Pi | 2.15 | $1,339 | 44.8 | - |
| GPT-5.6 Sol | SoL-Pi [Efficiency] | 1.10 | $894 | 42.0 | - |
| GPT-5.6 Sol | SoL-Pi [Performance] | 2.02 | $1,271 | 47.2 | - |
| Opus 5 | Claude Code | 2.00 | $2,535 | 43.7 | - |
| Opus 5 | Pi | 2.37 | $1,741 | 44.8 | - |
| Opus 5 | SoL-Pi [Efficiency] | 1.31 | $1,158 | 42.2 | - |
| Opus 5 | SoL-Pi [Performance] | 2.10 | $1,605 | 50.5 | - |
完整技术栈基于 GPT-5.6 Sol 构建,迁移到 Opus 5 时无需进一步搜索。在 Opus 5 上,它保留了 Pi 94.3% 的分数,同时将 token 流量减少 44.7%,API 成本降低 33.5%。在 GPT-5.6 Sol 上,它保留了 Pi 93.7% 的分数,token 减少 49.0%,成本降低 33.2%。
Performance 配置对每个后端使用单个最佳机制:GPT-5.6 Sol 上用 ObservationPack,Opus 5 上用 Action Fusion。它分别将分数提升了 5.3% 和 12.8%,超越 Pi。
在 GPT-5.6 Sol 上,完整技术栈将缓存写入流量从 0.0141 B 增加到 0.0316 B tokens。总成本仍然下降,从 $1,339 降至 $894。该论文估计,相比原生 Codex 和 Claude Code harnesses,每小时节省 $8.75 至 $13.50;相比 Pi,每小时节省 $4.36 至 $5.71。
Terminal-Bench 4(63 个纯 CPU 任务):SoL-Pi 解决了 15 个任务,而 Codex 和 Pi 都是 18 个。相比 Pi,它将总成本降低了 26.3%($211.12 vs $286.45)。
IMO 2026,Lean 4 验证:SoL-Pi 通过 6 道题中的 3 道,与 Pi 持平,每次通过问题的成本最低($20.90)。Codex 通过了 5 道。
Agent swarm:20 个 SoL-Pi worker 配合 Codex 协调器达到 1,127 个循环,成本 $60.11。用 20 个 Pi worker 时达到 1,366 个循环,成本 $82.12。单个 Codex agent 仍然是最便宜的选择,成本 $39.20,达到 1,333 个循环。
研究团队称跨模型迁移是初步的。这些机制在 Opus 5 上触发的频率较低,可能是因为搜索仅使用了 GPT-5.6 Sol 的轨迹。
SoL-Pi 相比 Pi 将 EdgeBench token 流量减少 44.7% 至 49.0%。
API 成本降低约 33%,同时保持 Pi 约 94% 的平均分数。
4 项机制在 152 个方向和 535 个环境的搜索中存活下来。
SoL-Pi 是 GitHub 上 MIT 许可的、opt-in 的 Pi 扩展。
查看 Paper、GitHub Repo 和 Technical Blog。所有荣誉归于该项目的研究人员。同时,欢迎在 Twitter 上关注我们,不要忘记加入我们的 150k+ ML SubReddit 并订阅我们的 Newsletter。等一下!你用 telegram 吗?现在你也可以加入我们了。
想与我们合作推广你的 GitHub Repo 或 Hugging Face Page 或产品发布或网络研讨会吗?联系我们
Asif Razzaq 是 Marktechpost AI Media Inc. 的 CEO。作为一位有远见的企业家和工程师,Asif 致力于将人工智能的潜力用于社会公益。他最新的事业是推出了人工智能媒体平台 Marktechpost,该平台以深入报道机器学习和深度学习新闻而著称,既具有技术深度又易于被广大受众理解。该平台每月浏览量超过 200 万次,显示出其在受众中的受欢迎程度。