前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
返回 AI 情报前线
All News · 全部资讯8915
  • AI Agent安全防护:威胁模型与关键控制措施
  • Go语言廉价RAG实战:从每轮50美分降至4美分
  • 上下文窗口才是 AI 回答质量的瓶颈
  • OpenAI暂停最强模型训练:模型突破控制
  • 125B MoE模型本地运行:3090三卡80 tokens/s优化实践
  • Claude攻克物理学九圈计算难题破世界纪录
  • Opus 5.5 Agent 爱汇报不干活?官方三招修复
  • Agent安全新思路:用短期可撤销凭证构建独立身份
  • 给 AI Agent 分配独立邮箱,处理每封邮件都视为不受信输入
  • AI 功能无声失败 26%:用 Eval Harness 捕获 LLM 输出退化
  • Codex报SKILL.md无效?原来是文件描述符耗尽
  • OpenCode永久提供DeepSeek V4.1 Flash 60美元额度
  • Nvidia SoL-Pi系统让编程Agent token消耗减半
  • 开发者亲测一个月停用AI:编码速度下降但深度思考回归
  • Together AI 发布 17 美元微调分类模型完整配方
  • 长对话 LLM Token 成本优化:缓存何时有效何处失效
  • 上下文工程:别把百万 Token 当存储桶用
  • OpenAI最强大模型因Agent安全漏洞被暂停
  • 笔记本跑 7000 亿参数 GLM:用 SSD 当显存火爆 GitHub
  • 谷歌TPU运行Kimi推理速度快57%,采用DeepSeek框架
  • Claude Code突破5小时限制可优雅收尾
  • OpenAI Agent失控调用DeepSeek/Kimi,近百万条短链曝光
  • 美团LongCat-2.5-Preview:1.6T MoE大模型支持百万token上下文
  • Anchors 方法让 LoRA 微调灾难性遗忘降低 28 倍
  • AI 推理服务器实战:GPU 选型与云端部署指南
  • Meta Muse AI 助手被通过隐藏端点劫持
  • OpenAI智能体擅传53张客户图片至公网,已承认违规
  • GitHub Copilot企业托管配置支持内联验证
  • OpenAI智能体安全漏洞:53张用户图片被发布至公开网络
  • AI应用上线后高频故障模式分析
  • AI Agent与传统自动化的安全差异:控制权在哪里
  • 我的RAG评估骗了我两次
  • GitHub Copilot用量API新增PR评审耗时分析
  • OpenAI Agent入侵Hugging Face细节披露
  • Meta Muse超越ChatGPT同期数据,剑指智能眼镜
  • Anthropic论文:Claude可完成九层推理链
  • 多 Agent 系统八大隐蔽失败模式与真正有效的防护机制
  • GitHub Copilot Canvas 入门:用自然语言构建自定义工作流
  • AI Agent 误将私密文章发布上线:一次 CI 流程的教训
  • 切 AI 工具时不再重复介绍代码库:真正有效的做法
  • Supabase 用户因配置不当暴露大量数据
  • Copilot自动修复Agent现利用记忆上下文
  • GitHub Copilot 周更:新增 Claude Opus 模型和本地沙箱
  • 已加载 43 / 8915
8.0
热点
AI SCORE
编程提效2026-09-26 18:30

Nvidia SoL-Pi系统让编程Agent token消耗减半

The Decoder#Nvidia#AI编程Agent#性能优化
Editor brief · 编辑速览

SoL-Pi通过优化模型与环境之间的控制层,使编程Agent的token使用量最高减少49%,性能几乎不变,测试了152种方案超3000次运行。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

Nvidia 的新论文描述了一个自动优化编码 Agent 控制层(称为 harness)的系统。研究人员表示,Token 用量下降近一半,而性能基本保持不变。

AI Agent 在无人监管状态下运行得越久,成本就越高。单次推理会演变成冗长的推理链、工具调用和反馈循环,Token 用量也随之膨胀。

Nvidia 研究人员的这项新研究并非从模型层面,而是从 harness 层面来解决成本问题。Harness 是模型与其运行环境之间的控制层,Codex、Claude Code 或 OpenClaw 等系统都使用了这一层。

研究 AI 分析 Agent 执行轨迹、提出 harness 修改建议,只保留那些在降低成本的同时维持性能的方案。SoL-Pi 在 EdgeBench 上相比 Codex 节省 50%,相比 Claude Code 节省 54.3%。

SoL-Pi 自动研究循环图,显示研究环境、研究 AI、想法池和四个保留的机制,旁边是 Codex、Claude Code、Pi 和 SoL-Pi 在 EdgeBench 上的评分和 API 成本对比柱状图。

Harness 控制 Agent 如何观察状态、执行操作和处理反馈。迄今为止大多数效率优化方法都集中在通过更快的注意力核和服务基础设施、模型压缩(如量化)或替换更便宜的模型来降低每个 Token 的成本。

AI 探索 152 个方向寻找更精简的控制逻辑

在实践中优化 harness 很困难,因为工具使用、上下文管理、验证和中止逻辑都紧密耦合。在一处节省 Token 的改动可能在别处引发错误,或者只是将成本推后到下一阶段。通常需要人工筛选冗长的执行轨迹,将反复出现的失败模式转化为代码。

这个名为 SoL-Pi 的系统将这项工作自动化了。研究 Agent 观察另一个 Agent 的执行轨迹,提出修改建议,并在准备好的环境中测试。能力和效率检查决定了哪些候选方案能够存活。据作者介绍,该方法借鉴了递归自我改进的思想。

评估只在 harness 冻结后才进行,且不会反馈到搜索过程中。

搜索流程图,从轨迹 rollout 到 map-reduce 分析、机制提议、候选实现、独立审查和开发验证,再到单独的保留评估。

在 535 个可执行环境中,该系统探索了 152 个方向,包括从 GitHub issue-pull-request 对提取的 495 个任务和 40 个合成测试用例。整个过程生成了超过 3000 次运行和超过 60000 次 Agent-环境交互。研究人员表示,这一规模展示了系统的搜索广度,但更多搜索并不自动带来更好的结果。这是一个风险,因为之前的工作表明自动优化的 harness 往往会对训练任务过拟合,在陌生任务上收效甚微。

SoL-Pi 通过严格分离搜索反馈和评估来解决这个问题。研究人员使用 EdgeBench 作为测试基准,并将其完全隔离在搜索过程之外。在其 51 个公开任务中,他们用 11 个对完成的候选方案进行一次性验证。其余 40 个保留用于最终评估,且这些结果永不反馈到搜索中。

四种消除浪费工作的机制

搜索产生了四种机制。Action Fusion 将两个连续步骤合并为一个,例如代码编辑后紧跟测试运行,这样就消除了一次完整的语言模型调用。Online Context Compact 在每个规划步骤后运行,在不丢失重要信息的前提下修剪累积的上下文。

ObservationPack 将冗长的工具输出存档,并在后续步骤中插入简短摘要,而不是每次都重新发送完整文本。Evidence-Preserving Reducer 将大型错误和测试日志路由到更便宜的模型,提取关键发现,并有一个自动验证步骤来捕捉任何遗漏的关键线索。

Nvidia 在 535 个可执行环境中搜索机制,并将 EdgeBench 保留用于最终评估。

四格图,分别展示 Action Fusion 如何合并连续 API 调用、Online Context Compact 如何在子任务完成后修剪上下文、ObservationPack 如何存档大型工具输出并用简短摘要替代、以及 Evidence-Preserving Reducer 如何通过更便宜的模型蒸馏错误日志并进行自动验证。

在 EdgeBench 的 51 个公开任务上,SoL-Pi 的表现与原始 Pi harness 大致相当。研究人员表示,Token 用量下降多少取决于配置。最有效的变体结合了全部四种机制,Token 用量减少 49%,达到 Pi 分数的 93.7%。优先考虑性能的用户如果只选择最强的单一机制,则能以 5.3% 的优势超越 Pi 的分数,同时仍能节省 Token。在两种变体中,Token 用量下降幅度为 44.7% 到 49%。

SoL-Pi 的效率变体将 Token 用量减半,成本从 $1339 降至 $894,分数略有下降。

对比表,展示 Codex、OpenSquilla、Oh-My-Pi、OpenCode、Oh-My-Opencode、Pi 和两个运行 GPT-5.6 Sol 的 SoL-Pi 变体的 Token 流量、成本、平均分数和 Token 效率。

以美元计算,作者估计与原生 Codex 和 Claude Code harness 相比每小时节省 $8.75 至 $13.50,与 Pi 相比每小时节省 $4.36 至 $5.71(基于当前 API 价格)。

研究人员仅使用 GPT-5.6 Sol 构建了该系统,然后不做任何修改地应用到了 Opus 5 上。在 Opus 5 上,它保留了 Pi 94.3% 的性能,并实现了类似的节省。但这些机制在 Opus 5 下触发频率更低、力度更小,研究人员将其归因于 harness 仅在 GPT-5.6 Sol 轨迹上进行了优化。

其他基准上的结果更为复杂

在 EdgeBench 之外,情况更为混杂。在 Terminal-Bench 4 的 63 个 CPU 任务中,SoL-Pi 仅解决了 15 个任务,而 Codex 和 Pi 各解决了 18 个。总成本仍比 Pi 低约四分之一。

在 2026 年国际数学奥林匹克(IMO 2026)的形式化验证 Lean 4 任务中,该系统以每个已解决问题最低成本的成绩破解了六道题中的三道。在内核优化实验中,20 个 SoL-Pi Worker 组成的群体比相当的 Pi Worker 群体降低了 26.8% 的成本。

在内核优化测试中,使用 SoL-Pi Worker 的群体取得了最佳结果,成本比使用 Pi Worker 的群体低约四分之一。

Agent 群体架构图,有一个 Codex 协调器和五组每组四个 Worker,旁边是进度曲线和对比周期数与模型成本的柱状图。

效率提升伴随着权衡,因为更短的上下文会降低提示缓存的复用率。在一次测试运行中,总成本仍从 $1339 降至 $894。展望未来,作者建议在许多任务上对 harness 进行预训练,类似于模型的预训练方式,并使用已有的精简 harness 来降低搜索其继任者的成本。他们将这种递归效率改进称为一种愿景,而非当前研究的结论。

Harness 对 Agent 成本的影响程度在工具公司 Composio 8 月的一次测试中变得清晰。该测试让 Deepseek V4 Flash 在包括 Claude Code 和基于 Pi 的 Oh My Pi 在内的四个 Agent 框架上运行。即使做的是相同的工作,每个已解决任务的成本也相差近 3 倍。

由于 Agent 消耗的 Token 越来越多,定价和优化压力持续增长。据 OpenRouter 分析师 Peter Walker 称,自 2026 年 2 月以来,Agent Token 用量增长了 14 倍,其中近 70% 来自缓存的提示。

SoL-Pi 使用的上下文压缩可能有副作用。一项研究发现,压缩平均仅保留 17% 的用户指令。并行 Agent 也会推高成本。Codex 开发者 Eric Provencher 最近警告说,超过两个子 Agent 几乎总是会浪费 Token 而不提升质量,因为它们大部分时间都在互相检查工作。

Original source

本文由 AI 翻译整理自 The Decoder,原文版权归原作者所有。

阅读英文原文
上一篇
OpenCode永久提供DeepSeek V4.1 Flash 60美元额度
下一篇
开发者亲测一个月停用AI:编码速度下降但深度思考回归