前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8485
  • Meta让数千名工程师「修Bug」来训练AI编码工具
  • 2026企业AI架构转型:从免费套餐到成本敏感的工程现实
  • AWS实战:通过MCP桥接让云端Agent安全调用本地工具
  • n8n集成Bedrock AgentCore:零基础设施搭建生产级AI Agent
  • AI Evals 入门:如何真正评估你的 AI 系统效果
  • 通过 MCP 协议让 AI Agent 完全控制真实 iOS/Android 设备
  • 深度推理模型生产部署实战指南
  • 深度推理模型性能监控实战指南
  • Agent系统最可怕的bug不是崩溃,而是静默失败
  • Vercel域名购买后可一站式配置部署、代理和邮箱
  • AI编程时代:代码审查员的核心价值与实操框架
  • AI Agent伪装身份欺骗开源维护者:安全沙箱已失效
  • Mistral 开源 3B 安全模型 Shieldstral:本地内容审核新选择
  • 自研 Agent 流水线的实战复盘
  • 自建内部 AI 平台成本远超预期:工程团队需谨慎决策
  • 自适应测试时计算:告别均匀分配推理预算
  • 分离Prefill/Decode:避免长Prompt阻塞所有Token
  • Agent难复现Bug的克星:确定性模拟测试
  • Agent工具调用分支预测:消除等待空档
  • Agent上下文窗口即RAM:引入分页机制
  • 停止让工具流经LLM:2026年代码模式转型
  • SparseSpec-L:无训练稀疏 KV 缓存让长上下文 LLM 推理提速 2.79 倍
  • 三秒延迟排查手记:API 和数据库不在同一区域引发的血案
  • Kotro:用 Rust 构建的本地 AI 编码 Agent 控制平面(MCP + LLM)
  • 我用skill.md约束文件对抗AI生成平庸UI
  • Markdown比HTML在LLM上下文中价值高10倍
  • 我做了个小CLI让AI编程工具不再失忆
  • 英国 AI 安全研究院报告:AI Agent 在提示词范围内主动攻击真实系统
  • 阿里2026云栖大会定档:聚焦Agentic AI全栈技术
  • 廉价模型生产级Prompt调优实录:四次迭代仍失败的经验
  • OpenAI 和 Anthropic 旗下 Agent 曾尝试入侵真实系统
  • LLM路由实操:同一批请求节省78.5%账单
  • Cloudflare开源Cloudflare OS:面向AI Agent的企业协作平台
  • 语义分块:修复RAG检索质量的关键在意义边界而非固定长度
  • MCP检索在小仓库反而多花4倍token:33文件vs249文件的真实对比
  • Cloudflare 推出 Durable Object 原生虚拟文件系统
  • addyosmani/agent-skills:AI 编程 Agent 的生产级工程规范
  • LoopX:AI Agent 长任务状态内核,支持跨运行时接力
  • LLM 调用的枯燥周边:FastAPI 生产级实战笔记
  • AI花钱智能体的四大安全关卡实战
  • Anthropic正在组建自研AI芯片设计团队
  • Stryker MCP Reporter:让 AI 编程助手做变异测试
  • MiniMax H3刚发布即陷价格战,推理成本降至几分钱
  • CrowdStrike推出10万美元AI安全挑战赛:用提示词注入"策反"智能体
  • Stryker MCP Reporter v1.8.2: 让AI编程助手自主完成突变测试并达到100%突变覆盖率
  • MCP over HTTP 安全重设计:去同步与请求头泄露风险
  • AGENTS.md:给 AI 编程工具的工程化指南
  • README 服务人类,AGENTS.md 服务 AI Agent
  • FLUX 3 Video全面可用
  • Anthropic确认自研AI芯片:年薪216万至328万招聘工程师
  • Cloudflare 发布 Agent 访问控制模型:身份代理+持续鉴权架构
  • 已加载 51 / 8485
8.0
热点
AI SCORE
技术实践2026-08-06 00:19

停止让工具流经LLM:2026年代码模式转型

dev.to · AI#Agent架构#成本优化
Editor brief · 编辑速览

从tool-calling转为Code Mode,context从36781 tokens降至222(降低99.4%),同一任务API消耗大幅减少。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

从 Tool-Calling 到 Code Mode:让 Agent 写一个脚本,而不是把五十个工具调用逐个念给 LLM —— 上下文 token 下降约 99%。

太长不看: 经典 Agent 循环把每个工具定义都加载进上下文窗口,并把每个中间结果通过模型回传。只要接上几十个工具,用户还没开口,上下文就满了。2026 年的方向 —— Code Mode —— 是让 Agent 写一个简短的脚本直接调用工具,批量数据留在沙箱里,只有最终答案返回。一个极小的可运行演示把上下文从 36,781 个 token 砍到 222 个 —— 减少 99.4%。同样的结果,无需 API key。

心智模型:不是让一个员工大声朗读 50 份手册的每一页和电子表格的每一行,而是把工作需要的 3 份手册交给他,让他们在自己的桌子上做计算。你只收回最终答案 —— 而不是原始数据。

问题:tool-calling 随工具数量增加无法 scale

Function/tool-calling 是目前大多数 Agent 的行动方式。用五个工具时效果绝佳。但整个工具面(tool surface)在每次请求时都会被序列化进上下文窗口,模型请求的每个中间结果也会通过上下文回传。

所以一个类似"统计每个套餐层级的未解决工单数量并保存报告"的任务看起来是这样的:

  1. 把所有 50 个已连接工具的 schema 加载进上下文
  2. 调用 list_tickets → 2,000 行数据通过模型返回
  3. 调用 get_customers → 400 行数据通过模型返回
  4. 模型在脑中合并并计算这些数据块

模型为 50 个它大部分不需要的 schema 付了费,也为 2,400 行它只需要聚合而不需要读取的原始数据付了费。Anthropic 测量了一个真实的 Google Drive → Salesforce 任务,token 用量达 150,000 个;Cloudflare 在 2,500 个端点的 API 上达到了约 117 万个 token 的工具定义用量。

模式:写代码来调用工具

Code Mode(Anthropic 的"Code execution with MCP"、Cloudflare 的"Code Mode")翻转了这个循环:

  • 工具变成代码 API —— 一个类型化函数的文件系统,每个工具一个函数
  • 渐进式披露(Progressive disclosure)—— Agent 只读取任务需要的少数签名
  • 模型输出一个脚本,而不是一串工具调用
  • 沙箱运行它。中间数据存在于沙箱中;只有最终结果返回

以下是这个"模型"在演示中写的完整脚本 —— 2,000 张工单和 400 个客户在沙箱内部完成连接,从不接触上下文:

tickets = list_tickets("open")            # 2000 rows: fetched and joined entirely in the sandbox
plan = {c["id"]: c["plan"] for c in get_customers()}
counts = {t: 0 for t in ("free", "pro", "enterprise")}
for tk in tickets:
    counts[plan[tk["customer_id"]]] += 1
rows = [{"tier": t, "open_tickets": counts[t]} for t in counts]
result = save_report("open_by_tier", rows)

沙箱只暴露工具 API —— 没有内置函数,没有导入 —— 所以脚本可以组合工具,但无法触及进程的其余部分:

api = {"list_tickets": list_tickets, "get_customers": get_customers, "save_report": save_report}
sandbox = {"__builtins__": {}, **api}
exec(script, sandbox)      # only the script text + final answer ever cross the context window
Code Mode — write code that calls tools, don't stream tools through the model

  Task: count open tickets per plan tier over 2000 tickets / 400 customers.
  Tools connected to the agent: 50 (this task needs 3).

   classic tool-calling    36,781 context tokens   (all schemas + raw data pass through)
   code mode                  222 context tokens   (3 signatures + one script + answer)
   ------------------------------------------------
   context reduction        99.4%

  Same result either way: [free: 720, pro: 596, enterprise: 684]

差距不是常数 —— 随工具数量和数据规模复合增长。

现实检验:精确数字来自上面的简单模型 —— 把它当作方向性参考而非基准。形态是真实的,并在生产环境中被测量过:Anthropic 的 Drive→Salesforce 任务从约 150k token 降到约 2k token,独立复现在 78% 到 99.9% 之间,取决于工具数量和数据规模。

为什么这是 2026 年的方向

已验证的部分:LLM 非常擅长写代码,而代码 API 是表达"做这五件事并组合结果"的一种密度高得多的方式,相比五次独立的 tool-call 往返。Anthropic、Cloudflare 和一项关于 MCP 设计选择的独立研究都汇聚到同一个发现 —— token 用量在工具数量上变得大致恒定,因为模型只读取它打开的东西。

走向:随着 Agent 连接到数百个 MCP 服务器,"预先加载所有内容"变得根本不可行,tool-calling 层将转移到计算机上。预计沙箱 —— 而不是 tool-calling —— 将成为默认的动作原语(action primitive),工具 schema 同步到文件系统并按需披露。

这个演示有多忠实?

这是一个极简模型,不是基准:"token"是 chars/4 的代理,"模型"写一个固定脚本,沙箱是一个受限的 exec。真实系统用 LLM 生成脚本并更激进地隔离它(gVisor、容器、V8 isolates)—— 这是该模式的主要成本:你现在要运行不受信任的、模型生成的代码,所以沙箱化和限制是强制的。不过 token 经济学的数字完全符合生产报告。

python3 demo.py   # standard library only

来源与延伸阅读

Wang et al. — From Tool Orchestration to Code Execution: A Study of MCP Design Choices (arXiv 2602.15945) — benchmarks the "context-decoupled execution model" and shows token use becomes roughly constant in tool count.

Anthropic — Code execution with MCP: building more efficient AI agents (the 150k → 2k token result)

Cloudflare — Code Mode: the better way to use MCP and give agents an entire API in 1,000 tokens (typed API from MCP schemas, executed in a V8 isolate)

Code Execution With MCP: Cut Tool Tokens up to 98% (independent reproductions across tool counts)

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
Agent上下文窗口即RAM:引入分页机制
下一篇
SparseSpec-L:无训练稀疏 KV 缓存让长上下文 LLM 推理提速 2.79 倍