过去一年,Token 单价持续下探,但 AI 预算并未同步下降。原因不只在模型价格,而在 Agent 把一次问答扩展成多轮推理、上下文重载、工具调用和自动执行。2026 年 8 月 13 日的多条信号指向同一结论:模型能力仍在快速商品化,真正决定交付质量、成本和安全性的,正从“选哪个模型”转向“如何设计 Agent 的运行环境”。本文将从成本边界、工程护栏、工作流分层和模型路由四个角度,给出程序员与技术管理者可直接验证的实践方案。
今日主线

主线一:Token 更便宜,Agent 总成本却可能更高
信号:单位推理价格下降,并不等于单任务成本下降。
一份关于 AI 成本的实践复盘指出,2023 年以来 Token 价格下降约 90%,企业 AI 支出却增长约 320%。作者把它归因于 Jevons 悖论:资源效率提升后,新应用变得可行,最终需求增长超过单位成本下降。Token 降价 90% 但 AI 账单没降
Agent 正在放大这一效应。普通聊天通常是一次输入、一次输出;Agent 则要反复执行“思考—行动—观察—修正”。如果每一轮都重新发送已有历史,上下文会不断膨胀。运行步数从 10 增加到 20,最坏情况下的输入消耗并非简单翻倍,而可能接近平方增长。AI Agent 反模式:无限循环问题
模型路由也可能制造隐藏成本。英伟达 Nemotron 3.5 Lightning 的相关讨论指出,智能路由器倾向于为每次请求选择“最合适的模型”,但频繁切换模型可能破坏 Prompt 缓存:已经积累的长上下文无法复用,需要重新支付 prefill 成本。Nemotron 3.5 Lightning 与模型路由争议
工程影响:成本指标必须从“每百万 Token 单价”升级为“每个成功任务的总成本”。
只看 API 单价,会漏掉四个乘数:
- Agent 平均运行步数与长尾步数;
- 每轮重复装载的上下文;
- 推理模型在简单任务上的隐藏思考消耗;
- 路由切换造成的缓存失效。
这也解释了为什么更便宜的模型不一定降低月账单。若低价促使团队把更多流程改造成 Agent,并放宽步数、上下文和重试策略,总成本仍可能上升。
**行动与验证:**以任务为单位记录输入、输出、缓存命中、工具调用、重试次数和最终产物状态。重点看 p50、p95、p99 单任务成本,以及“达到步数上限的任务占比”。若调用均价下降而单任务 p95 成本上涨,优化重点应放在上下文裁剪、终止条件和任务拆分,而不是继续议价。
反方边界也要说清楚:Jevons 悖论描述的是需求扩张倾向,不意味着每个项目都会增支。任务量固定、上下文稳定、无自主循环的批处理系统,仍能直接受益于降价。需要警惕的是把“调用便宜了”误认为“Agent 架构无需预算边界”。
主线二:模型能力商品化,Harness 正成为真正的工程差异
信号:模型排行榜没有统一赢家,但运行环境能显著改变结果。
三款同期旗舰模型的横向评测显示,Claude Opus 5 在 SWE-bench Pro 和全新推理任务上领先;GPT-5.6 Sol 在 Terminal-Bench 与长周期工程任务上占优;Kimi K3 则以开放权重和低价形成差异化。没有一个模型在编程、工具调用、成本和部署自由度上全面获胜。Opus 5、GPT-5.6 Sol 与 Kimi K3 编程实测
与此同时,Harness Engineering 的实践强调,AI 编程助手反复犯错、跨会话质量波动,往往不是模型突然“变笨”,而是项目约束、架构文档、测试入口和观测信息没有稳定提供给 Agent。材料中引用的案例显示,仅调整 Harness、未更换模型,也能显著提高 Terminal-Bench 表现。Harness Engineering:打造 AI 编程助手的工作环境
DeepSeek V4 Pro 的正式版进一步强化了这个趋势:除了模型本身升级,更重要的是原生兼容 OpenAI Responses API、适配 Codex,并提供 low、high、max 三档思考强度。接口兼容与运行时控制,让团队能够在不重写整套业务逻辑的情况下进行模型替换和任务分级。DeepSeek V4 Pro 更新说明
工程影响:模型选型不应只做一次排行榜决策,而应建立可替换、可分级的执行层。
简单修改、格式转换和确定性脚本生成,可以使用低成本或低思考档位;跨文件重构、复杂调试和长周期终端任务,再切换到高能力模型。模型路由的依据应是任务风险、上下文规模和预期价值,而不是“所有请求默认使用最强模型”。
Harness 至少要提供四类信息:当前架构约束、可执行的验证命令、权限边界、失败后的停止与回滚规则。模型可以替换,项目事实和验收标准不能漂移。
**行动与验证:**选择 20—50 个团队真实任务建立内部评测集,同时记录成功率、人工返工时间、单任务成本和架构违规次数。模型升级时重跑同一批任务;Harness 修改时也重跑。只有这样才能区分收益来自模型,还是来自更完整的上下文与工具环境。
这里的边界是:公开 Benchmark 可以帮助缩小候选范围,却不能替代内部评测。不同模型在真实代码修复、终端操作和前端生成上的强项不同;而素材中的部分对比来自二次整理,未覆盖统一版本、统一 Harness 和统一预算,不能据此宣布绝对排名。
主线三:Agent 安全问题已从“幻觉”升级为权限与供应链问题
信号:真正危险的不是答错,而是答错后拥有执行权。
MCP 规范允许服务器不实现授权。一项材料引用的测量结果称,7,973 个在线远程 MCP 服务器中,40.55% 暴露的工具没有认证。符合规范不等于适合生产环境;客户端也未必能直观看出远程工具是否实施了调用者身份校验。MCP 服务器认证是可选项
另一条更严重的行业信号来自 LiteLLM 供应链事件。报道援引安全公司披露的数据称,受感染版本在约 40 分钟的攻击窗口内抓取并外传凭据,泄露内容包括云密钥、代码仓库 Token、SSH 密钥、Kubernetes 密钥、软件包发布凭据和 CI/CD 凭据。LiteLLM 供应链投毒事件
真实用户反馈也指向权限边界。约克大学与卡尔加里大学研究团队分析了数千条相关帖子与评论,发现 AI 编程工具的典型问题包括覆盖文件、删除数据、未经授权访问,以及第三方工具集成风险。6000+ 评论揭示 AI 编程安全问题
工程影响:Agent 风险取决于“模型错误概率 × 可用权限 × 可达资产”。
只优化提示词无法解决这个乘法问题。即使模型错误率很低,只要它能读取宿主机密钥、写生产数据库、调用无认证 MCP 工具,单次异常的爆炸半径仍然不可接受。
本地沙箱工具 miniVE 给出了一种工程思路:将 Agent 放入一次性容器,只挂载工作目录,不暴露宿主机文件系统、SSH 密钥和真实 .env。miniVE:让 AI 编码代理在本地沙箱中运行
**行动与验证:**默认拒绝生产写权限;凭据使用短期、最小权限版本;远程 MCP 接入前验证认证、授权和审计日志;Agent 在隔离环境运行;高风险操作只生成计划或补丁,不直接执行。
需要避免另一个极端:沙箱并不自动等于安全。若容器挂载了宿主机 Docker Socket、SSH 目录或生产凭据,隔离形同虚设;若允许任意网络外连,敏感代码仍可能被上传。安全验证必须检查实际挂载、网络策略和密钥注入方式。
AI 编程与工程实践

AI 编程当前最容易误判的指标,是“测试通过”。
一段代码可以编译成功、测试全绿、功能可用,却仍然违反当前架构。例如系统已从“API—Service—Database”演进为事件驱动架构,Agent 若继续沿用旧模式直接调用数据库,局部功能可能完全正确,整体决策却已经过期。AI 编程 Agent 通过测试也可能做出错误架构决策
数据库迁移更能说明“语法正确”和“生产安全”的差距。为字段增加唯一约束的 SQL 可能完全合法,但在大表上执行时会获取高等级锁并扫描数据,造成 API 超时和连接池堆积。相关实测比较显示,直接变更与分阶段验证方案最终得到相同 Schema,锁持有时间和 p99 延迟却可能相差数个数量级。AI Coding Agent 写出的 Postgres 迁移为何会锁表
因此,代码评审不能只问“测试是否通过”,还要问:
- 是否遵守当前架构版本和依赖方向;
- 是否引入新的高权限路径;
- DDL 会获取什么锁、持续多久;
- 回滚是否真的可执行;
- Agent 使用的项目文档是否仍然有效。
这也是 AGENTS.md、架构决策记录和迁移规范的价值:它们不是写给模型看的装饰文档,而是可版本化的工程约束。更进一步,应当让 CI 检查这些约束,例如禁止特定层直接访问数据库、对高风险 DDL 运行静态检查、验证架构文档链接和更新时间。
不过,规则越多并非越好。过长的项目说明会在每轮 Agent 循环中反复计费,也可能把真正重要的限制淹没。更合理的方式是分层加载:全局只保留不可违反的边界,任务相关规范按目录和文件类型按需注入。
AI 办公与生产力
今天最有迁移价值的生产力案例,不是“让 Agent 替人写文案”,而是把工作分成可自治和必须审批的两层。
一套开源项目营销系统使用 PLAYBOOK.md 保存语气规则与护栏,用 routines/ 管理不同任务的提示词,用 state/ 在例程之间传递状态,再通过定时任务运行指标统计、仓库 SEO、内容生成和机会发现。作者没有追求所有渠道全自动:自有或低风险渠道可自动发布,Hacker News、Reddit、X 等社区渠道只生成草稿,由人工完成最终批准。我的 Agent 替我做营销
这里的关键不是营销,而是工作流分级:
- 可逆、可审计、规则明确的任务允许自动执行;
- 涉及声誉、外部沟通或不可逆操作的任务停在草稿状态;
- 人工审批不负责重新生产内容,只负责判断是否放行。
这套模式可以直接迁移到技术团队的 AI 办公提效:周报整理、变更日志、文档索引和指标汇总可以自动化;客户邮件、事故公告、生产发布和社区回应保留人工确认。审批摩擦并不一定是效率损失,它可能正是风险控制产生价值的位置。
VS Code 1.133 支持在会话中切换模型提供商,也说明办公与开发环境正在从单一模型入口变成多模型工作台。VS Code 1.133 Agent 窗口更新 但切换便利不应导致任务上下文无节制复制。团队仍需记录每类任务使用的模型、成本和质量,否则“多模型自由”很快会变成不可解释的账单与结果波动。
值得关注的产品与行业变化
DeepSeek V4 Pro 正式版已上线 App、网页端和 API,增强 Agent 能力,支持 Responses API,并针对 Codex 适配;其思考模式提供 low、high、max 三档控制。官方还宣布自 8 月 17 日起采用峰谷定价,闲时价格为高峰时段的一半。DeepSeek V4 Pro 官方更新
对工程团队而言,最值得关注的不是又多了一个模型,而是两个可操作变化:OpenAI Responses API 兼容降低迁移成本,峰谷定价使非实时任务调度成为成本优化手段。离线评测、批量文档处理、夜间代码分析可以考虑转移到闲时,但线上交互不应为了价格牺牲延迟目标。
阿里开放 Qwen3.8-2.4T-A95B 权重,模型总参数 2.4T、每个 Token 激活 95B,原生支持 262,144 Token 上下文并可扩展至约 101 万 Token。阿里开源 Qwen3.8 长上下文和开放权重扩大了私有部署与复杂工作区处理的空间,但“能装下一百万 Token”不代表“应该装满”。上下文越长,检索噪声、prefill 成本和缓存策略越重要,必须用任务成功率而不是窗口大小评价价值。
GitHub Copilot 发布的 Agent Plugins 1.0 则把技能与 MCP 服务器打包为跨客户端插件,目标是一次开发,在 VS Code、Copilot CLI 和 Copilot App 等兼容客户端使用。Agent Plugins 1.0 这是插件生态标准化的重要信号,也会同步扩大供应链攻击面。插件清单统一之后,签名、来源治理、版本锁定和组织级白名单必须跟上。
至于 SSI 持续学习模型、自进化 Agent 等方向,目前更适合视为待验证假设。素材显示 SSI 的相关信息主要来自爆料,并非完整正式发布;自修改 Harness 虽然展示了诱人案例,但在权限漂移、错误积累和可审计性上仍有明显挑战。SSI 首模型与持续学习方向 在复现数据、长期稳定性和安全机制公开之前,不宜直接把“自进化”写入关键生产链路。
程序员今天可以做什么

下面六项都能独立验证,无需先重构整套系统。
-
为 Agent 增加三重停止条件
适用对象:运行工具循环、浏览器任务或 Coding Agent 的团队。预期收益:压低失控任务的长尾成本。风险:限制过紧会提前终止复杂任务。验证指标:p99 步数、触顶率、重复工具调用率、无产物结束率。至少同时设置最大步数、最大金额或 Token、最长运行时间,并检测相同工具参数连续重复。 -
把成本口径改成“每个成功任务”
适用对象:已有模型调用监控的平台团队。预期收益:识别上下文重载、重试和缓存失效造成的假性降价。风险:任务成功定义不清会污染数据。验证指标:成功任务成本 p50/p95、缓存命中率、人工返工分钟数。先选一个边界清晰的任务做两周基线。 -
将简单任务和复杂任务分级路由
适用对象:同时使用多个模型或支持思考强度控制的团队。预期收益:减少昂贵模型处理变量改名、格式转换等低风险任务。风险:错误分类会降低质量,频繁切换还可能损害缓存。验证指标:分级后的成功率、升级重试率、缓存命中率和单位任务成本。 -
把 Agent 移入最小权限沙箱
适用对象:允许 Agent 执行 Shell、安装依赖或修改多文件的开发者。预期收益:缩小误删文件和凭据泄露的爆炸半径。风险:错误挂载 Docker Socket、SSH 目录或.env会让隔离失效。验证指标:宿主机敏感目录不可见、默认无生产凭据、销毁环境后无残留、网络外连符合白名单。 -
为数据库迁移建立锁级别审查
适用对象:使用 PostgreSQL 且允许 AI 生成迁移的后端与全栈团队。预期收益:减少“测试通过、上线锁表”的事故。风险:静态规则无法覆盖所有数据规模与并发条件。验证指标:预演环境锁等待、迁移期间查询 p99、排他锁持续时间、回滚耗时。高风险 DDL 必须在接近生产数据量的环境演练。 -
按可逆性划分自动执行和人工审批
适用对象:自动生成文档、发布内容、回复工单或执行运维动作的团队。预期收益:保留大部分 AI 办公提效,同时控制声誉与生产风险。风险:审批队列可能成为新瓶颈。验证指标:自动完成率、审批平均耗时、驳回率、误发布次数。可逆且低风险的任务自动执行,不可逆或对外任务默认停在草稿状态。
趋势判断
**已发生的事实是:**旗舰模型密集发布,开放权重继续逼近闭源能力;Responses API、跨客户端插件和会话内模型切换正在降低供应商切换成本;Agent 已经深入终端、文件系统、数据库和外部社区。
**本文的编辑判断是:**未来半年,AI 编程竞争的焦点将从模型榜单转向 Harness、权限隔离、上下文管理和任务级经济性。模型仍然重要,但它更像可替换的执行引擎。真正形成团队复利的,是可版本化的项目规则、内部评测集、审计轨迹和稳定的验收机制。
**待验证的假设是:**持续学习、自修改 Harness 和多 Agent 路由可能进一步提高长周期任务完成率,但也可能引入错误累积、缓存失效、权限漂移和不可复现决策。判断这类架构是否成熟,不能只看单次演示,应至少观察长期任务成功率、单位任务成本、回滚能力和安全事件率。
对程序员来说,今天最重要的 AI 热点不是“哪个模型又赢了几个百分点”,而是 Agent 已经获得了真实行动能力。模型犯错并不新鲜;新问题是,它犯错时能改多少文件、花多少钱、调用哪些工具,以及团队能否及时停止它。
参考
- DeepSeek API Docs:DeepSeek V4 Pro 更新说明
- GitHub Copilot Changelog:Agent Plugins 1.0
- Token 降价 90% 但 AI 账单没降
- AI Agent 反模式:无限循环问题
- Harness Engineering:打造 AI 编程助手的工作环境
- MCP 服务器认证是可选项
- miniVE:让 AI 编码代理在本地沙箱中运行
- AI Coding Agent 写出的 Postgres 迁移为何会锁表
- AI 编程 Agent 通过测试也可能做出错误架构决策
- 我的 Agent 替我做营销
- 阿里开源 Qwen3.8
- LiteLLM 供应链投毒事件