前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
返回 AI 情报前线
All News · 全部资讯9258
  • 6000+评论揭示:Cursor是AI编程安全问题最多的工具
  • 2026年AI编程工具横评:9款主流Harness对比与模型选配指南
  • LTX-2:首个DiT架构音视频生成模型开源
  • 33个生产Agent运行经验:记忆持久化模式总结
  • VLM+DOM Diff实现低误报的UI回归测试
  • 新模型来了?先用自己仓库的历史 commit 跑一遍
  • 廉价新模型上线前,我用 2 小时金丝雀测试决定要不要切
  • 免费模型评测后再付费:AI 编程任务的评估工作流
  • Meta 30B本地Agent模型Mac实测对比
  • 用测试套件自动分流免费/付费模型的工作流
  • Switchyard:Rust 编写的 LLM 流量代理,支持 OpenAI/Anthropic 协议互转
  • RAGFlow v0.4:开源 RAG 引擎支持 DeepSeek v4 与多渠道聊天
  • 廉价模型优先、失败时升级:构建可审计的双层 LLM 流水线
  • Vercel实习生直参生产:CDN、v0、AI Gateway实战复盘
  • DeepSeek-V4-Pro 正式版:Agent 能力大幅提升,支持三档思考强度
  • 2026年Claude Code最佳替代工具横评
  • DeepSeek-V4-Pro 正式版发布:Agent 能力大幅提升,支持 Responses API
  • AI编程工具选型:别比补全速度,比执行位置
  • AI代码审查风险分级路由:用强模型只审高危diff
  • DeepSeek V4 Pro正式版发布,多项对标Fable 5
  • 把AI Agent的模型路由策略放进Git:账单降了代码才动
  • 成本感知AI路由策略:按任务难度自动选免费或最强模型
  • 两周路由日志:终结选AI模型的玄学决策
  • 我用自己git历史评估每代新编程模型
  • LiteLLM供应链投毒致全球2500企业195TB数据泄露,含大量CI/CD密钥
  • AI编程的真正陷阱:需求描述不完整比代码Bug更危险
  • 自建LLM路由:用任务分类器把每类任务分配给最便宜模型
  • 本地演练LLM降级链路:别等故障时才暴露问题
  • 升级率作为不变式:别让廉价模型把贵价配额烧光
  • AI Agent 经济雏形:任务市场与自主协作
  • 60行纯Python实现多模型路由交换机
  • 别测最终答案:轨迹评估才是 Agent 质量真相
  • DeepSeek-V4-Pro 实测:非基准测试的业务场景表现
  • AI分析Agent应内置覆盖率账本,避免隐藏的 scope 扩展
  • 大 MCP 工具注册表如何避免撑爆 LLM 上下文
  • AI证明可验证了:OpenAI开源Lean 4形式化验证工作流
  • 150行Python手写AI Agent,无LangChain依赖
  • 免费编程模型的可重复烟雾测试方法
  • CI中免费AI模型会静默失败,先建熔断器
  • AI重新生成不是编辑,是赌博:需要明确编辑方向
  • AI 应用接入实时网络信息的 Web Search API 实战指南
  • Claude Sonnet 5 发布:性价比接近旗舰级
  • AI 代理队列需要背压而非更多 Worker
  • VS Code 1.133:Agent 窗口免登录可用 Claude,可中途切换模型
  • 2026 年大模型选型决策树:从 0.05 到 3000 美元/百万 Token
  • Grok 4.6 及 AI 队友功能发布
  • 客服Agent拒绝能力工程指南:置信度阈值决策设计
  • CoreWeave证实A100可出租至2029年,GPU寿命超预期
  • AI自动生成Dockerfile/K8s/GitHub Actions:部署规划Agent实战
  • 英伟达开源Nemotron 3.5 Lightning:30B MoE Agent执行层
  • 评估AI Agent的真相:轨迹评估才是关键
  • 已加载 51 / 9258
8.0
热点
AI SCORE
编程提效2026-08-13 11:48

把AI Agent的模型路由策略放进Git:账单降了代码才动

dev.to · AI#AI Agent#成本优化#工程实践
Editor brief · 编辑速览

作者发现未托管的Agent把大部分预算花在生成文档级任务上,而真正复杂的bug反而被分配了同样模型;将路由规则JSON化并入Git,实现可审查、可回滚的模型选择策略。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

让一个编码 Agent 无人值守地处理积压任务,两周后 provider 的账单告诉了我日志里没有的信息:Agent 把大部分预算花在了前沿模型上,做的工作不过是重新生成文档字符串、提升固定依赖版本、整理 import 顺序。而它真正接触到的唯一一个有点难度的 bug——队列消费者里的时间顺序问题——却和文档字符串用了同一个模型,同一套浅层重试策略,最终交付的补丁我在四天后 revert 了。

这种反转才是真正的问题。不是"模型太贵",而是:无人值守的 Agent 每次调用都在做消费决策,而默认决策永远是一样的。

上一篇文章论证了 Agent 权限应该纳入版本控制。把同样的思路套用到模型选择上就是:路由是策略,策略应该是文件,文件应该在 git 里可审查。以下是我现在运行的配置,用占位符代替模型标识符——catalog 变化太快,我今天写的任何名称到你读到这篇文章时都可能已经失效了。

与其把层级埋在代码里,路由规则存在于一个 JSON 文档中,它是可 diff 的、可审查的、可回滚的:

{
  "tiers": [
    {
      "name": "gratis",
      "models": ["<free-tier-model-id>"],
      "accept_when": {
        "any_of": ["single-file edit", "no logic change", "docs or comments", "version bump"]
      }
    },
    {
      "name": "standard",
      "models": ["<mid-tier-model-id>"],
      "accept_when": {
        "any_of": ["multi-file edit", "new test", "isolated function change"]
      }
    },
    {
      "name": "heavy",
      "models": ["<top-tier-model-id>"],
      "accept_when": {
        "any_of": ["concurrency", "data migration", "public API change", "touches auth or crypto"]
      }
    }
  ],
  "escalation": {
    "attempts_per_tier": 1,
    "on_exhaustion": "open_issue_for_human"
  },
  "gate": {
    "command": ["make", "verify"],
    "timeout_seconds": 900
  }
}

三个设计选择完成了安全相关的工作,它们和选什么模型完全无关:

gate 是 make verify,就这么多。一条补丁只有在该仓库真实的测试套件、linter 和类型检查器全部通过后才能推进。不存在模型去评估另一个模型输出这回事——那样的话便宜层级就会给自己的错误盖橡皮图章。

escalation 有上限。每个层级一次尝试机会,然后任务变成一个 GitHub issue,附带失败记录。没有上限的重试循环不过是更慢地抵达贵价模型的方式。

默认方向是向下,不是向上。如果分类器不确定,任务从低层级开始,通过 gate 向上失败,而不是从高层级开始然后永远发现不了任务其实很简单。

消费这个配置的 runner 就是无聊的管道代码——读策略、分类任务形状、调用 provider、跑 gate、escalate——大概 120 行。策略文件才是值得保留的 artifact,因为这是你审查、diff 和 blame 的东西。

用影子模式验证,而不是靠感觉

危险的时刻不是写策略,而是信任它。所以在任何一个任务真正经过便宜层级路由之前,我会用影子模式跑分类器:它给每个进入的任务打标签,记录它本来会怎么做,而 Agent 照常用强模型。一周的真实流量之后,回放日志然后问:

只有影子数据看起来合理之后,我才让低层级根据自己的标签行动——而且只针对影子记录干净的任务形状。无论日志看起来多好,concurrency-and-auth 类别永远不会从顶级毕业。

还有一个纪律:每当你在一个层级里换入或换出一个模型时,重新跑一遍验证。同一个模型 ID 在 provider 端更新后行为可能不同,上个月可靠的中间层级公民可能悄悄变成这个月 revert 补丁的来源。

为什么最底层免费能改变算术

如果最便宜的层级每次调用都要花钱,那么对于小规模工作负载来说路由开销可能不值。但如果它不花钱,经济账就翻转了:整个系统的期望成本收敛到真正需要强模型的那小部分任务上。

我通过 MonkeyCode 运行这个,它提供免费模型访问和免费服务器选项——所以路由过程本身和最底层执行都不挂表。披露:本文是 MonkeyCode 产品推广的一部分。无论 provider 是谁,有两个注意事项我都会坚持:我没有验证你读到这篇文章时哪些模型在免费层级——拉取实时模型列表而不是信任任何文章,包括这篇——而且任何免费层级都可能改变限额或消失。上面的设计已经能容忍这种情况:一个已死的免费模型会从它的层级报错并 escalates,这正是有界 escalation 规则的作用。

哪里会出问题

测试套件薄弱,免谈。整个方案建立在机械 gate 之上。如果 make verify 抓不住坏掉的补丁,便宜层级就会愉快地放行垃圾。先加强测试套件——这甚至在你从来不路由任何东西的情况下也值得。

分类器是脆弱的部分。任务形状启发式天然粗糙。影子模式的存在正是因为我不够信任它;如果你有足够的标注历史,对过去任务做相似性搜索比关键词匹配更好,但那是一个后续优化,不是前置条件。

交互延迟。穿越层级会增加往返。开发者盯着自动补全不应该等过一整个 escalation 链——保持交互路径单一模型。

安全关键和深度专业化的代码。如果你的领域里没有"琐碎"任务——内核工作、医疗、形式化方法——删除策略文件底部两行,所有事情从顶层开始。

如果你在真实仓库上影子测试过路由策略,我真的很想知道你的误标率是什么样的——尤其是哪些任务形状骗过了分类器。我的分类器一直被版本号更新骗到,结果发现那是 breaking change,我还没找到一个干净的信号来识别它们。

思维导图

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
DeepSeek V4 Pro正式版发布,多项对标Fable 5
下一篇
成本感知AI路由策略:按任务难度自动选免费或最强模型