前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
返回 AI 情报前线
All News · 全部资讯9258
  • 2026年AI编程工具横评:9款主流Harness对比与模型选配指南
  • LTX-2:首个DiT架构音视频生成模型开源
  • 33个生产Agent运行经验:记忆持久化模式总结
  • VLM+DOM Diff实现低误报的UI回归测试
  • 新模型来了?先用自己仓库的历史 commit 跑一遍
  • 廉价新模型上线前,我用 2 小时金丝雀测试决定要不要切
  • 免费模型评测后再付费:AI 编程任务的评估工作流
  • Meta 30B本地Agent模型Mac实测对比
  • 用测试套件自动分流免费/付费模型的工作流
  • Switchyard:Rust 编写的 LLM 流量代理,支持 OpenAI/Anthropic 协议互转
  • RAGFlow v0.4:开源 RAG 引擎支持 DeepSeek v4 与多渠道聊天
  • 廉价模型优先、失败时升级:构建可审计的双层 LLM 流水线
  • Vercel实习生直参生产:CDN、v0、AI Gateway实战复盘
  • DeepSeek-V4-Pro 正式版:Agent 能力大幅提升,支持三档思考强度
  • 2026年Claude Code最佳替代工具横评
  • DeepSeek-V4-Pro 正式版发布:Agent 能力大幅提升,支持 Responses API
  • AI编程工具选型:别比补全速度,比执行位置
  • AI代码审查风险分级路由:用强模型只审高危diff
  • DeepSeek V4 Pro正式版发布,多项对标Fable 5
  • 把AI Agent的模型路由策略放进Git:账单降了代码才动
  • 成本感知AI路由策略:按任务难度自动选免费或最强模型
  • 两周路由日志:终结选AI模型的玄学决策
  • 我用自己git历史评估每代新编程模型
  • LiteLLM供应链投毒致全球2500企业195TB数据泄露,含大量CI/CD密钥
  • AI编程的真正陷阱:需求描述不完整比代码Bug更危险
  • 自建LLM路由:用任务分类器把每类任务分配给最便宜模型
  • 本地演练LLM降级链路:别等故障时才暴露问题
  • 升级率作为不变式:别让廉价模型把贵价配额烧光
  • AI Agent 经济雏形:任务市场与自主协作
  • 60行纯Python实现多模型路由交换机
  • 别测最终答案:轨迹评估才是 Agent 质量真相
  • DeepSeek-V4-Pro 实测:非基准测试的业务场景表现
  • AI分析Agent应内置覆盖率账本,避免隐藏的 scope 扩展
  • 大 MCP 工具注册表如何避免撑爆 LLM 上下文
  • AI证明可验证了:OpenAI开源Lean 4形式化验证工作流
  • 150行Python手写AI Agent,无LangChain依赖
  • 免费编程模型的可重复烟雾测试方法
  • CI中免费AI模型会静默失败,先建熔断器
  • AI重新生成不是编辑,是赌博:需要明确编辑方向
  • AI 应用接入实时网络信息的 Web Search API 实战指南
  • Claude Sonnet 5 发布:性价比接近旗舰级
  • AI 代理队列需要背压而非更多 Worker
  • VS Code 1.133:Agent 窗口免登录可用 Claude,可中途切换模型
  • 2026 年大模型选型决策树:从 0.05 到 3000 美元/百万 Token
  • Grok 4.6 及 AI 队友功能发布
  • 客服Agent拒绝能力工程指南:置信度阈值决策设计
  • CoreWeave证实A100可出租至2029年,GPU寿命超预期
  • AI自动生成Dockerfile/K8s/GitHub Actions:部署规划Agent实战
  • 英伟达开源Nemotron 3.5 Lightning:30B MoE Agent执行层
  • 评估AI Agent的真相:轨迹评估才是关键
  • Tailscale 追查数据库损坏:根因是 SQLite 16 年旧 Bug
  • 已加载 51 / 9258
8.0
热点
AI SCORE
编程提效2026-08-13 11:39

成本感知AI路由策略:按任务难度自动选免费或最强模型

dev.to · AI#AI编程#成本优化#模型选择
Editor brief · 编辑速览

作者两周任务日志分析显示:机械转换类任务mid-tier模型几乎全能搞定;跨文件设计或疑难bug才需frontier模型。提供了可复用的路由决策脚本。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

在上一篇文章中,我搭建了一个用于探测 AI 编程助手实际能力边界的测试框架。本文要讨论的问题是紧接其后的:一旦你了解了某个助手能做什么,仍然需要决定由哪个模型来执行任务——把所有任务都扔给最贵的模型,是一笔悄悄流失的预算。

强大且便宜的模型不断推出,前沿模型在难题上的表现也持续提升。真正的问题不是"哪个模型最好",而是"我日常中的哪些任务真正需要最好的模型"。本文介绍我使用的路由方案,包含一个小型的、可直接复用的代码片段供你适配。

起始的观察

我记录了两周内自己使用助手辅助编程的任务,并对每个任务事后做了标注:这个任务是否真的需要深度推理,还是任何具备能力的模型都能完成?大致分布如下:

机械转换(重命名 + 修复 import、生成样板测试、转换配置格式):中档模型几乎每次都能成功。

本地推理(解释这个函数、找出这个测试为何 flaky):大多数时候中档模型也够用。

跨领域设计或隐蔽 bug(竞态条件、API 契约决策、涉及多个文件的重构):这是较弱模型产生"看起来对但实际错"输出的地方——审查它们花的时间比节省的时间还多。

所以优化目标不是模型质量,而是审查成本。机械任务上的错误答案很容易发现(测试套件会捕获它)。设计问题上的错误答案则很难发现(你就是那个测试套件)。

三层路由规则

我遵循的规则是:任务从最便宜的层级开始,只有在失败检测器是"人"的时候才升级。如果测试套件、类型检查器或 linter 能捕获一个错误的答案,就没有理由为此支付前沿模型的价格。

可复用的部分:预检分类器

不是在 prompt 时凭感觉做决定,而是先运行一个极简分类器。它故意做得很"笨"——用启发式规则,而不是 ML——因为我想让它可审计:

# route.py — 在把任务发给 agent 之前决定用哪一层
import re

TIER3_SIGNALS = [
    r"race|deadlock|concurren|async.*order",
    r"auth|token|secret|permission|inject",
    r"migrat|schema change|breaking",
    r"refactor.*(across|all|whole)",
]

def tier(task: str, files_touched: int, has_tests: bool) -> int:
    t = task.lower()
    if any(re.search(p, t) for p in TIER3_SIGNALS):
        return 3
    if files_touched > 3 and not has_tests:
        return 3          # 没有安全网 + 影响范围大
    if files_touched <= 1:
        return 2
    return 1 if has_tests else 2

if __name__ == "__main__":
    print(tier("rename getUser to fetchUser and fix imports", 6, True))   # 1
    print(tier("explain why this parser drops trailing commas", 1, True)) # 2
    print(tier("possible race in the retry logic", 2, True))              # 3

输入参数(files_touched、has_tests)来自任务脚手架——在我的场景中,agent 框架会在执行前报告这些数值。关键不在于具体的阈值,而在于路由决策是明确的、可记录的、可调整的。一周后你可以统计每层输出需要返工的比例,用真实数据收紧或放宽信号规则。

在这个架构中免费层的位置

第 1 层和第 2 层需要一个始终可用且零成本的模型,因为这是我日常流量最大的部分。披露:本文是 MonkeyCode 产品推广的一部分。我将第 1/2 层任务路由到 MonkeyCode,因为它提供免费模型访问和免费服务器选项,这与高流量、低风险层级正好对应——当路由器把一个样板生成任务下发时,我无需考虑每次调用的成本。第 3 层任务(审查成本占主导的那些)仍然发给我当前信赖的前沿模型处理设计工作;免费层不改变这部分决策。

关于免费层的一个诚实警告:预期会有波动。延迟、可用性以及提供的模型都可能会变化,所以路由器将免费端点视为默认选项而非保证——如果第 1 层任务失败或超时,它会重试一次,然后升级一层,而不是循环重试。

局限性,以及谁不应该这样做

分类器的好坏完全取决于它的信号规则。任何未被正则列表覆盖的内容默认落入较低层级。缓解措施是"失败时升级"的行为加上日志记录,但如果你跳过日志记录,就是在盲目飞行。

第 3 层误分类是代价最高的失败模式。一个并发 bug 被路由到弱模型,可能产生自信满满的废话。拿不准的时候,往上路由——表格的最后一列是需要保守对待的那个。

如果你的任务几乎全是第 3 层(安全关键系统、全新算法工作),路由不会为你节省任何成本,直接用最好的模型。

如果你无法机械地验证第 1 层输出(没有测试、没有 linter、没有类型检查器),整个前提就不成立。先把测试框架写好。

如果你想尝试这个方案,从日志记录开始:在路由之前,先手动标注一周的任务,了解你实际的任务层级分布,然后才自动化这个拆分。路由器是最简单的部分——了解你自己的工作负载才是真正有价值的产出。

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
把AI Agent的模型路由策略放进Git:账单降了代码才动
下一篇
两周路由日志:终结选AI模型的玄学决策