通过将简单查询路由到廉价模型、复杂证明升级到best-of-3中间层、根据置信度提前终止的策略,在NVIDIA NIM上实现账单从$0.186降至$0.04。
并非每个问题都值得动用最贵的模型。把所有查询都发给前沿层简单粗暴但代价惊人——一次简单查找和一次严谨证明耗费相同。Agentic AI from Zero 的第七个项目构建了一个路由器,它以最低成本完成任务:简单查找发给一次便宜调用,复杂证明发给最佳-of-3,廉价答案一旦置信就提前退出,超预算就降级而非爆掉。在一次针对 NVIDIA NIM 的真实六次查询运行中,成本为 $0.039971,而非 $0.185790——节省了 78.5%,有实测为证。
按难度路由,而非按模型名。三个层级,每个都有公开的 $/1k 价格,其中 escalate 比 direct 贵约 60 倍——这正是路由的价值所在:
PRICE_TABLE = { # cheapest → dearest
"direct": Tier("direct", 0.0005, 1, "one terse call — a cheap model"),
"cot": Tier("cot", 0.0030, 1, "one call that reasons step-by-step"),
"escalate": Tier("escalate", 0.0300, 3, "best-of-3, priced like a frontier model"),
}
LADDER = ["direct", "cot", "escalate"]
EARLY_EXIT_CONFIDENCE = 0.75
免费分类,然后路由
一个廉价的关键词启发式方法——无需 API 调用,$0 成本——给每个查询打 trivial / medium / hard 分,并映射到入口层级(direct / cot / escalate)。模型从不自行选择层级。
路由循环:分类 → 预算 → 运行 → 门控
整个策略是确定性 Python 代码。先分类,如果预算承担不起想要的层级就往下走一级,运行真实调用,检查置信度门控——置信就提前退出,不确定且预算允许则只升一级:
comp = classify_complexity(query) # $0, deterministic
want = entry_tier(comp.label)
tier = budget.best_affordable_at_or_below(want, query) # step DOWN if too dear
if tier is None: return refused # can't afford even `direct`
degraded = tier != want # forced cheaper than we wanted
while True:
att = self._run_tier(query, tier) # a REAL NIM call (usage → $)
if att.confidence >= EARLY_EXIT_CONFIDENCE: # confident enough?
early_exit = tier != "escalate" and not degraded; break # STOP — don't pay more
nxt = next_tier(tier)
if nxt is None: break # already at the top
if not budget.affords(spent_c, spent_t, estimate_cost(query, nxt), ...):
degraded = True; break # DEGRADE — budget says no
tier = nxt # escalate one step
职责分离才是关键:模型只负责回答、推理、自我评分置信度。它不选择层级、不设预算、不决定提前退出、不计算价格。当 escalate 运行 best-of-N 时,连选择过程都是确定性的——模型提出 N 个多样样本,Python 保留最置信的那个。
一次运行演示的四件事
Token 预算——每个查询都带硬性 $ 上限;查询 5 的紧张 $0.0040 预算阻止了它想要的 escalate,所以降级到 CoT 而不是超支。
按复杂度 + 成本路由——启发式方法对每个查询打分并映射,无需 API 调用。
基于置信度的提前退出——6 个查询中有 3 个在廉价层级就停了,因为自我评分的置信度超过了 0.75;路由器从未为它们支付 escalate 费用。
每次决策的成本分析——账本根据真实使用 token 为每个查询计价,并与测量的基线对比报告节省额:前沿层级实际在所有六个查询上都跑过,所以"节省 78.5%"是测量结果而非说法。
还留下一个诚实的失误:关于"17 只羊,除了 9 只都跑了"的谜语,模型回答 8(正确答案是 9)且自我评分 1.00,所以路由器在一个置信但错误的廉价答案上提前退出了。基于置信度的提前退出用小小的质量风险换取大大的成本节省,这完全取决于模型的自我校准——这正是为什么预算和审计账本都放在模型无法移动的代码里。
逐步走一遍真实路由流水线,看看成本账本和测量基线,在这里获取仓库:https://dev48v.infy.uk/agentic/project7-cost-router.html
下一篇,Project 8:一个事件触发的自动化 Agent。