先记住这个答案
路由模型应选参数量远小于被路由目标的小模型,利用其输出 logits 做确定性分类而非长文本生成,并将路由结果按输入签名缓存。同时监控路由延迟和准确率,当路由模型抖动或超时,直接回退到默认大模型。
- 路由模型优先选小模型,避免大模型开销
- 路由结果按输入哈希缓存,命中省去模型推理
- 设置路由超时与失败回退,保障服务SLO
路由模型的延迟成本构成与压缩机制
路由模型本身的前向传播产生延迟和算力成本。若采用与目标模型同等量级的生成式模型,则路由开销可能接近直接推理,不划算。更合理的是使用小型分类模型(如 <1B)或基于嵌入的线性分类器,将请求分类为简单/复杂,路由到不同规模的目标模型。
延迟控制还可以利用路由结果的缓存:对请求内容做规范化后计算哈希作为键,缓存路由决策。在业务重复模式多的场景下,缓存命中率预计可达70%以上,此时路由增加的平均延迟趋近于哈希查询。缓存需设置TTL应对数据分布漂移。
电商客服系统路由分类实践
假设一个电商客服系统,每日请求20万次。若全部路由到旗舰模型,单次成本0.02美元;改用70%走小模型(成本0.005,延迟低),30%走旗舰模型。引入一个假设的2亿参数路由分类器,每次推理约5ms,成本0.0001美元。在缓存命中率较高的假设下,加缓存后实际路由开销几乎可忽略。
实施中先用历史日志微调分类器,并设置路由阈值:当分类置信度低于0.7时直接走旗舰模型。按上述假设条件推算,整体成本预计下降约45%,平均响应延迟预计从1.2秒降至0.8秒,P99延迟略升。
路由模型策略的失效边界
当输入内容分布快速变化,如出现新促销活动、新政策时,缓存命中率会骤降,路由分类准确率也可能下跌。此时路由模型可能把复杂请求误判为简单,影响回答质量。需建立维度监控准确率下降触发自动回退。
缓解措施是定期用小批量人工评估校准分类器,并在新事件初期临时提高置信度阈值。同时路由模型自身故障也需处理:设置超时(如200ms),超时则立即转默认大模型,避免请求阻塞。
容易答错的地方
- 路由模型越大越准
- 认为必须用旗舰模型才能分类准确。实际上路由分类任务通常只需区分意图或复杂度,小型微调模型在数据充分且任务适配时往往能达到95%以上的准确率(需结合实际任务评估),且延迟和成本显著低。
- 忽略缓存过期策略
- 路由结果缓存长期不失效会导致样本偏差累积,用户请求模式变化后分类错误增多。需要设置合理过期时间(如小时级)并主动监控命中率,及时调整。
面试官还会怎么问?
如何评估路由分类器的准确率对整体业务的影响?
关注误分类引发的端到端质量差异。可定义离线指标如路由一致性(对同语义的不同表达应得同结果),在线可用A/B测试观测用户满意度、错误反馈率等。
路由模型自身成本如何纳入总成本模型?
按每请求计算:路由推理成本+被路由模型的预期成本(按路由概率加权)。可设定一个合理占比阈值(例如5%)作为优化触发点,具体阈值需结合业务收益评估后确定。
当路由模型不可用时,降级策略应如何设计?
最简单是直接回退到高能力模型,保证服务质量但成本上升。也可本地缓存最近路由决策或使用规则兜底,但需保证可靠性。
参考资料
示例用于理解所注明的运行环境与边界;延伸学习可结合原文中的更多案例。