Google DeepMind 提出新路由策略,将模型选择的计算开销从 1.986 大幅降至 0.075,核心是根据价值动态决定是否支付昂贵的估算成本。
Google DeepMind 的 Pandora's Router 将路由问题框架为潘多拉魔盒问题,在 EmbedLLM 上将检查成本降至 0.075。该方法只在价值超过成本时才为昂贵的估算付费。
Google DeepMind 的 Pandora's Router 在 arXiv 论文 2608.20316 中有详细描述,在 EmbedLLM 上将路由检查成本从 1.986 降至 0.075。该方法将模型选择框架为潘多拉魔盒问题,只在预期价值证明成本合理时才为昂贵的估算付费。
EmbedLLM 检查成本:0.075 vs 1.986(始终昂贵)
EmbedLLM 路由遗憾度:0.311, from 0.370
arXiv 论文 2608.20316:'Pandora's AI Model Routing Box'
在 MATH、RAG 和 EmbedLLM 基准上评估
在所有测试成本设置下, combined regret 和成本最低或并列最低
Google DeepMind 的新路由方法,详细见 arXiv 预印本 "Pandora's AI Model Routing Box: Efficient Allocation with Costly Value Estimation"(arXiv:2608.20316),解决了一个实际低效问题:路由本应节省计算资源,但决定路由本身也可能消耗计算资源。According to @rohanpaul_ai,该论文主张只在更好的决策值得额外成本时才在模型选择上投入更多。
该方法将决策框架为潘多拉魔盒问题。每个专家首先获得一个廉价但有噪声的分数。路由器只在额外信息的预期价值高于其成本时才为更强的估算付费。这通过将检查成本变为一个显式、可调的变量而非固定开销,改变了路由的经济性。
在 MATH、RAG 和 EmbedLLM 上,Pandora's Router 在所有测试成本设置下平均拥有最低或并列最低的路由遗憾度和检查成本组合。在 EmbedLLM 上,路由目标超过 100 个时,其平均检查成本为 0.075,而始终运行昂贵估算器的成本为 1.986,同时路由遗憾度也从 0.370 降至 0.311。作者在摘要中未披露具体成本设置或完整消融细节。
这一贡献不仅仅是又一次准确率提升。在生产环境中,路由开销会吞噬跳过大模型带来的节省。之前的工作(如 Mixtral 的稀疏 MoE)假设固定的路由成本;Pandora's Router 将路由器本身的计算资源作为一等公民。EmbedLLM 上 26 倍的检查成本降低,是一个让路由在大规模场景下是否可行的关键数字。
DeepMind's Pandora's Router frames routing as a Pandora's Box problem, cutting inspection cost to 0.075 on EmbedLLM.
The method pays for expensive estimates only when value exceeds cost.

关注该论文完整的消融结果,特别是如何实际设置成本阈值,以及该方法是否能扩展到超过 100 个路由目标。还要关注 DeepMind 是否会发布代码或将 Pandora's Router 集成到生产系统中,这将标志着该预印本之外的实际应用。
Originally published on gentic.news