市面上各种LLM路由层声称能省60%成本,但从不公开评估集和评分细节。文章开源了OmnisBench基准工具,让开发者自行验证路由效果与成本节省的真实性。
每隔几周,同样的帖子就会在圈子里转一轮。某人的路由层把 LLM 账单砍了 60%,"质量没有丝毫下降",还附上一张漂亮的图表来证明。
除了它什么都证明不了。评测集是私有的。评分方式是私有的。产生那个分数的实际模型回复从不公开。他们只是让你相信一张截图,而我们在这个行业待得足够久,大致知道一张截图值多少钱。
所以我们做了那个缺失的东西。它叫 OmnisBench,是开源的(Apache 2.0),它的全部职责就是以一种你可以自己去验证的方式,衡量 LLM 路由实际上有多好。
如果你还没深入其中:LLM 路由器会查看每个请求,然后把它发送到能够完成任务的、最便宜的模型,而不是把所有请求都丢给一个昂贵的前沿模型。简单的 prompt 丢给小型模型。难的任务丢给大模型。理论上,你保留了大部分质量,但只付了账单的一小部分。
这是理论。OmnisBench 衡量的是实践。
我们最关心的数字是所谓的 oracle。对于每个任务,oracle 选出实际把它做对的、最便宜的模型。我们知道哪些做对了,因为我们把它们都跑了一遍。这不是一个你可以上线的路由器。这是天花板。这是任何路由器在给定任务集上可能做到的最好成绩,它告诉你,在任何人开始吹牛之前,真正能省多少钱。
我们在 364 个任务上跑了它:HumanEval(164 道编程题,由它们自己的单元测试评分)和 GSM8K(200 道数学题,按答案评分)。模型池是 Claude Opus 5、GPT-5、Claude Haiku 4.5 和 GPT-5-nano。
结果如下。
所以标题自己会写。理想路由达到了 99.7% 的成功率,但成本大约只有发往顶级模型的 10%。非常好。
现在让我来给你泼点冷水。
在那大多数 60% 图表里,你不会看到两个东西。
第一,oracle 是天花板,不是产品。它作弊了。它事后知道哪个模型把哪个任务做对了,而没有任何在线路由器有这种奢侈。真正可部署的路由器得分如何,在于它有多接近那条 oracle 线,而差距才是有意思的部分。任何把 oracle 风格数字当作自家产品来报价的人,卖给你的就是天花板。
第二,这个让我们比较意外:最便宜的模型单独跑已经得了 94.5%。在这组特定任务上,GPT-5-nano 就是 quietly good。所以路由不是在给你买一个神奇的 60%。它是在不买全部前沿模型价格的前提下,买到最后的几点质量。这仍然非常值得拥有。只是它不是童话故事。
我们宁愿提前告诉你这些,也不愿让你在把那个亮眼的数字汇报给老板之后才发现真相。
这才是 OmnisBench 存在的全部原因。它不要求你相信上面的表格。它发布每个任务上实际的模型回复,并提供了一个可以离线重新评分的命令。
pip install -e .
python scripts/prepare_datasets.py # HumanEval + GSM8K
python -m omnisbench.cli run --config configs/v0.yaml --run runs/mine
python -m omnisbench.cli report --run runs/mine
python -m omnisbench.cli verify --run runs/2026-08-19 # re-grades the published run, no API calls
verify 用评分器重新跑一遍已发布的回复,重建整个排行榜,包含成本在内,不需要调用任何 API 或持有密钥。篡改一条存储的回复,它就会失败。这就是重点。如果我们的数字有误,你大约一分钟就能证明它,而且我们真心希望你去试试。
结果、方法和诚实的局限性都在网站上,代码在 GitHub:
Results: https://omnisbench.fortitude-omnis.group/
Code: https://github.com/Fortitude-Group/OmnisBench
我们还在做一个真正的开源路由器 OmnisRouter,每次发布都会用这个基准来评分,所以它不能悄悄退化然后希望没人注意到。准备好了再说更多。
如果你能打破这些数字,在方法上戳个洞,或者你只是觉得我们测错了东西,告诉我们。开源和可验证的意义就在于此。
OmnisBench 由 Fortitude Omnis 构建。我们做小而锋利的工具,而且我们尽量不在自己的营销里撒谎。