开源的自托管代理(Apache 2.0),支持OpenAI/Anthropic/Gemini格式,自动选最便宜且能胜任的模型,每条响应附带成本决策头信息,可预览路由不收费。
一个决定你钱花在哪里的路由器,要求你给予很大的信任。它坐在每个请求的前面,悄悄地选择一个模型,然后在月末给你一张账单。如果它告诉你省了 60%,你大多只能选择相信它。
我不想选择相信它。所以 OmnisRouter 给每个响应都附上一张收据,而这张收据才是整个问题的重点。
这是一个开源(Apache 2.0)、自托管的代理,支持 Anthropic、OpenAI 和 Gemini 格式。你只需要改一个 base URL,保留自己的 provider 密钥,每条请求都会发送到能够实际处理它的最便宜的模型。响应会以客户端自己的格式返回,同时附带一条说明,解释选择了什么以及花了多少钱。
每个响应都携带一组响应头:
X-Omnis-Model: gemini/gemini-2.5-flash
X-Omnis-Decision: Routed
X-Omnis-Confidence: 0.26
X-Omnis-Policy: v3-omnisbench-2026-08-20
X-Omnis-Cost-Delta-Vs-Big: -0.0121
如果你想在花任何钱之前知道它会怎么做,有一个免费的端点可以在不调用 provider 的情况下返回完整决策:
curl -s localhost:8080/v1/route -H "authorization: bearer $TOKEN" \
-d '{"messages":[{"role":"user","content":"Summarize this thread."}]}'
{ "policy_version": "v3-omnisbench-2026-08-20",
"decision": "ROUTED", "reason": "cheapest_capable",
"chosen": { "provider": "gemini", "model_id": "gemini-2.5-flash" },
"est_cost_delta_vs_big_usd": -0.0121 }
没有截图,没有需要你信任的仪表盘。决策就在响应里,你可以记录它。
确定把请求发到哪里不需要任何网络跳转。一个小型固定的 ONNX 模型(bge-small-en-v1.5)在进程内对 prompt 进行嵌入,嵌入向量映射到最近的意图簇,然后该簇的策略表选择能够满足该类工作质量要求的最便宜候选者。如果它不够自信,会升级到强模型而不是胡乱猜测。整个过程发生在我设定的 50ms 预算之内。
以下是已上线模型的一个实时追踪:
数学那一行才是有趣的部分。在小学数学上,tiny gpt-5-nano 的准确率基本上和前沿模型一样,所以 OmnisRouter 把活派到那里,省下大约 25 倍的价差。这不是猜测,而是来自实际测量。
路由模型不是一个我要求你相信的黑箱。意图簇和策略表随代码仓库一起发布,从公共数据重建,所以相同的输入产生相同的模型,每个决策都带有生成它的策略版本戳。
coding 和数学策略由 OmnisBench 驱动,这是一个配套基准测试,对每个模型按任务评分,并公布每个响应以便你可以在本地重新评分。所以当路由器说"便宜模型在这里够用"时,那是一个你可以去验证的数字,而不是幻灯片上的一行话。其他领域目前使用合理的估计,基准测试覆盖范围会从这里逐步扩展。
最便宜胜任不等于最便宜。目的不是把一切塞进最小的模型然后祈祷。它是要只在前沿模型真正需要的地方花前沿的钱,并且能够逐请求展示为什么去了那里。当能力无法忠实地转移到选定的 provider 时,它会用一个明确的错误拒绝,而不是默默地丢弃。第一次遇到会惊讶,但每次都是正确的。
它作为单个自托管进程运行,带有嵌入式数据库,你的密钥静态加密,prompt 内容只有在去往你选择的模型时才会离开你的基础设施。
网站和完整路由故事:https://omnisrouter.fortitude-omnis.group/
代码:https://github.com/Fortitude-Group/OmnisRouter
路由背后的基准测试:https://omnisbench.fortitude-omnis.group/
如果你能让它路由得很差,或者你认为收据应该携带更多信息,请告诉我。这就是开源模型和决策日志存在的意义。
OmnisRouter 由 Fortitude Omnis 构建。我们做小而锋利的工具,并且尽量不在自己的营销里说谎。