作者构建Prompt分类路由系统,基准测试显示Gemini平均成本比OpenAI低约59%,质量差距极小,提示按难度分级路由可显著节省LLM调用费用。
很多 AI 应用把每一个 prompt 都发给同一个强大的模型——无论是简单问题还是复杂推理。
但实际上,每个 prompt 都真的需要最贵的模型吗?
我构建了 AI Router 来验证这个想法。
Prompt → 分类 → 难度 → 路由策略 → 最优模型
它对 OpenAI、Gemini 和 Claude 在质量和 API 成本两方面进行基准测试,然后根据测试结果对 prompt 进行路由。

有趣的结果:
Gemini 的质量得分仅比 OpenAI 低 1.15 分,而其实际测量的单次请求成本平均低约 59%。
这并不意味着 Gemini 总是更好。它揭示了为什么对所有负载使用同一个模型可能不是最具成本效益的做法。
想看看路由器如何处理你的 prompt?
👉 试试 AI Router Live
输入一个 prompt,看看 AI Router 如何对其分类并根据路由策略选择模型。
👉 在 GitHub 上查看源码
这目前还是一个 MVP,基准测试规模较小,因此这些结果不应被视为通用模型排名。
接下来,我会测试 100–500+ 个 prompt 来比较:
对比维度:成本 • 质量 • 延迟 • 可靠性
我想回答的问题是:
智能 LLM 路由能在不显著牺牲质量的前提下降低多少成本?
技术栈:Go、Gin、OpenAI、Gemini、Claude、Next.js 和 TypeScript。
目前我正在探索 AI/LLM 工程、后端工程和 AI 基础设施方面的机会,希望参与模型路由、RAG、Agent 和生产级 AI 系统的相关工作。
如果你的团队也在解决类似的问题,我非常希望建立联系。
我也欢迎对构建生产级 LLM 系统的工程师提出反馈和交流。