前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
返回 AI 情报前线
All News · 全部资讯9321
  • 2026年AI工程师成长路径:不止于聊天机器人
  • JVM内存管理与性能调优:GC算法、堆布局与JIT编译
  • Claude Code 技能加载竟消耗 20 万 token
  • 60行代码构建本地脱敏代理,保护API密钥不外泄
  • 金融SaaS单API密钥设计:结构化输出与幂等性实践
  • 如何在应用中使用 Amazon Q 嵌入式聊天定制品牌化界面
  • AI API成本削减97.5%实战:绕过中间商反而更贵
  • 14款MCP服务器上下文窗口消耗实测
  • Bedrock多Agent文档分类方案实战
  • Jumio实时特征存储架构:亚100ms欺诈检测
  • failproof AI将编码Agent策略执行从700ms压至0.7ms
  • Claude Code周限额明日大幅下调三分之一
  • MCP Gateway: 统一多MCP服务器的架构方案
  • 实测:选对模型把我AI API账单削减90%
  • Agentic AI延迟问题:算力堆叠不是答案
  • NoWreck:验证AI代码修改是否属实的工具
  • AI Agent成为新型攻击面:自我复制威胁研究
  • 多模型API退出测试:成本账本才是选型关键
  • 为什么不能只用Claude做所有事
  • Axonius多租户AI Agent隔离方案实践
  • 用LiteLLM将Claude Code路由到DeepSeek节省成本
  • Claude Code支持AGENTS.md跨工具标准配置
  • Coding Agent 账单省 50-70%:利用 sticky routing 保住 Prompt Cache 命中
  • AI Agent 为何还在用 while(true) 循环——工程陷阱深度剖析
  • SEO Agent 选 MCP 还是 REST?一份实用决策框架
  • SGLang深度解析:如何高效服务DeepSeek-V4-Pro
  • FlakeFixer: 用Agent自动分析Flaky Test
  • AI编码Agent记忆系统设计的四个教训:删除不是过期
  • 盲人开发者为视障群体打造AI描述应用ScribeMe
  • AI代码审查员的验证悖论:声称完成≠真正完成
  • LLM API多租户安全清单:tenants-safety essential
  • AI Agent不应持有你的钥匙:权限最小化原则
  • Claude 多智能体系统上演自复制恶意软件攻防战
  • MCP Server 开发避坑指南:工具描述比 TypeScript 更难
  • 生产级 Solana Agent 交易生命周期深度解析
  • 5分钟让AI助手读懂你的代码库
  • 用Python构建AI简历筛选器
  • Agent上下文满了该丢什么:长对话记忆管理实战
  • Warp推出Factories:一站式AI软件开发工厂基础设施
  • AI Agent试点到生产:成本暴涨700倍的教训
  • Cursor发布Origin功能:AI编程上下文管理
  • TryHackMe 提示词注入 CTF 实战攻略
  • 面向 Agent 的运维队列:失败自动转Ticket
  • 四个静默失败的 CI 检查:它们都是绿的,但什么都没做
  • AI 编码工具会读取 .env:本地 DLP 代理 Anonmyz 在prompt边界截流
  • Google 开源 SAM:零配置的 AI Agent P2P 发现与调用网络
  • Cursor Skills完全指南:格式规范与跨Agent迁移实测
  • OpenAI Codex Skills规范详解:目录结构与官方文档未记载的细节
  • 用Gitea自建Claude Code内部插件市场,团队Skill统一分发
  • Claude Skills规范深度解读:从格式到团队协作
  • 2026年LLM应用架构实战:摆脱if/else链式判断
  • 已加载 51 / 9321
8.0
热点
AI SCORE
编程提效2026-08-19 00:26

用LiteLLM将Claude Code路由到DeepSeek节省成本

dev.to · AI#Claude Code#DeepSeek#成本优化
Editor brief · 编辑速览

通过ANTHROPIC_BASE_URL和LiteLLM代理,将低优先级任务路由到DeepSeek V4,保留Claude订阅处理高难度工作。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

用 ANTHROPIC_BASE_URL 和 LiteLLM 的 drop_params 为 DeepSeek 创建一个 claude-cheap 别名,把订阅额度留给高风险任务。

改动内容 — 具体配置

你为 Claude Code 订阅付费,但并非每个任务都需要最强大的模型。探索性阅读、"总结一下这个目录"、用完即弃的草稿工作——这类高频低风险任务会烧掉大量 token。解决方案:为此类任务配置第二个更便宜的 backend。

问题在于:Claude Code 只认 Anthropic 的 Messages API。它没有内置的"同一工具、不同模型"概念。但你可以通过几个环境变量和一个自托管代理把它指向别处。

这个方案(由 dev.to 上的一位开发者分享)可以从同一个终端运行两个 agent:

可信赖的 agent:claude — 真正的 Anthropic 订阅,默认 session

便宜的 agent:claude-cheap — 同一个 CLI,通过 LiteLLM 代理路由到 DeepSeek V4(pro 对应 Sonnet 级别,flash 对应 Haiku 级别)

代理将 Anthropic 格式的请求转换为 DeepSeek,通过 OpenRouter API 提供服务。VPS 上的持久 SSH 隧道连接到各台机器。

核心技巧 — /v1/messages,而非 /v1/chat/completions

关键操作:将 ANTHROPIC_BASE_URL 指向 LiteLLM 的 /v1/messages 端点,而不是 LiteLLM 也暴露的 OpenAI 兼容路径。Claude Code 只认 Anthropic 的请求结构,所以 OpenAI 形状的端点会以类似客户端 bug 的方式失败,但实际上不是。一旦 LiteLLM 坐到正确的端点上并在底层做转换,Claude Code 完全不知道它其实不是在跟 Anthropic 通信。

值得注意的一个 Bug — Plan Mode 的 context_management

Claude Code 的 Plan Mode 会在请求中附加一个 context_management 参数。Anthropic 的 API 能处理它。但大多数其他 backend 不认识这个参数,会以 400 拒绝整个请求——看起来像是 Plan Mode 本身坏了,实际上是下游模型从未打算接受这个参数。

Cover image for One terminal, two trust levels — running Claude Code against a real subscription and a cheap proxy

LiteLLM 配置中的一行修复:

litellm_config.yaml
---
drop_params: true

这告诉 LiteLLM 静默删除不支持的参数,而不是转发它们让 backend 拒绝请求。这样 Plan Mode 在哪个模型实际回答时都能正常工作。

两条命令,故意不对称

这一部分比任何代理配置都值得复制:可信赖的和便宜的 agent 故意看起来不一样。

claude — 真家伙,全订阅,无包装。默认终端,默认 prompt。这是错误代价最高的 session,所以你希望在它做的事情和你之间零视觉噪音。

claude-cheap — 一个 shell 函数,掉进一个隔离的子 shell,用独特的标签和图标重命名 tab,并在退出时重置。不是为了美观:晚上 11 点在六个标签页之间切换时,你希望从结构上不可能把便宜的、限制更宽松的 session 误认为运行在你订阅上的那个。贵的工具不给仪式感;便宜的工具给一身伪装。

# --- Cheap agent: DeepSeek via self-hosted LiteLLM proxy ---
claude-cheap() {
  (
    unset ANTHROPIC_API_KEY
    export ANTHROPIC_BASE_URL=http://localhost:3456
    export ANTHROPIC_AUTH_TOKEN=anything
    export ANTHROPIC_MODEL=deepseek/deepseek-v4-pro
    export ANTHROPIC_DEFAULT_SONNET_MODEL=deepseek/deepseek-v4-pro
    export ANTHROPIC_DEFAULT_HAIKU_MODEL=deepseek/deepseek-v4-flash
    export CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC=1
    echo -ne "\033]0;🐋 DEEPSEEK-AGENT\007"
    claude "$@"
    echo -ne "\033]0;Terminal\007"
  )
}

子 shell ( ... ) 使这些 export 是用完即弃的——函数返回后不会泄漏到父 shell。

ANTHROPIC_AUTH_TOKEN 设置为假值,因为 LiteLLM 不检查它;它只是需要存在,这样 Claude Code 才不会拒绝启动。

CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC 减少对这个 session 回拨 Anthropic 自有遥测端点的调用,因为这个 session 背后没有真实的 Anthropic 账户。

为什么要这么做 — Supervisor/Executor 分离

目标从来不是"让 Claude Code 更便宜"。而是 supervisor/executor 分离:订阅 session 做规划、审查,任何你不想看到出问题的事情。代理 session 处理高频低风险工作,其输出在获得信任之前会经过审查,方式与订阅 session 相同。

决策的逻辑与为监控 agent 选云端模型而非本地模型相同——不是"哪个模型更聪明",而是"我能容忍哪种失败模式,什么是最便宜且能达标的东西"。这里轴是订阅成本而非设备端 vs 云端。底层问题是一样的:我愿意接受什么程度的错误,以及谁来监督它是否出错。

待解决的问题 — 本地纯端侧方案

也有一个纯本地变体:同样的双层模式,但便宜的那层完全跑在本地设备上而非通过托管代理。那个方案遇到了 tool-calling 格式不匹配的问题——那是一个值得单独讲的故事,作者计划另写一篇。

操作步骤

  1. 用 drop_params: true 设置 LiteLLM 代理,配置好你的 DeepSeek/OpenRouter 凭证
  2. 将 ANTHROPIC_BASE_URL 指向代理的 /v1/messages 端点
  3. 将 claude-cheap 函数添加到你的 shell 配置中
  4. 对探索性阅读和草稿工作运行 claude-cheap;规划审查工作保持用 claude

你的订阅留在需要的地方。你的便宜 agent 处理其余的事情。

Originally published on gentic.news

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
Axonius多租户AI Agent隔离方案实践
下一篇
Claude Code支持AGENTS.md跨工具标准配置