Claude Code 在 API 配额用尽时自动切换到本地模型继续工作。一个实用的成本优化策略,让开发者不被配额限制打断工作流。
如果你像我一样使用较便宜的 Anthropic 套餐,在深度使用 Claude Code 进行编码时,经常会遇到每日或每周配额限制。如果想继续工作,可以连接本地开源模型而不是使用 Anthropic。要监控当前配额,输入:/usage
最好的开源模型在不断变化!写这篇文章时,我推荐来自 Z.AI 的 GLM-4.7-Flash 或 Qwen3-Coder-Next(*编辑注:2026 年中期 -> 查看:Qwen3.6-27B 和 Gemma 4)。如果想节省磁盘空间和 GPU 内存,可以尝试较小的量化版本,它加载和运行速度更快,但质量会有所下降。我会另外发布一篇详细文章,介绍如何根据你的任务和机器限制找到最适合的开源模型。
如果你以前没用过 LM Studio,它是在本地机器上查找和运行开源 LLM 及视觉模型的便捷方式。在 0.4.1 版本中,LM Studio 引入了连接 Claude Code(CC)的支持。详见:https://lmstudio.ai/blog/claudecode,或按以下说明操作:
找到模型搜索按钮来安装模型(见上面的图片)。LM Studio 建议运行模型时上下文 > 25K。
打开新的终端会话:
a. 启动服务器:
lms server start --port 1234
b. 配置环境变量指向 LM Studio:
export ANTHROPIC_BASE_URL=http://localhost:1234
export ANTHROPIC_AUTH_TOKEN=lmstudio
c. 启动指向你服务器的 CC:
claude --model openai/gpt-oss-20b
降低对速度和性能的预期!
要确认你正在使用的模型或切换回去,输入 /model
LM Studio 基于开源项目 llama.cpp 构建。如果你不想使用 LM Studio,可以直接安装并运行该项目并连接 Claude Code,但说实话,除非你在微调模型或有特殊需求,否则 LM Studio 通常是更快的设置方式。
目前,这是一个备用方案。除非你拥有非常强大的机器,否则你会注意到操作耗时增加和代码质量下降,但它确实能用(!),而且在配额限制恢复后在本地 OSS 模型和 Claude 之间切换也很容易,所以当你卡住或只是想节省配额时,这是继续编码的好办法。如果你尝试了,请告诉我你的情况以及哪个模型对你有效。