DeepSeek API全面涨价并引入时段定价,Claude Code无控团队月消费可达1500欧元;文章给出3个成本控制杠杆。
Originally published on NextFuture
这个月的 Claude Code 账单突然飙到几千美元,而 DeepSeek——你曾经用来省钱的那个便宜 API——刚刚宣布全面涨价。如果团队还是把所有任务都默认用 Opus 模型,成本会持续攀升却无人察觉。本文指出 3 个具体抓手,帮助你在这个月内控制住 AI 成本,从选模型到自托管 LLM 全覆盖。
DeepSeek 刚刚发布公告:"plans to raise DeepSeek API service pricing across the board soon; a relatively large increase is expected"。此前 DeepSeek 曾经把 V4-Flash 打到 $0.14/M input token——这是市场上最低价之一。更值得注意是,DeepSeek 已经公布了分时段定价机制:在两个高峰时段(北京时间 9-12 点和 14-18 点),input token 价格从 $0.14/M 翻倍到 $0.28/M,output 从 $0.28/M 涨到 $0.56/M。cached input($0.0028/M)和 cache-miss input($0.14/M)之间的差距高达 50 倍——这意味着如何设计 prompt prefix 来优化缓存,现在比选哪个便宜模型更重要。
根据一份面向 CTO/团队负责人的指南,10 人团队如果无节制地使用 Claude Code,可能"drain €1.500+ monthly"。这份文档显示 Sonnet 和 Opus 的价差大约是 5:1,所以选模型是影响成本最大的杠杆。按平均水平使用量(每天 40 次调用,每次 4000 input token、800 output token,每月 22 个工作日),10 人团队每月消耗约 1800-2200 万 token——按 Sonnet 价格,费用在 180-300 EUR/月;同样用量切到 Opus,账单就涨到 900-1500 EUR/月。Anthropic Console 支持设置 hard cap(超出阈值直接阻断 API 调用)和 soft warning(达到预算 70% 时提醒)——这两个控制手段不需要改变开发者的日常工作方式。
另一份指南描述了通过 vLLM 配合 dynamic LoRA routing 部署 Llama 3.3 70B 的方案,使用 DigitalOcean 一台月费 $12 的 GPU Droplet(NVIDIA H100)或 $10 的(L40S)。作者声称系统能处理 50+ 并发请求,500K token inference 测试只花了不到 $1。相比 Claude Opus 的 $15/M input token,作者算出自托管系统的成本约 $0.11/M input token——这个"135x cheaper"的数字来自个人博客的自行测量,未经独立 benchmark,只能作为大容量且数据不太敏感的工作负载的参考信号,不能拿来替代日常工作中全部使用 Claude Code 的场景。
去 Anthropic Console 查看最近 2-4 周每个 API key 的用量,在 CLAUDE.md 里把 Sonnet 设为默认模型,Opus 只用于复杂推理任务。
去 Anthropic Console 查看最近 2-4 周每个 API key 的用量,在 CLAUDE.md 里把 Sonnet 设为默认模型,Opus 只用于复杂推理任务。
设置月度预算的 hard spend cap,并配合 70% 的 soft alert——防止 automated loop/agent mode 运行时间过长导致 token 意外暴涨。
设置月度预算的 hard spend cap,并配合 70% 的 soft alert——防止 automated loop/agent mode 运行时间过长导致 token 意外暴涨。
如果团队有大容量的批量/离线工作负载(data synthesis、offline indexing),可以先尝试自托管 Llama 或把 batch job 迁移到 DeepSeek 的非高峰时段,再决定是否要把全部 production 流量切过去。
如果团队有大容量的批量/离线工作负载(data synthesis、offline indexing),可以先尝试自托管 Llama 或把 batch job 迁移到 DeepSeek 的非高峰时段,再决定是否要把全部 production 流量切过去。
This article was originally published on NextFuture. Follow us for more fullstack & AI engineering content.
For further actions, you may consider blocking this person and/or reporting abuse