前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8767
  • 用 pass-all-k 而非准确率衡量AI系统可靠性
  • OpenAI因安全顾虑暂停Astra模型发布
  • 我停止让GPT-5管理邮箱:工作流反而更便宜更好
  • AI Agent 治理失败实录:策略门控为何沦为空文
  • LLM 应用七大攻击面与防御层
  • 大规模 AI 编程成本控制实战指南
  • 自学AI三年成为AI与系统开发总监
  • Copilot 使用量 API 新增 Agent 应用活动追踪
  • Meta推出编程Agent Muse Code:成本低但数据安全存疑
  • Coinbase、Shopify、Ramp自建编程Agent为何仍付费给Anthropic
  • AMD收购Taalas将AI模型直接刻入芯片
  • 我们如何用MCP协议让AI助手直接预订餐厅
  • DGX Spark六个月实测:营销数字在骗人,真实性能这样算
  • Agentic Coding未来五年将重塑软件工程
  • EU AI Act第50条内容溯源规范落地:实际可用的双层方案
  • MCP工具返回值格式实测:72次试验对比摘要行与原始时序数据
  • Oracle禁止在OpenJDK中使用AI生成代码
  • 人机交互场景下LLM低延迟推理工程实践
  • Anthropic Agent Skills 设计反思:Skill 不是 Capability
  • x402 协议实现可靠 Agent 支付的工程实践
  • DeepSeek涨价Claude Code烧钱:Dev成本控制三招
  • 2026年多AI编程智能体运行工具横评
  • AI智能体越界真相:一次34小时的真实攻击链复盘
  • Cohere Health基于Bedrock AgentCore的临床政策数字化实践
  • 生产级MCP服务器测试与调试指南
  • claude-crew:持久化多终端Claude Code智能体架构详解
  • TReNDS用Bedrock将根因分析从30分钟压缩到60秒
  • AI Agent访问控制架构:如何防止数据库被恶意篡改
  • AWS用约束规划自动计算NHL季后赛锁定条件,经验证四个赛季
  • AI Agent自动化开发者工作流:41%发布周期压缩实战
  • Token末日:Accenture 数据显示非工程师才是 token 消耗大户
  • Cloudflare 推出面向 AI Agent 的浏览器 Kitesurf
  • AI独立生成50次测试用例:49次精准覆盖所有边界条件
  • AI Agent支付基础设施一周内集体企业级化
  • AI Agent 故障隔离实战: blast radius 与三级 kill switch 设计
  • OpenAI发布Astra模型网络安全初步评估报告
  • Claude Code 高级编排:子 Agent 模式与防耗尽策略
  • 用 Spring Boot 搭建自托管 AI 客服组件,零 SaaS 订阅
  • 给 AI 写指令本质是写警告标签
  • Meta 认为编程代理的未来在于持久记忆而非更强模型
  • GitHub Code Quality 不再自动为 PR 添加 Copilot 审阅者
  • 别再往ChatGPT扔错误堆栈了
  • Claude Fable 5单次会话从推文构建可玩3D游戏
  • 让AI Agent拥有支付能力:x402协议实战
  • AI Agent工具优化:让Agent能安全调用你的工具
  • 用 Python + AI 自动化播客元数据流水线
  • AWS上Agentic AI实际成本拆解:单元经济学分析
  • open-connector:让AI Agent永远不接触用户凭证
  • npm脚本骗过多数用户:Agent权限提示研究
  • 警惕:MCP服务器正重蹈npm安全覆辙
  • GitHub Actions触发器丢失需手动恢复,附多条工具快讯
  • 已加载 51 / 8767
8.0
热点
AI SCORE
编程提效2026-08-08 01:00

DeepSeek涨价Claude Code烧钱:Dev成本控制三招

dev.to · AI#DeepSeek#Claude Code#成本优化
Editor brief · 编辑速览

DeepSeek API全面涨价并引入时段定价,Claude Code无控团队月消费可达1500欧元;文章给出3个成本控制杠杆。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

DeepSeek 涨价、Claude Code 成本飙升:越南开发团队该怎么办?

Originally published on NextFuture

这个月的 Claude Code 账单突然飙到几千美元,而 DeepSeek——你曾经用来省钱的那个便宜 API——刚刚宣布全面涨价。如果团队还是把所有任务都默认用 Opus 模型,成本会持续攀升却无人察觉。本文指出 3 个具体抓手,帮助你在这个月内控制住 AI 成本,从选模型到自托管 LLM 全覆盖。

涨价信号:DeepSeek 不再是永远的最低价 API

DeepSeek 刚刚发布公告:"plans to raise DeepSeek API service pricing across the board soon; a relatively large increase is expected"。此前 DeepSeek 曾经把 V4-Flash 打到 $0.14/M input token——这是市场上最低价之一。更值得注意是,DeepSeek 已经公布了分时段定价机制:在两个高峰时段(北京时间 9-12 点和 14-18 点),input token 价格从 $0.14/M 翻倍到 $0.28/M,output 从 $0.28/M 涨到 $0.56/M。cached input($0.0028/M)和 cache-miss input($0.14/M)之间的差距高达 50 倍——这意味着如何设计 prompt prefix 来优化缓存,现在比选哪个便宜模型更重要。

Claude Code:失控的话账单轻松破 1500 EUR/月

根据一份面向 CTO/团队负责人的指南,10 人团队如果无节制地使用 Claude Code,可能"drain €1.500+ monthly"。这份文档显示 Sonnet 和 Opus 的价差大约是 5:1,所以选模型是影响成本最大的杠杆。按平均水平使用量(每天 40 次调用,每次 4000 input token、800 output token,每月 22 个工作日),10 人团队每月消耗约 1800-2200 万 token——按 Sonnet 价格,费用在 180-300 EUR/月;同样用量切到 Opus,账单就涨到 900-1500 EUR/月。Anthropic Console 支持设置 hard cap(超出阈值直接阻断 API 调用)和 soft warning(达到预算 70% 时提醒)——这两个控制手段不需要改变开发者的日常工作方式。

自托管 Llama 3.3 70B:省钱但要清楚 trade-off

另一份指南描述了通过 vLLM 配合 dynamic LoRA routing 部署 Llama 3.3 70B 的方案,使用 DigitalOcean 一台月费 $12 的 GPU Droplet(NVIDIA H100)或 $10 的(L40S)。作者声称系统能处理 50+ 并发请求,500K token inference 测试只花了不到 $1。相比 Claude Opus 的 $15/M input token,作者算出自托管系统的成本约 $0.11/M input token——这个"135x cheaper"的数字来自个人博客的自行测量,未经独立 benchmark,只能作为大容量且数据不太敏感的工作负载的参考信号,不能拿来替代日常工作中全部使用 Claude Code 的场景。

本周应该做的 3 件事

去 Anthropic Console 查看最近 2-4 周每个 API key 的用量,在 CLAUDE.md 里把 Sonnet 设为默认模型,Opus 只用于复杂推理任务。

去 Anthropic Console 查看最近 2-4 周每个 API key 的用量,在 CLAUDE.md 里把 Sonnet 设为默认模型,Opus 只用于复杂推理任务。

设置月度预算的 hard spend cap,并配合 70% 的 soft alert——防止 automated loop/agent mode 运行时间过长导致 token 意外暴涨。

设置月度预算的 hard spend cap,并配合 70% 的 soft alert——防止 automated loop/agent mode 运行时间过长导致 token 意外暴涨。

如果团队有大容量的批量/离线工作负载(data synthesis、offline indexing),可以先尝试自托管 Llama 或把 batch job 迁移到 DeepSeek 的非高峰时段,再决定是否要把全部 production 流量切过去。

如果团队有大容量的批量/离线工作负载(data synthesis、offline indexing),可以先尝试自托管 Llama 或把 batch job 迁移到 DeepSeek 的非高峰时段,再决定是否要把全部 production 流量切过去。

This article was originally published on NextFuture. Follow us for more fullstack & AI engineering content.

For further actions, you may consider blocking this person and/or reporting abuse

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
x402 协议实现可靠 Agent 支付的工程实践
下一篇
2026年多AI编程智能体运行工具横评