DSH 开源引发 17000 星热潮,同时 V4-Pro API 涨价 12 倍;文章提供基准数据与成本测算,为多模型工作流选型提供决策依据。
2026 年第三季度,DeepSeek 同时宣布了两项重大举措:V4‑Pro 的 API 价格上调,同时开源 DeepSeek Harness(DSH)。V4‑Pro 峰时段费率上调至原基准价的 12 倍,此举在开发者社区引发广泛讨论。同期,GitHub 上的开源项目 DSH 在极短时间内获得超过 17,000 颗星标。业界从业者提出了若干实际问题:涨价后,V4‑Pro 相比 OpenAI Codex 是否仍有足够的性价比?DSH 能为 Agent 工作流工程带来哪些核心优势——尽管它并不能降低 token 消耗量?本文整理了公开基准数据、token 成本计算案例、DSH 与 Codex 的能力测试结果及架构差异,并分析了 DeepSeek 开源策略背后的商业逻辑。运营多模型工作负载的团队可以利用 4sapi 等 API 网关简化异构大模型后端的访问控制。本文为工程师选型 Agent 运行时技术栈及做出成本优化的 API 采购决策提供参考。
DeepSeek 近期对 V4‑Pro‑0813 模型的定价进行了修改。在峰时段窗口(9:00‑12:00 和 14:00‑18:00),每百万 token 的定价上涨至原费率的 12 倍。定价公告发出数小时后,DeepSeek 在 GitHub 上发布了 DeepSeek Harness(DSH)。该开源项目迅速积累超过 17,000 颗星标,引起了全球 Agent 开发者的关注。
开发者社区内出现了两种相互矛盾的观点。一派认为,涨价后 V4‑Pro 相比 OpenAI Codex 已丧失成本优势。另一派则指出,DSH 具备 Codex 无法复制的独特架构优势,即使 API 费用更高也值得继续采用。区分模型推理成本与 Agent 运行时能力至关重要——DSH 本身是一个开源的 Agent 执行框架,用户仍需为调用 V4‑Pro 或任何其他 LLM 后端支付相应的 API 费用。
为评估实际经济效益,我们比较两条技术路径完成相同 Agent 任务时的端到端费用。计算参考了 DeepSeek 官方定价表及 OpenAI 2026 年 7 月对 GPT‑5.6、Luna 和 Terra 模型的定价调整。所有成本均按每百万 token 计量。
在峰时段条件下,V4‑Pro 比 Luna 贵,但比 Terra 和 Sol 便宜。单次请求的最大输入 token 上限为 272,000 token。当对输入 token 进行缓存时,Luna 的未缓存输入及输出 token 费用低于 V4‑Pro。在输入输出 token 量相同的情况下,无论缓存命中率如何,Luna 都保持成本优势。V4‑Pro 闲时段费用约为每百万 token 2.78 美元,峰时段达到 5.55 美元。Terra 每百万 token 费用为 13.1 美元,Sol 高达 32.74 美元。
OpenAI Codex 捆绑在 ChatGPT 订阅套餐中。Plus 订阅用户可无限使用,不产生额外账单。Business 档用户同样享受无限 Codex 使用额度。独立开发者若无有效订阅,则需按计量费率支付 Codex API 调用费用。
模拟一个真实的 Agent 工作负载场景:每个任务消耗 10 个输入 token 并生成 1 个输出 token。缓存命中率在 0% 到 99% 之间波动。对于一个月周期的 Agent 工作负载,V4‑Pro API 账单可达 20 美元。每月输入 token 量在 2,330,000 至 8,830,000 token 之间,峰时段输出 token 量最高达 4,420,000 token。费用随缓存效率及请求是否落在峰时段而大幅波动。
Terminal‑Bench 基准测试结果反映了实际的 Agent 能力差距。在命令行任务测试中,V4‑Pro 比 Luna 高 3.2 分,比 Terra 高 0.5 分,仅落后 Sol 0.9 分。在代码仓库修改任务中,Luna、Terra 和 Sol 分别领先 V4‑Pro 4.5、6.9 和 10 分。V4‑Pro 在命令行操作上表现稳健,但在长周期代码重构任务上落后于竞争对手。
从总拥有成本角度看,有两类团队应在调价后重新考虑 V4‑Pro。第一类是追求极致每 token API 低成本的团队——Luna 以相近的能力提供更低的单价。第二类是已拥有 ChatGPT‑Plus 订阅的个人开发者:现有 Codex 配额已可覆盖 Agent 场景,无需额外 API 支出。
原始 token 成本只是 Agent 系统评估的一个维度。DSH 与 Codex 在 Agent 运行时设计上遵循截然不同的理念。
我们可以用餐饮机器人作类比来说明这一区别。Skills 代表模型级操作提示词。MCP 定义了工具调用协议规范。Harness 是执行运行时,接收模型输出并调用实际工具行为。在相同的基座模型参数下,不同的 harness 实现对完全相同的目标会产生不同的成功率和总成本。
一轮公开压力测试提供了实证数据。一组测试使用 V4‑Flash 作为后端,通过 DSH 完成 20 个任务,通过 Codex 完成 16 个任务。DSH 每个已完成任务的成本约为 Codex 的三分之一。另一组测试以 GPT‑5.5‑Pi 为基座模型。Codex 展现出更高的任务成功率和更低的费用。DSH 未纳入第二轮测试,因此跨平台对比无法得出普遍结论。
DSH 具备若干独特的技术特性:
模型无关支持: 开发者可热切换底层 LLM,包括 OpenAI、Anthropic 及自托管模型实例。避免了对单一模型厂商的硬绑定。
全开放内部实现: Codex 向终端用户暴露的可配置参数有限。DSH 开放了其内部工作流逻辑。工程师可以修改工具调用逻辑、更改日志机制、调整重试策略,甚至重写部分运行时源代码。
创建者模式能力: DSH 支持创建者模式。Agent 可自主编写新的程序代码。若执行失败,它会回滚修改并保留原始核心源文件。这为二次开发提供了高度的自由度。
业界评论将这一对比形容为"Agent 2.0"。Codex 类似闭盒消费电子产品,易于部署,开箱即用表现稳定。DSH 则像一套可定制的机械套件。它要求更深入的工程理解,但能针对特定需求进行广泛修改。构建自定义 Agent 管道的团队可以利用 4sapi 提供的统一路由功能,将多个模型后端连接到 DSH 部署。
一个广泛存在的误解认为,开源 DSH 等于"零额外成本赠送免费 Agent 能力"。实际上,DSH 并不能消除 token 消耗。开源运行时将 Agent 入口点移向终端用户,用户仍需为模型 API 调用支付推理费用。
回顾 DeepSeek 的历史产品路线图。2025 年初,DeepSeek 发布了 R1 模型权重。经历一个月免费试用期后,推理、通信及存储服务转为付费计费。2025 年 8 月,DeepSeek 发布了开源 Agent 工作流组件。开源代码覆盖了模型到用户的交互逻辑,而 Web 前端、App 及 API 网关服务仍为商业付费产品。
官方开源活动财务数据说明了商业潜力。2025 年 2 月 27 日至 3 月 28 日期间,R1 服务处理了 6080 亿输入 token 和 1680 亿输出 token,缓存命中量为 3420 亿 token。基于官方每百万 token 0.872 美元的定价,理论收入可达 562,027 美元,利润率达 545%。
DeepSeek 保持了相当有竞争力的基础模型定价。即使 V4‑Pro 调价后,它仍是市场上性价比最高的高性能模型之一。DSH 并不强制用户必须运行 DeepSeek 模型。开发者可以连接 OpenAI、Anthropic 或第三方模型端点。开源运行时缩短了 Agent 开发周期。简单任务可分配给更便宜的轻量模型,复杂的重载工作可分配给高端模型。这种架构使用户能够在多供应商服务间分配 token 预算。
开源 DSH 扩大了 DeepSeek 开发者生态。公司并不试图将用户锁定在专有闭源平台上。社区贡献者提交适配和功能补丁。DSH 默认启用本地日志记录。用户对话历史存储在客户端设备本地,用户可以主动向上游项目提交反馈。"开源 harness 驱动 token 销售"的观点只捕捉了部分真相,忽视了 DSH 带来的社区驱动生态价值。
团队在 DSH 与 Codex Agent 技术栈之间做选型时,需权衡三个维度:成本约束、定制需求及厂商锁定风险。
如果团队优先考虑最小定制修改下的快速部署:OpenAI Codex 提供稳定的开箱即用性能。ChatGPT‑Plus 订阅用户无需额外 API 账单即可获得 Agent 能力。这适合个人开发者及专注于业务输出而非 Agent 框架研发的小型团队。
如果需要定制 Agent 执行逻辑、在多个 LLM 后端间切换、或避免厂商锁定:DSH 开源运行时更为适合。工程师承担维护运行时实例、调优提示词模板及调试工具调用工作流的负载。可以将 DSH 与多样化模型端点配合使用,在性能和每 token 费用间取得平衡。
采用 DSH 时,需密切关注 DeepSeek V4‑Pro 峰时段定价规则。将大批量 Agent 批处理任务调度至闲时段窗口执行,以降低 API 支出。应用 token 级限速和预算告警机制,防止意外账单飙升。
DeepSeek 上调 V4‑Pro API 价格与发布开源 DSH 的双重动作,重塑了 2026 年 Agent 工程选项。峰时段 tariff 上调后,V4‑Pro 不再拥有绝对成本优势。Luna 等竞争模型在某些场景下提供了更便宜的替代方案。然而,DSH 带来了高度可定制的开源 Agent 运行时,支持多模型访问和深度二次开发。为构建自主可控 Agent 系统的团队创造了新的可能性。
Agent 技术采购不能纯粹依赖每 token 价格比较。工程师需要结合基准性能、运行时可定制性、厂商依赖性及总运营费用来得出最终结论。开源框架降低开发阻力,但并不消除推理成本。理性的工作负载调度和多模型流量管理对长期 Agent 运营仍然至关重要。
了解更多:https://4sapi.com