DeepSeek V4.1 Flash采用全新CED架构,成本优势来自架构本身;重点指出提供商别名路由风险——请求模型名与实际服务模型可能不一致,给出三条客户端路由层应对策略:校验响应model字段、将缓存命中率入成本面板、为provider强制限流迁移做准备。
9 月 10 日,DeepSeek 发布 V4.1 Flash:一款 552B 参数的 MoE 模型,基于全新的 Causal-Encoder-Decoder(CED)架构,支持原生多模态视觉、100 万 token 上下文窗口,权重在 Hugging Face 上以 MIT 协议开源。对大多数开发者而言,这次发布不过是又一条新闻。真正值得停下来看看的是公告中被埋没的低调退役通知:从 9 月 14 日北京时间 12:00 起,在 V4.1 Pro 上线之前,所有发往 deepseek-v4-pro 的请求都将被路由到 V4.1 Flash,并按 V4.1 Flash 的价格计费。注意这里实际发生了什么:你的代码没有任何改动——model: "deepseek-v4-pro" 这个字符串还在、端点还在、SDK 还在——但背后的模型被换掉了,账单也被换掉了。只不过这一次对你是利好。旧名称 deepseek-v4-flash 和 deepseek-v4-flash-vision-exp 也将在临时期间被路由到新模型。该提供商正在用自身的 API 作为别名路由层,把一个高价档位合并进了低价档位。这与我们上周报道的第三方价格变动不同:这一次模型本身在路由层被替换了,而大多数客户端应用根本无法察觉。
V4.1 Flash 的成本优势并非补贴。它来自三个架构决策。首先,非对称的编码器-解码器分离。40 层分为 20 层因果编码器和 20 层解码器。长输入由编码器一次性汇总;解码器的全局 KV 状态直接从编码器最后一层的隐藏状态投影而来,将预填充复杂度从大约 O(NL) 降低到对于远长于窗口的序列约 O(NL/2)。这就解释了一个看似奇怪的配置:每个输入 token 仅激活约 8B 参数,而解码时激活约 16B。其前身 V4 Flash 是一个 284B 模型,每个 token 激活约 13B。模型体积翻倍了,但输入阶段的计算却用了更少的激活参数。其次,缓存压缩。KV-cache 的 HBM 需求降至上一代的四分之一,SSD 需求降至八分之一,相较于 DeepSeek 第一代模型,缓存缩小了 437 倍——每个 token 约 890 字节。对于 Agent 工作负载,这才是决定性数字:长对话历史能否常驻缓存并被反复复用,决定了整个成本曲线的形态。第三,将缓存差距定价进费率表。闲时价格:命中缓存每百万 token 0.02 元,未命中 1.0 元,输出 4.0 元;高峰时段三项价格翻倍。命中与未命中之间的差距是 50 倍——缓存命中率不再仅仅是性能指标,而是定价函数的一等输入。关于能力,DeepSeek 自己报告的数字:DeepSWE v1.1 上 74.2 分(对比 Claude Opus 5.0 的 74.0),Terminal-Bench 2.1 上 90.6 分(对比 89.1)。但要看脚注:同一模型在八个不同测试框架下,DeepSWE 得分从 65.6 到 74.2 不等,差距近 9 分;在更难的 Terminal-Bench 4.0 上仅得 31.2,而 Opus 5.0 是 51.8。把它定位为一款出色的低价档位 Agent 工作主力,而非免费的 frontier 模型,这个定位是准确的。
提供商端别名路由已经在发生;客户端路由层应该迎头赶上:
验证响应中的 model 字段。别名路由意味着请求的名称与实际服务的模型可能不同;日志、监控和成本归属应该以响应中的实际模型为准。
把缓存命中率放入成本仪表盘。命中与未命中之间有 50 倍的差距,将 Agent 工作流的命中率从 40% 提高到 80%,几乎能将输入成本减半。
为强制的提供商端迁移做好准备。9 月 14 日之后,deepseek-v4-pro 背后的计费档位会发生变化。你的路由层应该在价格快照发生漂移时告警,而不是在月末账单上才发现。
V4.1 Flash 已以模型名 deepseek-flash 在 DeepSeek API 上线,权重也已开源。如果你的应用已经架设在多个模型之上,采用它无需修改任何业务代码——只需把 base_url 指向一个统一网关:
from openai import OpenAI
client = OpenAI(
api_key="your-accels-key",
base_url="https://router.accels.tech", # single entry point; upstream alias routing is handled for you
)
resp = client.chat.completions.create(
model="deepseek-flash",
messages=[{"role": "user", "content": "Summarize this 1M-token repo changelog and flag three high-risk commits"}],
)
print(resp.model, resp.usage)
统一网关的价值恰恰在这样的时刻显现——当提供商重新调整其档位时:稳定性——上游别名路由和模型退役由网关吸收,因此你的调用不会在 API 迁移时断裂;完整的模型覆盖——新旧名称如 deepseek-flash 和 deepseek-v4-pro 共存于一个目录,切换只需改一个字符串;统一账单——命中、未命中、高峰与闲时调度被折叠成一张一致的账单面,因此跨模型比价不再需要手工核对费率表。用同一个 Agent 工作负载在 deepseek-flash 和 glm-5.3 之间做 A/B 测试,只需改一个字段,其余管道原样复用。
V4.1 Flash 把"便宜"从运维问题变成了架构问题:每个 token 890 字节的缓存、非对称激活、50 倍的缓存价格差距,都指向同一个教训——Agent 时代的成本杠杆在缓存和路由层,而不是买一个更贵的模型。而提供商自己在运行别名路由这一事实提醒我们:API 中的模型名称正从一个合约退化成一个建议。你的路由层准备好了吗?
DeepSeek 官方公告:DeepSeek V4.1 Flash
腾讯新闻 / 文心一言:DeepSeek-V4.1-Flash 分析(缓存缩小 437 倍,V4 Pro 退役)
DataNorth AI:DeepSeek 发布 DeepSeek-V4.1-Flash
百度百科:DeepSeek V4.1 Flash(高峰/闲时定价)