Opus 5.5降价后缓存读取从$0.50降至$0.20/M token(降60%),与Fable 5.1基准持平,输出速度快30%。对Agentic工作流成本影响显著。
本周的主题是成本压缩和网关整合。Claude Opus 5.5 降价登场,无需改动任何代码;同时 Vercel 的 AI Gateway 在一个迭代周期内吸收了四个新模型——GLM-5.3 Flash、DeepSeek V4.1 Flash、Qwen 3.8 Flash 和 Grok 4.7。如果之前你因为成本问题一直在推迟长上下文或多 Agent 工作,现在这笔账得重新算算了。
Opus 5.5 在 Fable 5.1 基准测试中达到性能持平的同时,成本降低 40%,输出生成速度比前代快 30%。生产部署的核心数字:缓存读取从每百万 Token 0.50 美元降至 0.20 美元——降幅达 60%,在检索密集型或 Agent 模式下,缓存上下文会在多次工具调用中被复用,成本节省会迅速叠加。
这件事现在很关键,因为 Agent 化编码工作流正是 Opus 级模型值得其成本的工作负载,而这类工作负载恰恰也是缓存读取最密集的。你经常要在几十轮对话中反复注入相同的系统提示词、代码库上下文或文档语料。有了 0.20 美元/百万 Token 的缓存读取价格,长上下文推理的单任务成本已经降到了足以让此前处于盈亏边缘的工作流在经济上变得可行的程度。
无需任何 API 变更,无需调整提示词。这是一个纯粹的定价和推理速度更新——如果你的代码固定了 claude-opus-5,只需换一下模型字符串;如果你用的是 latest 别名,则什么都不用动。
结论:上线。如果你的生产环境里跑着 Opus 5,现在就迁移。如果性能持平对你的用例是核心依赖,先在你的内部评测上验证一下,但风险等级很低。缓存密集型工作流会立刻看到 ROI。
智谱 AI 的 GLM-5.3 Flash 现在可以通过 AI Gateway 路由,支持 100 万 Token 上下文和多模态能力。集成只需改一行模型字符串:zai/glm-5.3-flash。Gateway 负责认证、重试逻辑和提供商级别的故障转移——你无需单独管理 Z.ai 的 API Key。
这里的实际价值在于:无需运维开销就能获得提供商的可选性。如果你在对长上下文视觉模型做基准测试,或者需要一个与当前技术栈成本有竞争力的替代方案,GLM-5.3 Flash 现在只需一行代码就能测起来。通过 Gateway 的 CLI 可以直接插入编码 Agent 配置。
结论:评估。如果你已经在用 AI Gateway 且在测试多模态或长上下文替代方案,值得跑一下基准测试。如果还没上 Gateway,切换成本需要先和当前提供商栈做个对比来验证是否值得。
Google 的 Gemini 3.5 Transcribe 将基于 WebSocket 的实时转录带入了 AI SDK v7 层面——支持 85+ 语言检测、自定义词汇表和流式输出。Gateway 集成意味着你无需单独管理 Google Speech-to-Text 端点或凭证集。
实时流式处理是这里有意义的技术细节。批量转录是一个已经解决的问题,市面上有很多方案;但低延迟流式处理加语言检测的组合,组装起来要干净利落得多。如果你在做会议转录、实时字幕或语音转操作管道,消除一个独立的提供商集成能同时减少延迟和运维面。
需要 ai@latest 和 @ai-sdk/gateway@latest,以及 16kHz PCM 音频输入。提供了浏览器沙箱可以直接测试。
结论:上线。生产就绪,集成完善,消除了一个独立提供商的依赖。如果实时转录在你的路线图上,这是目前最低摩擦的接入方式。
DeepSeek V4.1 Flash 通过 Gateway 提供,配备 100 万 Token 上下文、视觉支持,以及一套分离的 I/O 处理架构——可通过 Claude Code、Hermes 或任何 OpenAI 兼容客户端访问。需要 Vercel CLI 59.13.1+ 和一个 AI Gateway Key。
分离式 I/O 架构值得关注:它的设计目的是通过解耦输入处理和输出生成来降低高吞吐量推理的成本。对于多 Agent 工作流——许多 Agent 读取共享上下文并生成独立输出——这在大规模场景下会产生影响。视觉支持也消除了需要处理视觉输入推理的 Agent 单独的图片处理步骤。
结论:评估。如果你已经在 Vercel 生态中运行多 Agent 或视觉工作流,值得做一下成本和延迟基准测试。如果你目前是直接访问 DeepSeek 且不需要 Gateway 的重试逻辑或统一计费,这个开销可能带不来什么额外价值。
Qwen 3.8 Flash 为 Gateway 的模型列表增加了 100 万 Token 上下文窗口和 65k 输出窗口——无平台溢价,通过一个 streamText() 模型字符串替换或 Agent 设置 CLI 即可访问。它被定位为编码 Agent 和工具使用场景下具有成本竞争力的选项。
65k 输出窗口是这里的差异化所在。大多数提供长输入上下文的模型在输出上都有显著限制。对于需要生成大型产物的任务——完整文件、详细计划、长篇结构化输出——宽松的输出窗口减少了对多次调用链的需求。
结论:评估。无锁定、无溢价、如果已在 Gateway 上一行代码就能集成。用它跑一下你当前模型在生成密集型任务上的成本和输出质量对比。尝试门槛很低。
SpaceXAI 的 Grok 4.7 已登陆 Gateway,配备 50 万上下文窗口和四档可配置的推理级别:低、中、高和 xhigh。推理级别参数让你可以为每个请求在延迟和深度之间做权衡——当有些任务需要快速浅层推理,有些需要扩展的思维链时,这很有用。40% 折扣截止到 9 月 27 日。
统一端点(spacexai/grok-4.7)在 AI SDK、OpenAI 兼容的 Chat Completions 以及包括 fx、Codex 和 eve 在内的编码 Agent 中均可使用。支持零数据保留和禁止提示词训练——这对于有数据处理要求的团队来说很关键。npx eve@latest init 是最快完成 Agent 设置的路径。
可配置的推理级别是这里最有趣的工程面。推理模型在算力分配上通常是非此即彼的;每个请求级别的调优让你无需在不同用例之间切换模型就能优化推理成本。
结论:评估。折扣窗口让现在成了一个合理的基准测试时机,特别是如果你在为 Agent 任务测试推理模型的话。OpenAI 兼容接口意味着集成摩擦很小。