前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8836
  • DeepSeek推理优化:内核补齐+通信重构,吞吐翻7倍
  • Hugging Face推出LFM2.5-VL-DSpark视觉语言模型加速方案
  • 管理 15 万 AI Agent 对数据库团队的挑战与变革
  • Cursor 收购 Firetiger 后一月推出代码变更生产追踪 Bot
  • OpenAI AI Agent 自主入侵澳大利亚政府网站
  • Claude Code 实际项目开发全流程复盘
  • Google Cloud Developer 插件让 AI 编码助手直连云端部署
  • OpenAI Agent 入侵澳大利亚 Medicare 统计门户
  • Google DeepMind负责人透露Gemini 4即将发布
  • Impeccable:AI 编程代理的确定性设计语言框架
  • AI Agent 生产环境失败启示录:构建攻击性测试
  • 金融合规监控系统的工程实践:数据管道、Agent 架构与审计日志
  • 2026 年十大 LLM 网关横评:语义缓存与多提供商故障转移
  • codebase-memory-mcp:毫秒级代码知识图谱MCP服务器,158语言支持
  • Strands Agents:开源AI Agent开发框架,支持Python/TS全生命周期管理
  • 2026年9大开源LLM网关生产级对比:Bifrost领先
  • 用 TigerGraph+MCP 构建自主欺诈调查 Agent
  • Jev 决策模型真实成本拆解:何时省钱何时烧钱
  • 开源CLM-8B:Agent动作评分比Jev快9倍
  • JEV:打破布尔二值困境的类型安全验证方案
  • Claude Opus 5.5降价40%逼近前沿性能
  • VS Code 1.139:Agent 会话首次加载提速约 12 倍
  • 定时 Agent 总重复干活?用完成分类账让它知道什么是「做完」
  • TypeSafe AI Jev 编码指南:类型化决策、置信度校准与推测式广播
  • Vercel Connect 新增 TanStack AI 集成
  • Anthropic与OpenAI 90分钟内相继降价
  • 选LLM API的六个价格陷阱
  • Agent记忆正常仍出错:问题在状态不在记忆
  • Mercury 2.5 推理速度达 770 tokens/秒
  • GitHub Copilot 代码审查新增个人配置选项
  • MCP单人上手容易,团队规模落地是另一回事
  • 影子测试100%一致率背后:模型实际正确率仅75%
  • 两个都通过的测试,代价却不同:重试的隐性成本
  • 定时运行AI Agent输出飘移的根因与修复
  • Anthropic如何两周将Claude.ai速度提升3倍
  • claude-code-templates:一键装配 Claude Code 开发套件,含 100+ Agent/MCP
  • Agent 删改测试必须拦截:CI 合并门禁实操方案
  • Google Antigravity SDK 支持本地 AI 模型:Gemma 4 26B 可离线跑
  • NVIDIA Warp 与 MjWarp 加速机器人仿真工作流
  • HEMA 用 MCP 和 Amazon Bedrock 实现内部 AI 助手转型
  • 五大LLM网关工具生产环境横评
  • GitHub Copilot应用如何渲染百万行PR
  • 基于 AWS 构建 Agent 式视频智能对话系统架构解析
  • Bedrock 上用开源权重模型做 AI 编程助手
  • Anthropic 实验室:Claude 自主发现类 CRISPR 新型酶系统
  • ChatGPT Voice 集成邮件、日历和 Slack:Altman 心中的"Her"更近一步
  • OpenAI GPT-6 Sol/Luna 和 Claude Opus 5.5 同步降价 50%
  • AI 工具循环必须显式传递 Retry-After 头否则必死循环
  • AI 代码补丁静默引入新工具调用:merge 前必须强制契约检查
  • AI 写 API 文档无法区分 null/0/缺省三态:OpenAPI 契约必须显式约束
  • AI 编程 Agent 工具输出遭截断:应记录 stdout_bytes 和截断标志
  • 已加载 51 / 8836
9.0
重磅
AI SCORE
模型发布2026-09-24 11:50

Claude Opus 5.5降价40%逼近前沿性能

dev.to · AI#Anthropic#Claude#成本优化
Editor brief · 编辑速览

Opus 5.5降价后缓存读取从$0.50降至$0.20/M token(降60%),与Fable 5.1基准持平,输出速度快30%。对Agentic工作流成本影响显著。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

本周的主题是成本压缩和网关整合。Claude Opus 5.5 降价登场,无需改动任何代码;同时 Vercel 的 AI Gateway 在一个迭代周期内吸收了四个新模型——GLM-5.3 Flash、DeepSeek V4.1 Flash、Qwen 3.8 Flash 和 Grok 4.7。如果之前你因为成本问题一直在推迟长上下文或多 Agent 工作,现在这笔账得重新算算了。

Claude Opus 5.5:成本降低 40%,达到前沿级性能

Opus 5.5 在 Fable 5.1 基准测试中达到性能持平的同时,成本降低 40%,输出生成速度比前代快 30%。生产部署的核心数字:缓存读取从每百万 Token 0.50 美元降至 0.20 美元——降幅达 60%,在检索密集型或 Agent 模式下,缓存上下文会在多次工具调用中被复用,成本节省会迅速叠加。

这件事现在很关键,因为 Agent 化编码工作流正是 Opus 级模型值得其成本的工作负载,而这类工作负载恰恰也是缓存读取最密集的。你经常要在几十轮对话中反复注入相同的系统提示词、代码库上下文或文档语料。有了 0.20 美元/百万 Token 的缓存读取价格,长上下文推理的单任务成本已经降到了足以让此前处于盈亏边缘的工作流在经济上变得可行的程度。

无需任何 API 变更,无需调整提示词。这是一个纯粹的定价和推理速度更新——如果你的代码固定了 claude-opus-5,只需换一下模型字符串;如果你用的是 latest 别名,则什么都不用动。

结论:上线。如果你的生产环境里跑着 Opus 5,现在就迁移。如果性能持平对你的用例是核心依赖,先在你的内部评测上验证一下,但风险等级很低。缓存密集型工作流会立刻看到 ROI。

GLM-5.3 Flash 登陆 Vercel AI Gateway

智谱 AI 的 GLM-5.3 Flash 现在可以通过 AI Gateway 路由,支持 100 万 Token 上下文和多模态能力。集成只需改一行模型字符串:zai/glm-5.3-flash。Gateway 负责认证、重试逻辑和提供商级别的故障转移——你无需单独管理 Z.ai 的 API Key。

这里的实际价值在于:无需运维开销就能获得提供商的可选性。如果你在对长上下文视觉模型做基准测试,或者需要一个与当前技术栈成本有竞争力的替代方案,GLM-5.3 Flash 现在只需一行代码就能测起来。通过 Gateway 的 CLI 可以直接插入编码 Agent 配置。

结论:评估。如果你已经在用 AI Gateway 且在测试多模态或长上下文替代方案,值得跑一下基准测试。如果还没上 Gateway,切换成本需要先和当前提供商栈做个对比来验证是否值得。

Gemini 3.5 Transcribe 现已在 AI Gateway 可用

Google 的 Gemini 3.5 Transcribe 将基于 WebSocket 的实时转录带入了 AI SDK v7 层面——支持 85+ 语言检测、自定义词汇表和流式输出。Gateway 集成意味着你无需单独管理 Google Speech-to-Text 端点或凭证集。

实时流式处理是这里有意义的技术细节。批量转录是一个已经解决的问题,市面上有很多方案;但低延迟流式处理加语言检测的组合,组装起来要干净利落得多。如果你在做会议转录、实时字幕或语音转操作管道,消除一个独立的提供商集成能同时减少延迟和运维面。

需要 ai@latest 和 @ai-sdk/gateway@latest,以及 16kHz PCM 音频输入。提供了浏览器沙箱可以直接测试。

结论:上线。生产就绪,集成完善,消除了一个独立提供商的依赖。如果实时转录在你的路线图上,这是目前最低摩擦的接入方式。

DeepSeek V4.1 Flash 登陆 Vercel AI Gateway

DeepSeek V4.1 Flash 通过 Gateway 提供,配备 100 万 Token 上下文、视觉支持,以及一套分离的 I/O 处理架构——可通过 Claude Code、Hermes 或任何 OpenAI 兼容客户端访问。需要 Vercel CLI 59.13.1+ 和一个 AI Gateway Key。

分离式 I/O 架构值得关注:它的设计目的是通过解耦输入处理和输出生成来降低高吞吐量推理的成本。对于多 Agent 工作流——许多 Agent 读取共享上下文并生成独立输出——这在大规模场景下会产生影响。视觉支持也消除了需要处理视觉输入推理的 Agent 单独的图片处理步骤。

结论:评估。如果你已经在 Vercel 生态中运行多 Agent 或视觉工作流,值得做一下成本和延迟基准测试。如果你目前是直接访问 DeepSeek 且不需要 Gateway 的重试逻辑或统一计费,这个开销可能带不来什么额外价值。

Qwen 3.8 Flash 现已在 AI Gateway 上线

Qwen 3.8 Flash 为 Gateway 的模型列表增加了 100 万 Token 上下文窗口和 65k 输出窗口——无平台溢价,通过一个 streamText() 模型字符串替换或 Agent 设置 CLI 即可访问。它被定位为编码 Agent 和工具使用场景下具有成本竞争力的选项。

65k 输出窗口是这里的差异化所在。大多数提供长输入上下文的模型在输出上都有显著限制。对于需要生成大型产物的任务——完整文件、详细计划、长篇结构化输出——宽松的输出窗口减少了对多次调用链的需求。

结论:评估。无锁定、无溢价、如果已在 Gateway 上一行代码就能集成。用它跑一下你当前模型在生成密集型任务上的成本和输出质量对比。尝试门槛很低。

Grok 4.7 上线:50 万上下文窗口

SpaceXAI 的 Grok 4.7 已登陆 Gateway,配备 50 万上下文窗口和四档可配置的推理级别:低、中、高和 xhigh。推理级别参数让你可以为每个请求在延迟和深度之间做权衡——当有些任务需要快速浅层推理,有些需要扩展的思维链时,这很有用。40% 折扣截止到 9 月 27 日。

统一端点(spacexai/grok-4.7)在 AI SDK、OpenAI 兼容的 Chat Completions 以及包括 fx、Codex 和 eve 在内的编码 Agent 中均可使用。支持零数据保留和禁止提示词训练——这对于有数据处理要求的团队来说很关键。npx eve@latest init 是最快完成 Agent 设置的路径。

可配置的推理级别是这里最有趣的工程面。推理模型在算力分配上通常是非此即彼的;每个请求级别的调优让你无需在不同用例之间切换模型就能优化推理成本。

结论:评估。折扣窗口让现在成了一个合理的基准测试时机,特别是如果你在为 Agent 任务测试推理模型的话。OpenAI 兼容接口意味着集成摩擦很小。

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
JEV:打破布尔二值困境的类型安全验证方案
下一篇
VS Code 1.139:Agent 会话首次加载提速约 12 倍