前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8836
  • Google DeepMind负责人透露Gemini 4即将发布
  • Impeccable:AI 编程代理的确定性设计语言框架
  • AI Agent 生产环境失败启示录:构建攻击性测试
  • 金融合规监控系统的工程实践:数据管道、Agent 架构与审计日志
  • 2026 年十大 LLM 网关横评:语义缓存与多提供商故障转移
  • codebase-memory-mcp:毫秒级代码知识图谱MCP服务器,158语言支持
  • Strands Agents:开源AI Agent开发框架,支持Python/TS全生命周期管理
  • 2026年9大开源LLM网关生产级对比:Bifrost领先
  • 用 TigerGraph+MCP 构建自主欺诈调查 Agent
  • Jev 决策模型真实成本拆解:何时省钱何时烧钱
  • 开源CLM-8B:Agent动作评分比Jev快9倍
  • JEV:打破布尔二值困境的类型安全验证方案
  • Claude Opus 5.5降价40%逼近前沿性能
  • VS Code 1.139:Agent 会话首次加载提速约 12 倍
  • 定时 Agent 总重复干活?用完成分类账让它知道什么是「做完」
  • TypeSafe AI Jev 编码指南:类型化决策、置信度校准与推测式广播
  • Vercel Connect 新增 TanStack AI 集成
  • Anthropic与OpenAI 90分钟内相继降价
  • 选LLM API的六个价格陷阱
  • Agent记忆正常仍出错:问题在状态不在记忆
  • Mercury 2.5 推理速度达 770 tokens/秒
  • GitHub Copilot 代码审查新增个人配置选项
  • MCP单人上手容易,团队规模落地是另一回事
  • 影子测试100%一致率背后:模型实际正确率仅75%
  • 两个都通过的测试,代价却不同:重试的隐性成本
  • 定时运行AI Agent输出飘移的根因与修复
  • Anthropic如何两周将Claude.ai速度提升3倍
  • claude-code-templates:一键装配 Claude Code 开发套件,含 100+ Agent/MCP
  • Agent 删改测试必须拦截:CI 合并门禁实操方案
  • Google Antigravity SDK 支持本地 AI 模型:Gemma 4 26B 可离线跑
  • NVIDIA Warp 与 MjWarp 加速机器人仿真工作流
  • HEMA 用 MCP 和 Amazon Bedrock 实现内部 AI 助手转型
  • 五大LLM网关工具生产环境横评
  • GitHub Copilot应用如何渲染百万行PR
  • 基于 AWS 构建 Agent 式视频智能对话系统架构解析
  • Bedrock 上用开源权重模型做 AI 编程助手
  • Anthropic 实验室:Claude 自主发现类 CRISPR 新型酶系统
  • ChatGPT Voice 集成邮件、日历和 Slack:Altman 心中的"Her"更近一步
  • OpenAI GPT-6 Sol/Luna 和 Claude Opus 5.5 同步降价 50%
  • AI 工具循环必须显式传递 Retry-After 头否则必死循环
  • AI 代码补丁静默引入新工具调用:merge 前必须强制契约检查
  • AI 写 API 文档无法区分 null/0/缺省三态:OpenAPI 契约必须显式约束
  • AI 编程 Agent 工具输出遭截断:应记录 stdout_bytes 和截断标志
  • Anthropic工程师揭秘:Claude为何越进化写作越差
  • Gemini 3.8 Flash / Flash-Lite TTS 发布:千款语音、30秒克隆、逐行台词控制
  • 工程师详解:新版Claude为何写作风格变得怪异
  • 小米MiMo-V3将搭载HySparse 2:100万Token下KV缓存缩小4.5倍
  • GitHub Copilot 应用新增本地沙箱隔离功能
  • AI Agent 调试指南:重启不是调试,七层架构定位根因
  • AI 加剧软件供应链攻击威胁,行业如何应对
  • 阿里 Qwen Audio 3.1 发布:语音识别/TTS 多模型,API 价格最高降 95%
  • 已加载 51 / 8836
8.0
热点
AI SCORE
模型发布2026-09-24 06:16

Mercury 2.5 推理速度达 770 tokens/秒

Hacker News#LLM#性能优化#推理速度
Editor brief · 编辑速览

Artificial Analysis 数据显示 Mercury 2.5 在推理速度上取得突破,适合对延迟敏感的实时应用场景。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

Released September 2026

Mercury 2.5 在智能水平上略低于平均,但与其同价位其他模型相比定价颇具竞争力。它的一大亮点是速度非常快,且输出相当简洁。该模型支持文本输入、文本输出,上下文窗口为 260k tokens。

Mercury 2.5 在 Artificial Analysis Intelligence Index 上得分为 12,在同类可比模型中处于中位以下( median: 13)。在该 Intelligence Index 的评估中,它生成了 35M 个输出 tokens,相比中位数 85M 相当简洁。

Mercury 2.5 的定价为:输入 $0.25 / 1M tokens(中等定价,中位数: $0.25),输出 $0.75 / 1M tokens(中等定价,中位数: $0.90)。在该 Intelligence Index 上评估 Mercury 2.5,单次任务平均成本为 $0.06。

Mercury 2.5 推理速度达 781 tokens per second,表现相当突出(112)。

Technical specifications

本页展示的是该模型的推理版本(reasoning variant)。

也可能存在一个非推理版本。

175 个同级别模型

指标在同类模型中进行对比:

非推理模型 → 仅与其他非推理模型对比

推理模型 → 跨推理和非推理模型对比

开源权重模型 → 仅与同规模级别的其他开源权重模型对比:

Small: 4B–40B 参数

Medium: 40B–150B 参数

Large: >150B 参数

专有模型 → 与同价格区间的专有和开源权重模型跨类对比,使用 3:1 输入/输出的混合价格比:

$0.15–$1 / 1M tokens

Artificial Analysis Intelligence Index

Artificial Analysis Intelligence Index

Artificial Analysis Intelligence Index v4.3.2 包含:AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1。详见 Intelligence Index methodology,包含各评估项目的细分以及运行方式。

Artificial Analysis Intelligence Index by Open Weights / Proprietary

Artificial Analysis Intelligence Index

Artificial Analysis Intelligence Index v4.3.2 包含:AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1。详见 Intelligence Index methodology,包含各评估项目的细分以及运行方式。

表示模型权重是否开放下载。如果商业使用受条件限制则标记为"Commercial Use Restricted",如果许可证禁止商业使用则标记为"Non-commercial"。

衡量模型在特定能力和行业上的表现

Artificial Analysis Finance & Accounting Index

Intelligence Evaluations

代理知识工作,(Elo-500)/2000

代理现实世界任务,(Elo-500)/2000

代理 SaaS 工作流

代理编程和终端使用

推理与知识

专业文档推理,All-pass

1 - 幻觉率

长上下文推理

法律代理工作,criterion pass rate

代理业务运营

电子表格和文档上的定量分析

Kubernetes 事故根因分析

医疗长上下文推理

Intelligence Evaluation Relevance

虽然模型智能通常可以跨用例泛化,但特定评估对某些用例可能更具参考价值。

Artificial Analysis Intelligence Index

Artificial Analysis Intelligence Index v4.3.2 包含:AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1。详见 Intelligence Index methodology,包含各评估项目的细分以及运行方式。

AA-Briefcase v1.1 已更新

AA-Briefcase Elo 是一个综合指标,聚合了分析质量 Elo、呈现 Elo 和 rubric 通过率,rubric 表现通过合成一对一比赛转换为 Elo。Elo 及 95% 置信区间边界钳制在 0。

AA-Omniscience Index(越高越好)衡量知识可靠性和幻觉率。它奖励正确答案、惩罚幻觉,且对拒答不扣分。分数范围为 -100 到 100,其中 0 表示答对和答错数量相当,负分表示答错多于答对。

Intelligence Index Comparisons

Intelligence Index vs. 每 Intelligence Index 任务的成本

每 Intelligence Index 任务的成本

每个 Intelligence Index 任务的加权平均成本。各评估的成本由输入、缓存命中、缓存写入、推理和回答 token 价格除以任务数计算,再按其 Intelligence Index 权重加权。

Artificial Analysis Intelligence Index

Artificial Analysis Intelligence Index v4.3.2 包含:AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1。详见 Intelligence Index methodology,包含各评估项目的细分以及运行方式。

每个 Intelligence Index 任务的输出 Tokens

每个 Intelligence Index 任务的输出 Tokens

每个 Intelligence Index 任务所需的 token 数。通过将每个评估的输出 tokens 乘以 Intelligence Index 中各基准的相对权重,再除以任务数(不含重复)计算得出。

每 Intelligence Index 任务的成本

每 Intelligence Index 任务的成本

每个 Intelligence Index 任务的加权平均成本。各评估的成本由输入、缓存命中、缓存写入、推理和回答 token 价格除以任务数计算,再按其 Intelligence Index 权重加权。

运行 Artificial Analysis Intelligence Index 的成本

运行 Artificial Analysis Intelligence Index 的成本

运行 Artificial Analysis Intelligence Index 中评估的成本,根据模型的输入、缓存命中、缓存写入、推理和回答 token 价格以及跨评估使用的 token 总数(不含重复)计算。

定价:缓存命中、输入和输出

缓存提示词(之前处理过的)的每 token 价格,通常比常规输入价格有显著折扣,以每百万 tokens 的美元价格表示。这里显示的是缓存命中价格;缓存写入和缓存存储单独计费,且因提供商而异——详见各提供商的缓存定价详情。

用于 RAG 的上下文窗口

更大的上下文窗口与 RAG(Retrieval Augmented Generation)LLM 工作流相关,这类工作流通常涉及对大量数据的推理和信息检索。

输入和输出 tokens 的合并最大数量。输出 tokens 通常有更低的独立上限(因模型而异)。

通过输出速度(tokens per second)测量

模型在生成 tokens 时的每秒接收 token 数(即模型支持流式输出的情况下,从 API 收到第一个 chunk 后开始计时)。

模型性能呈现

数据代表模型第一方 API 的性能,或在没有第一方 API 时跨提供商的中间值。

每个 Intelligence Index 任务的时间

每个 Intelligence Index 任务的时间

每个 Artificial Analysis Intelligence Index 任务的加权平均时间(秒)。通过将每个任务的输出 tokens 除以输出速度,再按 Intelligence Index 中各基准的相对权重加权计算得出。

通过首 token 时间(秒)测量

延迟:首 Answer Token 时间

首 Token 时间

发送 API 请求后收到第一个回答 token 的时间(秒)。对于推理模型,这包含模型在给出答案前的"思考"时间。对于不支持流式的模型,这表示收到完成内容的时间。

端到端响应时间

输出 500 tokens 所需的秒数,根据首 token 时间、推理模型的"思考"时间和输出速度计算

端到端响应时间

端到端响应时间

收到 500 token 响应所需的秒数。关键组成部分:

输入时间:收到第一个响应 token 的时间

思考时间(仅推理模型):推理模型在给出答案前输出 tokens 进行推理的时间。token 数量基于 60 个多样化提示词的平均推理 tokens(方法论详情)。

回答时间:基于输出速度生成 500 个输出 tokens 的时间

模型性能呈现

数据代表模型第一方 API 的性能,或在没有第一方 API 时跨提供商的中间值。

Frequently Asked Questions

关于 Mercury 2.5 的常见问题

Mercury 2.5 何时发布?

Mercury 2.5 于 2026 年 9 月 8 日发布。

Mercury 2.5 由谁创建?

Mercury 2.5 由 Inception 创建。

Mercury 2.5 有多智能?

Mercury 2.5 在 Artificial Analysis Intelligence Index 上得分为 12,在同价格区间其他推理模型中处于中位以下(median: 13)。

Mercury 2.5 有多快?

Mercury 2.5 的生成速度为 780.8 tokens per second(基于 Inception 的 API),在同价格区间其他推理模型中远高于平均(median: 111.8 t/s)。

Mercury 2.5 的延迟是多少?

Mercury 2.5 的首 token 时间(TTFT)为 2.91s(基于 Inception 的 API),在同价格区间其他推理模型中略高于平均(median: 2.23s)。

Mercury 2.5 的费用是多少?

Mercury 2.5 的输入价格为 $0.25 / 1M tokens(优于平均,median: $0.25),输出价格为 $0.75 / 1M tokens(优于平均,median: $0.90),基于 Inception 的 API。

Mercury 2.5 的 API 定价是多少?

Mercury 2.5 的输入价格为 $0.25 / 1M tokens,输出价格为 $0.75 / 1M tokens(基于 Inception 的 API)。混合费率(7:2:1 缓存命中/输入/输出比)为 $0.14 / 1M tokens。定价因提供商而异。比较 API 提供商定价

Mercury 2.5 的输出有多冗长?

在 Intelligence Index 上评估时,Mercury 2.5 生成了 35M 个输出 tokens,在同价格区间其他推理模型中优于平均(median: 85M)。

Mercury 2.5 是推理模型吗?

是的,Mercury 2.5 是推理模型。它使用扩展思考或链式思维推理来处理复杂问题,然后再给出答案。

Mercury 2.5 支持哪些输入模态?

Mercury 2.5 支持文本输入。

Mercury 2.5 支持哪些输出模态?

Mercury 2.5 支持文本输出。

Mercury 2.5 能处理图像吗?

不能,Mercury 2.5 不支持图像输入。它只能处理文本。

Mercury 2.5 是多模态的吗?

不是,Mercury 2.5 不是多模态的。它只支持文本输入。

Mercury 2.5 的上下文窗口是多少?

Mercury 2.5 的上下文窗口为 260k tokens。这决定了模型在单个请求中能处理多少文本和对话历史。

Mercury 2.5 是开源的吗?

不是,Mercury 2.5 是专有模型。模型权重不公开。

Mercury 2.5 有多少参数?

Mercury 2.5 是专有模型,Inception 未披露模型大小或参数数量。

Mercury 2.5 在基准测试上表现如何?

Mercury 2.5 在 Artificial Analysis Intelligence Index 上得分为 12。这个综合基准评估模型在推理、知识、数学和编程方面的表现。

Mercury 2.5 可以通过 API 调用吗?

可以,Mercury 2.5 可通过 1 家提供商访问 API。比较 API 提供商

在哪里可以使用 Mercury 2.5?

Mercury 2.5 可通过 1 家 API 提供商使用。比较提供商

Original source

本文由 AI 翻译整理自 Hacker News,原文版权归原作者所有。

阅读英文原文
上一篇
Agent记忆正常仍出错:问题在状态不在记忆
下一篇
GitHub Copilot 代码审查新增个人配置选项