Mercury 2:扩散模型加速推理新范式
新型 LLM Mercury 2 采用扩散技术优化推理速度,为 AI 应用开发提供更高效的推理引擎选项。
新型 LLM Mercury 2 采用扩散技术优化推理速度,为 AI 应用开发提供更高效的推理引擎选项。
Mercury 2 免费 token 限时 10 倍
Mercury 2 免费 token 限时 10 倍。立即领取
今天,我们正式推出 Mercury 2——全球速度最快的推理语言模型,旨在让生产环境中的 AI 获得即时响应般的体验。
生产环境中的 AI 早已不再是一次 prompt、一次回答,而是由循环组成:Agent、检索流水线,以及在后台大规模运行的抽取任务。在循环中,延迟并非只出现一次,而是会在每一个步骤、每一位用户和每一次重试中不断累积。
然而,目前的 LLM 依然面临同一个瓶颈:自回归的顺序解码。每次生成一个 token,按照从左到右的顺序进行。
Mercury 2 不采用顺序解码。它通过并行细化来生成回答,同时产出多个 token,并在少量步骤内逐步收敛。它不像打字机逐字输出,更像编辑一次修改整份草稿。最终效果是:生成速度提高 5 倍以上,并拥有一条从根本上不同的速度曲线。
这种速度优势也改变了推理能力所面临的取舍。如今,更高的智能意味着投入更多测试时计算资源——更长的思维链、更多采样和更多重试——而代价则直接体现为更高的延迟与成本。基于 Diffusion 的推理,可以让你在实时延迟预算内获得推理级别的质量。
Mercury 2 改变了生产部署中的质量与速度曲线:
速度:在 NVIDIA Blackwell GPU 上达到 1,009 tokens/sec
速度:在 NVIDIA Blackwell GPU 上达到 1,009 tokens/sec
价格:每 100 万个输入 token 0.25 美元 · 每 100 万个输出 token 0.75 美元
价格:每 100 万个输入 token 0.25 美元 · 每 100 万个输出 token 0.75 美元
质量:可与领先的速度优化型模型竞争
质量:可与领先的速度优化型模型竞争
功能:可调节推理 · 128K 上下文 · 原生工具调用 · 符合 schema 的 JSON 输出
功能:可调节推理 · 128K 上下文 · 原生工具调用 · 符合 schema 的 JSON 输出
我们优化的是用户真正能够感受到的速度:用户实际使用时的响应能力——高并发情况下的 p95 延迟、各轮交互之间的一致表现,以及系统繁忙时依然稳定的吞吐量。
“Inception 的 Mercury 2 展示了新模型架构与 NVIDIA AI 基础设施相结合时所能实现的可能性。在 NVIDIA GPU 上突破每秒 1,000 个 token,充分体现了我们平台在性能、可扩展性和通用性方面的优势,足以支持覆盖完整范围的 AI 工作负载。”
Shruti Koparkar,NVIDIA 加速计算事业部产品高级经理
Mercury 2 擅长对延迟敏感、绝不能牺牲用户体验的应用场景。
自动补全、下一处编辑建议、重构、交互式代码 Agent——在这些开发者身处循环之中的工作流里,任何停顿都会打断心流。
“建议出现得足够快,让人感觉它就是你思考过程的一部分,而不是某个必须等待的东西。”
Max Brunsfeld,Zed 联合创始人
Agent 工作流会在每项任务中串联数十次推理调用。降低单次调用的延迟,不仅可以节省时间,还会改变你能够负担多少个执行步骤,以及最终输出所能达到的质量。
“我们现在正利用最新的 Mercury 模型,智能地优化大规模广告活动的执行。通过呈现洞察并实时动态增强投放,我们正在推动更出色的效果、更高的效率,以及更具韧性的 AI 驱动型广告生态系统。这项进展进一步强化了我们对自主广告的承诺:由智能系统持续优化执行,为客户交付可衡量的成果。”
Adrian Witas,Viant 高级副总裁兼首席架构师
“我们一直在评估 Mercury 2,因为它在延迟和质量方面无可匹敌,对实时转写文本清理和交互式 HCI 应用尤其有价值。其他模型在速度上都远远无法接近 Mercury!”
Sahaj Garg,Wispr Flow CTO 兼联合创始人
“Mercury 2 的速度至少是 GPT-5.2 的两倍,这对我们来说足以改变整个局面。”
Suchintan Singh,Skyvern CTO 兼联合创始人
语音界面有着 AI 领域最严苛的延迟预算。Mercury 2 让推理级别的质量能够在自然语音节奏下真正落地。
“我们打造的是能够与真人实时对话、栩栩如生的 AI 视频头像,因此低延迟不是什么锦上添花的功能,而是一切的基础。Mercury 2 为我们的语音技术栈带来了重大突破:快速、一致的文本生成,让整个体验始终保持自然、有人情味。”
Max Sapo,Happyverse AI CEO 兼联合创始人
“Mercury 2 的质量非常出色,模型的低延迟也让语音 Agent 能够更及时地响应。”
Oliver Silverstein,OpenCall CEO 兼联合创始人
多跳检索、重排序和摘要的延迟会迅速叠加。Mercury 2 让你可以在不突破延迟预算的前提下,把推理能力加入搜索循环。
“我们与 Inception 的合作,让搜索产品中的实时 AI 真正具备了实用性。SearchBlox 的每一位客户,无论来自客户支持、合规、风险、分析还是电子商务领域,都能在其全部数据中获得亚秒级智能能力。”
Timo Selvaraj,SearchBlox 首席产品官
Mercury 2 现已开放使用。
试用 Mercury 2 API
试用 Mercury 2 API
在 Chat 中试用 Mercury 2
在 Chat 中试用 Mercury 2
Mercury 2 与 OpenAI API 兼容。可以直接接入你现有的技术栈——无须重写。
如果你正在进行企业级评估,我们将与你合作,在预期的服务约束下完成工作负载适配、评测设计和性能验证。
Mercury 2 已正式上线。欢迎来到 Diffusion 时代。
LLM 的未来已经到来
LLM 的未来已经到来