Artificial Analysis 发布搜索 API 基准排名,GPT-5.6 Luna 模型下 Parallel、Exa、Firecrawl 三个提供商综合表现领先。
Artificial Analysis 发布了"搜索索引"(Search Index),这是一套用于衡量搜索 API 提供商在 AI Agent 质量、成本和速度三个维度表现的基准测试。
首批参测厂商包括 Parallel、Exa、Firecrawl、You.com、Tavily、Keenable 和 Brave。所有参测对象均使用相同模型(GPT-5.6 Luna)在标准化 Agent 配置下进行测试,唯一不同的是搜索服务提供商。Agent 运行在 Artificial Analysis 开源框架 Stirrup 上,每个任务执行 25 次搜索和网页抓取。
该索引由三个等权重基准测试组成。DeepSearchQA 包含 900 道研究问题,每道题需要多次搜索查询。BrowseComp 子集测试 200 个难以找到的事实,需要多步浏览。AA-Omniscience 覆盖六个知识领域的 600 道问题。作为对比基准,一个无工具的版本让模型独立回答问题。
没有搜索功能时,模型仅得 33 分。使用搜索功能后,分数范围在 65 到 75 分之间。Parallel、Exa 和 Firecrawl 分别以 75、74 和 73 分领先。| 图片来源:Artificial Analysis

更高的搜索质量也能降低总体成本。当模型能快速获得良好结果时,消耗的 token 数量会更少。与 Basic 版本相比,Parallel Search(高级版)的 token 使用量下降了超过 40%。单任务搜索成本虽然上升,但总体成本反而更低($0.084 vs. $0.11)。
单次查询的原始速度并不一定意味着整体更快。Parallel Search(turbo)单次响应时间最短(0.51 秒对比 Basic 的 1.03 秒),但其较低的质量(67 分对比 73 分)导致 Agent 需要执行更多轮次,最终每任务总耗时几乎相同。
Artificial Analysis 表示,Parallel、Firecrawl 和 Parallel(turbo)达到了成本与性能的最佳平衡。其他提供商可以申请加入该基准测试。完整的方法论已公开。
无炒作的 AI 新闻 – 人工精选
订阅 THE DECODER,享受无广告阅读、每周 AI 时事通讯、每年六期的独家"AI Radar"前沿报告、完整档案访问权限以及评论区访问权限。