Exa推出协调数千个子代理进行列表构建的深度研究API,在WANDR等4个基准上超越Opus 5.5和GPT-6 Astra,可用于大规模实体枚举和信息抽取。
Exa 发布了 Agent Ultra,这是其 Exa Agent API 的最高努力等级(effort level)。它专为必须穷尽运行的研究而构建:大规模列表构建、实体丰富化,以及需要数千个来源的问题。Exa 团队报告称,Ultra 在 4 个研究基准上击败了 Opus 5.5、GPT-6 Astra 和 Perplexity Agent,且均为最高努力等级设置。
可以,作为托管 API。Agent Ultra 今天已在 Exa API 上线,只需设置 effort: "ultra"。它不是开放权重模型,无法自托管。
Exa Agent 将任务拆分为子任务,并分配子代理同时研究多个领域。它将前沿模型路由到需要它们的步骤,在足够的地方使用更快的模型。Ultra 是消耗最多算力的模式。根据 Agent Ultra 文档,它比其他任何模式运行时间更长,以返回最完整的结果。
Ultra 任务通常需要约 30 分钟完成,极难任务可能需要长达 3 小时。
以下所有数据均来自 Exa 的发布文章。竞争对手均以最大努力等级运行。
| 基准(指标) | Agent Ultra | Opus 5.5 | GPT-6 Astra | Perplexity Agent |
|---|---|---|---|---|
| WANDR(软召回) | 81.4% | 72.3% | 26.0% | 40.1% |
| DeepSearchQA(F1) | 93.9% | 77.6% | 85.3% | 89.7% |
| WideSearch(行级 F1) | 58.9% | 51.6% | 54.7% | 56.0% |
| Company Find-All(每任务平均通过实体数) | 2,451 | 146 | 113 | 98 |
Exa 为每项结果配对了成本声明:
这些收益是相对值,不是百分点差。在 WANDR 上,与 Opus 5.5 的绝对差距为 9.1 分。
WANDR 是 Perplexity 的 500 个广度和深度数据收集任务基准,使用开放评测工具。Exa 的评分器共享上游评估逻辑:替换 Exa 作为搜索工具、更改传输逻辑,并使用 gpt-6-luna 作为评判模型。对于在该基准上已发布结果的供应商,Exa 报告该数字;否则由 Exa 自行运行基准测试。
DeepSearchQA 是 Google DeepMind 的 900 条多步搜索提示词基准。WideSearch 测试广泛信息收集。Exa 对 WANDR 和 DeepSearchQA 各评估了最多 200 个任务,对 WideSearch 和 Company Find-All 各评估了 100 个任务。评分任务数因供应商而异。所有结果均由供应商报告,尚未独立复现。
Exa 列出了 3 个目标用户群体:
模型提供商:汇编训练数据,例如实现某一技术的所有论文和代码库。验证标准如「已发布权重,不仅仅是 API」。
金融服务:构建尽职调查市场地图、跨文件和法院记录运行 KYC 研究,以及监控投资组合信号。
市场推广团队:构建账户列表并用判断字段丰富行数据,每个结果都有引用的 URL 作为支撑。
Ultra 还可以扩展现有列表。传入已有的行,这些行会被排除在新结果之外。
Ultra 使用标准 Agent run 端点。请求支持 outputSchema、input.data 和流式输出。
from exa_py import Exa
exa = Exa()
run = exa.agent.runs.create(
query="Find all companies building browser automation tools in the United States.",
effort="ultra",
)
run = exa.agent.runs.poll_until_finished(run.id, timeout_ms=3 * 60 * 60 * 1000)
print(run.stop_reason)
定价:按标准 Agent 使用量计费,单次运行默认上限 20 美元。提前完成的任务费用更低。
预算:maxCostDollars 接受 1 到 100 美元。maxDurationSeconds 接受 300 到 10800 秒。
停止:调用 stop 会提前结束运行、保留其结果,并按使用量计费到该时间点。
超时:SDK 轮询辅助函数默认 1 小时超时,因此需设置更长的超时时间或使用流式事件。
OpenAI 兼容性:在 /responses 上,设置 reasoning.effort: "ultra",配合流式或后台模式使用。
你可以在 Exa API Playground 中试用。
Agent Ultra 是 Exa Agent 的最高努力模式,现已通过 API 上线。
它编排并行子代理并混用前沿模型和更快的模型。
Exa 在 WANDR、DeepSearchQA、WideSearch 和 Company Find-All 上均报告了最高分。
运行费用默认最高 20 美元,可在 1 到 100 美元之间调整。
典型运行约需 30 分钟,上限 3 小时。
查看 Technical Details。本项目所有功劳归研究人员所有。也欢迎在 Twitter 上关注我们,别忘了加入我们的 150k+ ML SubReddit 并订阅我们的 Newsletter。等等!你用 telegram 吗?现在也可以加入我们了。
想与我们合作推广你的 GitHub Repo 或 Hugging Face Page 或产品发布或网络研讨会吗?联系我们
Michal Sutter 是数据科学专业人士,拥有帕多瓦大学数据科学硕士学位。凭借在统计分析、机器学习和数据工程方面的坚实基础,Michal 擅长将复杂数据集转化为可操作的洞察。