汇总主流 LLM 模型和 API 服务商的性能基准对比,帮助开发者选型和成本评估。
了解 AI 全貌,为你的使用场景选择最佳模型和服务提供商
Intelligence Index v4.1 更新了 GDPval-AA V2、𝜏³-Banking 和 Terminal-Bench v2.1。
根据你对智能水平、速度和成本的优先级,获取个性化推荐。
探索适用于通用工作、编程、客户支持等场景的 Agent。
从能力、定价和平台支持等维度比较 AI Agent。
访问更丰富的 benchmark 数据、自定义可视化、行业报告等内容。
Artificial Analysis Intelligence Index v4.1 包括:GDPval-AA v2、𝜏³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR。有关更多详细信息,包括各项评测的构成及其运行方式,请参阅 Intelligence Index 方法论。
Artificial Analysis Intelligence Index v4.1 包括:GDPval-AA v2、𝜏³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR。有关更多详细信息,包括各项评测的构成及其运行方式,请参阅 Intelligence Index 方法论。
该指标表示模型权重是否可用。如果权重可用,但商业用途受到限制(通常需要购买许可证),则模型会被标记为「Commercial Use Restricted」。
每项 Intelligence Index 任务的加权平均成本。每项评测的成本根据 input、cache hit、cache write、reasoning 和 answer token 的价格计算,再除以任务数量,并按照其在 Intelligence Index 中的权重进行加权。
每项 Intelligence Index 任务的加权平均成本。每项评测的成本根据 input、cache hit、cache write、reasoning 和 answer token 的价格计算,再除以任务数量,并按照其在 Intelligence Index 中的权重进行加权。
Artificial Analysis Intelligence Index v4.1 包括:GDPval-AA v2、𝜏³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR。有关更多详细信息,包括各项评测的构成及其运行方式,请参阅 Intelligence Index 方法论。
Artificial Analysis Intelligence Index v4.1 包括:GDPval-AA v2、𝜏³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR。有关更多详细信息,包括各项评测的构成及其运行方式,请参阅 Intelligence Index 方法论。
模型的相对 Elo 分数,由用户在 Artificial Analysis Speech Arena 中的反馈决定。部分模型可能因尚未获得足够票数而未显示。
Agentic 真实工作任务,(Elo-500)/2000
Agentic 编程与终端使用
推理与知识
1 - 幻觉率
长上下文推理
Agentic 知识工作,Elo
Agentic SaaS 工作流
法律领域的 Agentic 工作,标准通过率
Agentic 业务运营
指令遵循
长周期 Agentic 任务
Kubernetes 事故根因分析
虽然模型的智能水平通常能够迁移到不同使用场景,但某些特定评测可能与特定场景更加相关。
Artificial Analysis Intelligence Index v4.1 包括:GDPval-AA v2、𝜏³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR。有关更多详细信息,包括各项评测的构成及其运行方式,请参阅 Intelligence Index 方法论。
AA-Briefcase 是一项面向长周期知识工作的前沿 Agentic 评测,通过要求 Agent 交付电子表格、演示文稿和备忘录等成果,测试其完成真实业务工作流的能力。
AA-Briefcase Elo 是一个综合指标,汇总了分析质量 Elo、演示质量 Elo 和评分标准通过率,其中评分标准表现会通过合成的两两对战转换为 Elo。Elo 及其 95% 置信区间的上下界均限制为不低于 0。
AA-Omniscience 是一项知识与幻觉 benchmark:它奖励准确回答、惩罚错误猜测,并全面展示哪些模型能够在不同领域生成事实可靠的输出。
AA-Omniscience Index(越高越好)衡量知识可靠性和幻觉情况。它奖励正确回答、惩罚幻觉,拒绝回答不会受到惩罚。分数范围为 -100 至 100,其中 0 表示正确与错误回答数量相同,负分表示错误回答多于正确回答。
GDPval-AA v2 评估 AI 模型在广泛职业领域中完成真实且具有经济价值任务的能力。
Artificial Analysis Openness Index 根据模型不同组成部分的可用性和透明度,评估模型的「开放」程度。
每项 Intelligence Index 任务所需的 token 数量。计算方式是:将每项评测的输出 token 数量乘以各 benchmark 在 Intelligence Index 中的相对权重,再除以任务数量(不包括重复运行)。
每项 Intelligence Index 任务的加权平均成本。每项评测的成本根据 input、cache hit、cache write、reasoning 和 answer token 的价格计算,再除以任务数量,并按照其在 Intelligence Index 中的权重进行加权。
运行 Artificial Analysis Intelligence Index 各项评测的成本,根据模型的 input、cache hit、cache write、reasoning 和 answer token 价格,以及各项评测所使用的 token 数量计算得出(不包括重复运行)。
已缓存 prompt(此前处理过)的每 token 价格,通常比常规 input 价格低很多,以每百万 token 的美元价格表示。此处显示的是 cache hit 价格;cache write 和 cache storage 会单独计费,且各服务提供商的收费方式不同——详情请参阅「各服务提供商的 Cache 定价」。
API 请求或消息中所包含内容的每 token 价格,以每百万 token 的美元价格表示。
此处显示的混合 cache 价格仅使用 cache hit 价格。其他缓存成本因服务提供商而异:
Anthropic:单独收取 cache write 费用,5 分钟和 1 小时 TTL 的费率不同(1 小时 TTL 更贵)。
Google(Vertex/Gemini):除了 cache hit 价格外,还按小时收取 cache storage 费用。部分服务提供商还会对超过 200K token 的 prompt 采用阶梯定价。
OpenAI、DeepSeek 等:通常只收取 cache hit 费用,不收取 write 或 storage 费用。
完整明细请参阅 Prompt Caching。
模型生成内容的每 token 价格(即从 API 接收的 token),以每百万 token 的美元价格表示。
相关数据代表模型第一方 API 的性能(例如 o1 对应 OpenAI);如果没有第一方 API,则采用各服务提供商数据的中位数(例如 Meta 的 Llama 模型)。
模型生成 token 时每秒接收的 token 数量(对于支持 streaming 的模型,从收到 API 返回的第一个 chunk 后开始计算)。
相关数据代表模型第一方 API 的性能(例如 o1 对应 OpenAI);如果没有第一方 API,则采用各服务提供商数据的中位数(例如 Meta 的 Llama 模型)。
每项 Artificial Analysis Intelligence Index 任务的加权平均耗时(秒)。计算方式是:用每项任务的输出 token 数量除以输出速度,再按照各 benchmark 在 Intelligence Index 中的相对权重进行加权。
规模较小的新兴服务提供商正在以有竞争力的价格提供很高的输出速度。
每 token 价格,以每百万 token 的美元价格表示。该价格根据所选比例,对 cache hit、input 和 output token 价格进行混合计算(默认 cache-input-output 比例为 7:2:1)。
模型生成 token 时每秒接收的 token 数量(对于支持 streaming 的模型,从收到 API 返回的第一个 chunk 后开始计算)。
相关数据采用过去 72 小时的中位数(P50),以反映持续性的性能变化。
已缓存 prompt(此前处理过)的每 token 价格,通常比常规 input 价格低很多,以每百万 token 的美元价格表示。此处显示的是 cache hit 价格;cache write 和 cache storage 会单独计费,且各服务提供商的收费方式不同——详情请参阅「各服务提供商的 Cache 定价」。
API 请求或消息中所包含内容的每 token 价格,以每百万 token 的美元价格表示。
此处显示的混合 cache 价格仅使用 cache hit 价格。其他缓存成本因服务提供商而异:
Anthropic:单独收取 cache write 费用,5 分钟和 1 小时 TTL 的费率不同(1 小时 TTL 更贵)。
Google(Vertex/Gemini):除了 cache hit 价格外,还按小时收取 cache storage 费用。部分服务提供商还会对超过 200K token 的 prompt 采用阶梯定价。
OpenAI、DeepSeek 等:通常只收取 cache hit 费用,不收取 write 或 storage 费用。
完整明细请参阅 Prompt Caching。
模型生成内容的每 token 价格(即从 API 接收的 token),以每百万 token 的美元价格表示。
模型生成 token 时每秒接收的 token 数量(对于支持 streaming 的模型,从收到 API 返回的第一个 chunk 后开始计算)。
相关数据代表模型第一方 API 的性能(例如 o1 对应 OpenAI);如果没有第一方 API,则采用各服务提供商数据的中位数(例如 Meta 的 Llama 模型)。