Artificial Analysis推出自定义AI基准测试平台,支持用户用自己数据和工作流测试模型,可同时对比质量、成本和响应时间,对Agent场景尤其有价值。
Artificial Analysis 发布了 Optima,一个让用户能够构建针对特定用例定制 AI 基准测试的平台。
测试可以基于用户自己的数据源或对目标场景的描述,包含示例输入和输出。Optima 随后不仅会对比 AI 模型的质量,还会对比每个任务的成本和每个任务的耗时。
该平台解决了通用基准测试对实际应用而言用处有限的问题。自定义基准测试在方法论上是否合理、能否真正捕捉实际业务价值,仍然取决于其设计方式。
Optima 让用户构建自定义基准测试,并在质量、成本和速度三个维度对比 AI 模型在其特定用例上的表现。
Optima tackle AI benchmarking's biggest flaw by letting users test models against their own data
Artificial Analysis 以其独立的 LLM 评估和基准测试实现(如 GDPval-AA 和 AA-Briefcase)闻名,该公司近日推出了一款名为 Optima 的新平台。其理念很简单:公开基准测试按预设的任务和标准对比模型表现,但并不能真正揭示哪个模型最适合某个特定用例。Optima 旨在通过针对个人工作流程量身定制的对比来弥补这一差距。
用户可以使用自己的数据、工作流程,或对用例的描述来构建基准测试,然后跨主流模型运行并对比质量、每个任务成本和每个任务耗时方面的结果,Artificial Analysis 表示。Optima 现已可用。
三条路径构建自定义基准测试
Optima 接受多种类型的源材料。用户可以从自己的文件或 Hugging Face 上传现有评估数据集,也可以上传来自 Arize、Braintrust 或 Langfuse 等平台的 AI Agent 追踪记录。开发者还可以安装一个技能,该技能会从其编码环境和过往会话中收集信息,Artificial Analysis 写道。
没有这类数据的用户也可以描述其预期的用例,并提供示例输入和输出。然后 Optima 会生成建议的测试输入、评估标准和示例任务。用户可以在运行实际基准测试前通过反馈进行审查和调整。
两种评分方式可选:基于评分标准(rubric)对照客观标准进行评估,或采用 Artificial Analysis 在 GDPval-AA 和 AA-Briefcase 等基准测试中也使用的成对比较法。在成对比较法中,用户首先对一组样本响应进行评估,并指出自己偏好哪个答案。然后 Optima 从这些偏好中推导出测试数据集上的完整排名。
成本和速度成为一等比较指标
除了原始模型质量外,Optima 还追踪每个任务成本和每个任务耗时作为独立的比较维度。这使得检查某个性能提升是否真的值得付出更高成本或更长处理时间成为可能。
对于 Agentic 应用,仅看原始 token 价格几乎毫无意义。更便宜的模型如果需要更多尝试、更频繁失败或需要额外清理工作,最终成本可能反而更高。每个已完成任务的成本往往才是更有意义的数字。
据 Artificial Analysis 报道,早期测试者构建了针对金融和会计 Agent 的基准测试,以找出在质量没有重大损失的情况下能将成本降低十倍的模型。还有人测试哪个模型最匹配律师的写作风格,或最准确识别专有图像数据集中的元素。
在构建和运行基准测试时,Optima 仅收取所用模型的实际 token 成本,不加价,Artificial Analysis 表示。基于评分标准的评估每个标准每模型收费 $0.125,成对比较每次收费 $0.375。在基准测试创建、每次基准测试运行和每轮评估开始时,平台会根据成本估算持有余额,然后按实际发生的使用量和评估成本进行计费。
为什么通用基准测试不够用
Optima 解决了 AI 基准测试的一个公认问题。Epoch AI 的一项分析表明,基准测试结果取决于很少披露的实现细节。不同的提示词措辞和 temperature 设置导致同一模型在不同配置下得分明显不同。对于 SWE-bench 等 Agentic 基准测试,仅更换 scaffold(即 Agent 的控制软件和工具环境)就能造成高达 15 个百分点的差异。
一项更广泛的研究审查了 445 篇来自顶级 AI 会议的基准测试论文,发现了更多系统性问题。几乎所有论文都至少在一个方面存在方法论缺陷,包括定义不清、样本不具代表性以及缺少统计验证。研究中只有约 10% 的基准测试使用了反映实际应用场景的完整真实任务。推理或对齐等关键概念往往定义模糊,限制了从中得出结论的可靠性。
Optima 可以解决通用基准测试无法捕捉特定用例的问题。但基准测试更深层的方法论挑战并不会因此消失。即使有了针对自己任务定制的基准测试,其有效性仍取决于目标能力定义的精确程度、测试案例的代表性,以及评估的实现和文档记录方式。
还有另一个值得牢记的限制。即使是每个任务的成本和耗时,也不能告诉你产出对业务的实际价值。如果一个廉价快速的 AI 工作流程结果需要大量返工或对其所属流程贡献甚微,它仍然可能是低效的。