前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
返回 AI 情报前线
All News · 全部资讯9294
  • Cursor 修复命令注入漏洞后仍可被绕过(CWE-78)
  • LLM调用生产API的工程教训:别做快乐演示
  • 提示词与契约:让 AI 代理稳定执行的关键区别
  • LLM API 价格周刊:Qwen3.6 27B 生成价格降幅达44%
  • LLM只训练小学以下内容会怎样
  • 生产支持新范式:AI Agent从告警到自动根因分析
  • Anthropic 生物武器过滤系统停摆近一年,1.33 亿请求未审查
  • 本地 LLM 显存实测:Q4 量化实际比标称重 23%
  • 10 分钟测试你的 AI Agent 是在推理还是背答案
  • AI 自动化 SEO 实验:Claude Code 每日一更的 42 周数据
  • 数据漂移排查:先查滚动条再查数据库
  • Google 开源 DESIGN.md:让 AI 编码工具读懂视觉规范
  • 4美元/月 DigitalOcean + vLLM 部署 Claude 3.5 Haiku 推理服务
  • 强到弱脚手架:推理时提升弱模型性能的新方法
  • 我用OKF、CLAUDE.md和Skills大幅降低LLMToken消耗
  • Gemini 3.7 Flash 与 Qwen3.8-27B 发布:编程能力大幅提升
  • 4.8万星开源项目:在浏览器里跑完整AI Agent流水线
  • 给编程Agent一个可复现的失败,而非模糊需求
  • 多Agent系统规模化实战:Hermes与LobeHub架构复盘
  • 262k上下文模型在33k处崩溃的根因分析
  • AI基准测试平台Optima:用自有数据评估模型成本与性能
  • 用免费模型写一个最小复现服务器
  • CI不适合重复调用模型——改用免费服务器边车
  • MCP传输协议:stdio与HTTP如何选,及已废弃的旧版SSE方案
  • 用skilleval给Agent技能写自动化测试
  • 多租户Chatbot成本可视化的工程选型:OpenAI兼容API vs 原生API
  • 调查:五分之一美国工作者将任务委托给AI
  • 程序员视角:快速识别AI生成的网站
  • 认证聊天机器人流式后端的测试策略
  • GLM 5.3发布:基于5.2后训练刷新,编程评测开源SOTA
  • Code Agent运行机制详解:ReAct循环的工程实现
  • SharePoint 认证绕过漏洞 CVE-2026-55040 PoC 已公开
  • Node.js 长文本摘要:结构化输出校验与分块策略
  • 千问办公公测:GLM-5.3 与 DeepSeek V4 Pro 可直接选用
  • DeepSeek Harness 引发 Node.js 安装潮
  • GPT-5.6推理token按输出计费:成本估算可能偏差4倍
  • 开源模型评测工具:上线前用测试用例验证便宜模型
  • Anthropic缓存命中率低:实际节省分析
  • 多模态 LLM 生产级成本优化:视觉输入压缩与路由策略
  • SpaceX 60亿美元收购 Anysphere:Origin git平台才是真正的标的
  • DeepSeek 峰谷定价实战:Spring Boot 调度模式压榨成本
  • 昇腾 0 Day 适配小红书 dots3-note:全模态+投机解码
  • LabLLM:Mac 原生 App 从零训练小型语言模型
  • CLI-Anything:用标准接口让所有软件获得AI Agent原生支持
  • 长上下文没有杀死RAG:成本、延迟、可靠性三大陷阱
  • 一条YAML微调8B模型:4GB显存本地即可
  • 上下文已成平台能力:内部平台团队的新责任
  • 别信"完成了":强制AI Agent在报告前重新拉取真实状态
  • AI通过律师资格考试却不会比大小:理解AI的「参差不齐前沿」
  • Codex自动化研究:CUDA内核232倍加速实战
  • MCP令牌压缩91%:JSON Schema优化实践
  • 已加载 51 / 9294
8.0
热点
AI SCORE
工具产品2026-08-16 13:50

AI基准测试平台Optima:用自有数据评估模型成本与性能

The Decoder#AI评测#基准测试#模型选型
Editor brief · 编辑速览

Artificial Analysis推出自定义AI基准测试平台,支持用户用自己数据和工作流测试模型,可同时对比质量、成本和响应时间,对Agent场景尤其有价值。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

Artificial Analysis 发布了 Optima,一个让用户能够构建针对特定用例定制 AI 基准测试的平台。

测试可以基于用户自己的数据源或对目标场景的描述,包含示例输入和输出。Optima 随后不仅会对比 AI 模型的质量,还会对比每个任务的成本和每个任务的耗时。

该平台解决了通用基准测试对实际应用而言用处有限的问题。自定义基准测试在方法论上是否合理、能否真正捕捉实际业务价值,仍然取决于其设计方式。

Optima 让用户构建自定义基准测试,并在质量、成本和速度三个维度对比 AI 模型在其特定用例上的表现。

Optima tackle AI benchmarking's biggest flaw by letting users test models against their own data

Artificial Analysis 以其独立的 LLM 评估和基准测试实现(如 GDPval-AA 和 AA-Briefcase)闻名,该公司近日推出了一款名为 Optima 的新平台。其理念很简单:公开基准测试按预设的任务和标准对比模型表现,但并不能真正揭示哪个模型最适合某个特定用例。Optima 旨在通过针对个人工作流程量身定制的对比来弥补这一差距。

用户可以使用自己的数据、工作流程,或对用例的描述来构建基准测试,然后跨主流模型运行并对比质量、每个任务成本和每个任务耗时方面的结果,Artificial Analysis 表示。Optima 现已可用。

三条路径构建自定义基准测试

Optima 接受多种类型的源材料。用户可以从自己的文件或 Hugging Face 上传现有评估数据集,也可以上传来自 Arize、Braintrust 或 Langfuse 等平台的 AI Agent 追踪记录。开发者还可以安装一个技能,该技能会从其编码环境和过往会话中收集信息,Artificial Analysis 写道。

没有这类数据的用户也可以描述其预期的用例,并提供示例输入和输出。然后 Optima 会生成建议的测试输入、评估标准和示例任务。用户可以在运行实际基准测试前通过反馈进行审查和调整。

两种评分方式可选:基于评分标准(rubric)对照客观标准进行评估,或采用 Artificial Analysis 在 GDPval-AA 和 AA-Briefcase 等基准测试中也使用的成对比较法。在成对比较法中,用户首先对一组样本响应进行评估,并指出自己偏好哪个答案。然后 Optima 从这些偏好中推导出测试数据集上的完整排名。

成本和速度成为一等比较指标

除了原始模型质量外,Optima 还追踪每个任务成本和每个任务耗时作为独立的比较维度。这使得检查某个性能提升是否真的值得付出更高成本或更长处理时间成为可能。

对于 Agentic 应用,仅看原始 token 价格几乎毫无意义。更便宜的模型如果需要更多尝试、更频繁失败或需要额外清理工作,最终成本可能反而更高。每个已完成任务的成本往往才是更有意义的数字。

据 Artificial Analysis 报道,早期测试者构建了针对金融和会计 Agent 的基准测试,以找出在质量没有重大损失的情况下能将成本降低十倍的模型。还有人测试哪个模型最匹配律师的写作风格,或最准确识别专有图像数据集中的元素。

在构建和运行基准测试时,Optima 仅收取所用模型的实际 token 成本,不加价,Artificial Analysis 表示。基于评分标准的评估每个标准每模型收费 $0.125,成对比较每次收费 $0.375。在基准测试创建、每次基准测试运行和每轮评估开始时,平台会根据成本估算持有余额,然后按实际发生的使用量和评估成本进行计费。

为什么通用基准测试不够用

Optima 解决了 AI 基准测试的一个公认问题。Epoch AI 的一项分析表明,基准测试结果取决于很少披露的实现细节。不同的提示词措辞和 temperature 设置导致同一模型在不同配置下得分明显不同。对于 SWE-bench 等 Agentic 基准测试,仅更换 scaffold(即 Agent 的控制软件和工具环境)就能造成高达 15 个百分点的差异。

一项更广泛的研究审查了 445 篇来自顶级 AI 会议的基准测试论文,发现了更多系统性问题。几乎所有论文都至少在一个方面存在方法论缺陷,包括定义不清、样本不具代表性以及缺少统计验证。研究中只有约 10% 的基准测试使用了反映实际应用场景的完整真实任务。推理或对齐等关键概念往往定义模糊,限制了从中得出结论的可靠性。

Optima 可以解决通用基准测试无法捕捉特定用例的问题。但基准测试更深层的方法论挑战并不会因此消失。即使有了针对自己任务定制的基准测试,其有效性仍取决于目标能力定义的精确程度、测试案例的代表性,以及评估的实现和文档记录方式。

还有另一个值得牢记的限制。即使是每个任务的成本和耗时,也不能告诉你产出对业务的实际价值。如果一个廉价快速的 AI 工作流程结果需要大量返工或对其所属流程贡献甚微,它仍然可能是低效的。

Original source

本文由 AI 翻译整理自 The Decoder,原文版权归原作者所有。

阅读英文原文
上一篇
262k上下文模型在33k处崩溃的根因分析
下一篇
用免费模型写一个最小复现服务器