HuggingFace模型卡整合全量评估基准结果
Hugging Face升级模型页面,集成所有可用基准测试结果,便于程序员快速对比模型性能和选型决策。
Hugging Face升级模型页面,集成所有可用基准测试结果,便于程序员快速对比模型性能和选型决策。
EEE 于 2026 年 2 月上线,是 EvalEval Coalition 发起的一个项目,也是首个致力于改进 AI 评测结果报告方式的跨机构协作项目,覆盖第一方和第三方评测方。Hugging Face 同月推出了 Community Evals,旨在将 Hub 上 benchmark 分数的报告方式去中心化。两者结合,填补了用户、研究人员和政策制定者在信任、理解及选择评测与模型时面临的信息缺口。
评测结果是我们衡量模型能力、横向比较模型,以及分析安全与治理问题的依据,但这些结果目前散落各处,很难进行比较。它们存在于论文、排行榜、博客文章和 harness 日志等不同载体中,每一种都有自己的格式。即便是同一个模型、同一个 benchmark,由不同的人以不同方式运行,也经常会得到不同的分数。例如,LLaMA 65B 在 MMLU 上曾分别被报告为 63.7 分和 48.8 分。我们发现,这类差异可能源于评测设置,而这些设置通常并未在报告中披露。
EEE 是我们针对报告环节给出的解决方案。它用统一的 JSON schema 表示一项评测结果,并记录:
指标的实际含义
【推荐】包含逐样本输出的配套 JSONL 文件。
该 schema 在研究人员和政策研究人员的反馈基础上构建,可以接收来自任何来源的结果,因此无论是 harness 日志、排行榜抓取数据,还是论文中的数值,最终都会被转换成相同的结构。GitHub 仓库中提供了转换器、示例和贡献者指南。自上线以来,Hugging Face 上的 datastore 已增长到约 229,000 条评测结果,覆盖超过 22,000 个模型和 2,200 个 benchmark,数据来自 31 种不同的报告格式。仅从头复现这些运行,成本就可能高达数十万美元。这也充分说明:既然已经有人付出成本生成了这些数据,就不应该任由它们再次散落各处。
你可以在这里进一步了解该 schema 以及如何参与贡献。
现在,它还提供了更完善的集成与归属标注。贡献者可以将 EEE 结果发送到 Hugging Face Community Evals。我们构建了一个转换器,它可以接收你的 EEE 记录,并生成 Hugging Face 所需的小型 YAML 文件,因此你不必再手动用两种格式维护同一项结果。
这项新功能面向所有报告或阅读评测结果的人,而不仅仅是现有的 EEE 贡献者。对自有模型进行报告的第一方评测者,以及对他人模型进行报告的第三方评测者,都可以同时向 Community Evals 和 EEE 提交结果。任何浏览 Hub 的人都能看到这些结果,并追溯至完整记录。当你通过所在组织的 Hugging Face 官方账号提交数据时,你的结果会在 EvalEval 上显示验证勾选标记,向读者表明这些数字直接来自原始来源。本文接下来将介绍 Community Evals 是什么,以及转换器能够完成哪些工作。
Hugging Face Community Evals 由两个部分组成。
一个 benchmark 位于某个 dataset repo 中,并通过添加 eval.yaml 完成注册。注册后,该 dataset 页面会收集并展示一个排行榜,其中包含整个 Hub 上针对该 benchmark 报告的所有分数。官方 benchmark 列表会随着时间推移持续扩充。
模型的分数存放在 model repo 内的 .eval_results/*.yaml 中。它们会显示在 model card 上,同时汇入对应 benchmark 的排行榜。模型作者自行提交的结果,以及其他任何人通过 pull request 提交的结果,都会被聚合在一起。每项分数还会带有 badge,用于说明它是由作者提交、社区提交,还是经过独立验证。任何人都可以通过创建包含正确 YAML 文件的 PR,为任意模型添加分数;模型作者则可以关闭 PR,或在自己的 repo 中隐藏结果。
下面是其中一个排行榜的样子:
Community Evals 在 Hub 上为 Humanity's Last Exam 提供的排行榜
EEE 与 Community Evals 正是在这里协同起来。当你同时向两者发送一项结果时,会发生两件事:第一,你的分数会出现在 Hugging Face 模型页面上,并被收录进相应 benchmark 的排行榜;第二,它会带有一个来源 badge,直接链接回完整的 EEE 记录。generation config、harness 版本、可复现性说明,以及任何实例级数据都会保存在那里。
EEE Datastore 中的一项评测(MMLU-Pro)(a),在文件级别与 Hugging Face model card(b)交叉链接。Source EvalEval badge 会链接到完整的 JSON 记录。
这两个目标位置为了同一个目标承担着不同的职责。Hugging Face 把结果放到人们查看模型的地方,并提供返回来源的链接。EEE 则保存完整的结构化记录,让结果变得可解释,并在此基础上提供 Eval Cards。将数据同时发送到两者,同一项评测就能既被人看见,又能被人读懂——而这正是报告评测结果的意义所在。
你可以在下面看到这种交叉兼容性。上方 model card 中显示的 GPQA 分数,也会呈现在 Eval Cards 中。Eval Cards 会将 EEE 的运行数据与 benchmark、模型的 metadata 组合起来,形成一条可解释的记录。同一项评测,呈现在不同的界面中:
Hugging Face 会将评测分数作为 .eval_results/ 下的 YAML 文件,存储在 model repo 中。必填字段只有 benchmark dataset、task 和 value。source block 则负责创建指向 EEE 的反向链接。
- dataset:
id: openai/gsm8k
task_id: gsm8k
value: 96.8
date: '2024-07-16'
notes: '8-shot CoT'
source:
url: https://huggingface.co/datasets/evaleval/EEE_datastore/blob/main/flat/objects/<xx>/<yy>/<uuid>.json
name: EvalEval
转换器会根据你已有的记录填充这些内容。它将 source_data.hf_repo 映射到 dataset.id,将 evaluation_name 映射到 task_id,将 score_details.score 映射到 value,将 evaluation_timestamp 映射到 date,然后把 datastore object URL 作为 source link 写入,使其指向每条记录对应的 EEE JSON。目前,它支持四个官方 benchmark:MMLU-Pro、GPQA、HLE 和 GSM8K。
转换器所做的不只是调整字段结构。你只需将它指向一个 EEE datastore collection,它就会下载该 collection 及其引用的记录、检查 object hash,并找出能够映射到受支持 benchmark 的分数。在写入任何线上内容之前,它会先审查现有数据:读取模型 main branch 以及开放 PR 中的所有 .eval_results YAML,并基于 dataset 和 task 进行比较,而不是根据文件名比较。如果某个分数已经存在,它会被标记为 already_present;如果存在不同的分数,则会被标记为 score_conflict;如果无法在 Hub 上解析出 model repo,则会被标记为 missing_hf_model。其余所有内容都会被标记为 ready。
没有你的确认,任何内容都不会被推送。该工具会生成本地 YAML 预览文件和可供检查的 review 文件,展示哪些内容已经就绪、哪些仍需处理。只有当你输入 OPEN PRS 并填写 commit message 后,它才会创建 PR。除非传入 --force,否则再次运行时会复用 collection 的缓存结果。
转换器的 review 步骤。被排除的条目——此处为在 Hub 上找不到匹配 repo 的模型——会与其 EEE source URL 一同列出;已经就绪的 PR 则会等待用户明确输入 OPEN PRS 进行确认。
将你的完整记录提交到 EEE datastore。
使用 EEE 只需要多做一个步骤,而且该步骤基本由转换器自动完成。你可以在 GitHub 仓库中找到 community eval converter 工具。要处理一个 collection,请执行以下命令:
uv run tools/hf-community-evals/community_evals_converter.py MMLU-Pro \
--datastore evaleval/EEE_datastore@main
检查它生成的预览和报告,准备提交时输入 OPEN PRS。关于 schema、CLI 和转换器的完整文档位于 evalevalai.com/every_eval_ever/hf-community-evals。
让大型模型展开辩论:首届多语言 LLM 辩论大赛
日本 LLM 开放排行榜正式发布!
· 注册或登录后发表评论