FACTS 基准:量化测量 LLM 的幻觉问题
Google DeepMind 发布系统化的 LLM 事实性评估工具集。对 LLM 研究和生产环境的模型选型有参考价值。
Google DeepMind 发布系统化的 LLM 事实性评估工具集。对 LLM 研究和生产环境的模型选型有参考价值。
大型语言模型(LLM)正越来越成为各种用例中信息传递的主要来源,因此它们的回答在事实上的准确性至关重要。
为了继续在这个行业范围内的挑战上改进性能,我们需要更好地理解模型难以提供准确回答的使用场景类型,并在这些领域更好地衡量事实性能。
今天,我们与 Kaggle 携手推出 FACTS Benchmark Suite。它扩展了我们之前开发的 FACTS Grounding Benchmark 的工作,包括三个额外的事实性基准:
一个 Parametric Benchmark,用于衡量模型在事实问答使用场景中准确访问其内部知识的能力。
一个 Search Benchmark,用于测试模型使用搜索作为工具来检索和正确综合信息的能力。
一个 Multimodal Benchmark,用于测试模型以事实正确的方式回答与输入图像相关的提示的能力。
我们也在用 Grounding Benchmark - v2 更新原始的 FACTS grounding 基准,这是一个扩展基准,用于测试模型在给定提示的上下文中提供答案的能力。
每个基准都经过精心策划,共产生了 3,513 个示例,我们今天将其公开发布。与之前的版本类似,我们遵循行业标准做法,保留一个评估集作为私有集。FACTS Benchmark Suite Score(或 FACTS Score)计算为四个基准中公开集和私有集的平均准确率。Kaggle 将负责 FACTS Benchmark Suite 的管理,包括拥有私有保留集、在基准上测试领先的 LLM,以及在公开排行榜上展示结果。有关 FACTS 评估方法的更多详情可以在我们的技术报告中找到。
FACTS Parametric 基准评估模型在不借助网络搜索等外部工具的情况下准确回答事实问题的能力。基准中的所有问题都是由用户兴趣驱动的"琐碎事实"风格问题,可以通过维基百科(LLM 预训练的标准资源)来回答。最终基准由 1052 项公开集和 1052 项私有集组成。
公开集中的典型提示需要模型回答关于利基主题的简单问题,例如:"谁在《洛克福德档案》主题歌中吹奏了口琴?"
相比之下,FACTS Search 基准评估模型使用网络搜索工具回答问题的能力。该基准的设计目的是即使 LLM 可以访问网络也具有挑战性,通常需要依次检索多个事实来回答单个查询。所有模型都可以使用相同的网络搜索工具,确保在没有自定义网络检索设置这一混淆因素的情况下单独测试模型能力。FACTS Search 包含一个 890 项公开集和一个 994 项私有集。
公开集中包含以下示例是因为它需要从多个网页检索信息:"1960 年夏季奥运会上击败 Vazik Kazarian 的英国拳击手、在同一届奥运会男子轻次中量级项目中也参赛的摩洛哥拳击手,以及在 1960 年和 1964 年夏季奥运会上都参赛的丹麦拳击手,这三人的出生年份之和是多少?"
FACTS Multimodal 基准评估模型根据基于图像的问题生成事实准确文本的能力,这是现代多模态系统的关键功能。
这个任务需要整合视觉基础,即它能否准确解释和连接来自视觉输入的信息,同时利用其内部或"参数"世界知识。评估框架旨在确保回答既正确又提供所有必要的信息以实现完整性。该基准由 711 项公开集和 811 项私有集组成。
例如,公开集中的以下图像配有提示出现在 Multimodal 基准中:"这个动物属于什么科?"
我们在 FACTS Benchmark Suite 上评估了领先的 LLM,其中包括更新的 FACTS Grounding v2。
下表列出了 15 个领先模型及其总体 FACTS 分数(其后是四个单独基准的分数细分:Grounding、Multimodal、Parametric 和 Search)。
Gemini 3 Pro 在整体性能上领先,FACTS Score 为 68.8%。特别是,我们看到从 Gemini 2.5 Pro 到 Gemini 3 Pro 在 Search 和 Parametric 分片上有显著改进,其中 FACTS Search 上的错误率降低了 55%,FACTS Parametric 降低了 35%。FACTS Multimodal 总体上得分最低。所有评估的模型都实现了 70% 以下的整体准确率,为未来进展留下了相当大的空间。
除了 FACTS Benchmark Suite,Gemini 在事实性上的改进也反映在另一个事实性基准 SimpleQA Verified 上,从 Gemini 2.5 Pro 上的 54.5% 准确率提高到 Gemini 3 Pro 上的 72.1% 准确率。SimpleQA Verified 在短格式回答上测试 LLM 的参数知识。
虽然 LLM 事实性仍然是正在进行的研究领域,但 FACTS Benchmark Suite 和 Gemini 3 Pro 的结果代表了谷歌对让信息普遍易得和有用的长期承诺。我们希望这项工作能促进对 LLM 事实性更深入的研究,为依赖它们的人们开发更好、更准确的模型和产品。