Google开源的Inspect Viz工具可将AI模型评估结果渲染为热力图,在演示场景中直观对比多个LLM在多工具任务上的表现差异,解决数字堆砌难以向非技术人员传达的问题。
用 Inspect Viz 可视化 AI 评估
欢迎回到我们关于运行、分析和可视化 AI 评估的博客系列。上一次我们讨论了如何使用 inspect eval 和 inspect view 设计和运行评估以进行分析和可视化。许多方法(如重新排列仪表板列并对其进行排序,以确定模型间差异和技能有无差异)可以让你对整个领域有一个宏观的了解。虽然这能激发进一步和更深入的探索,但在预测性如何以及如何向他人传达发现方面会遇到问题。想象以下场景:
想象一位数据科学负责人需要在一场高风险、时间紧迫的现场会议中,展示四个 LLM 候选者在十个内部工具上的性能细分。在演示屏幕上重新排序和筛选多维度的评估数据难以阅读,还需要和观众一起做心算:引人入胜的内容,他们当然不会在此过程中睡着。
如果换一种方式,你有一个工具可以轻松自动化渲染不同配置之间的比较呢?如果按模型或按技能排列它们能显示清晰易读的图案呢?
好吧,让我向你介绍热力图!热力图是一种二维视觉矩阵,其中颜色强度代表数值大小——在我们的例子中,是二次曲线精度分数。通过利用人眼区分颜色梯度的自然能力,热力图可以在一目了然中立即揭示性能谱系。这使得因变量和自变量之间的趋势变得清晰、直观且高度易读。
虽然你可以简单阅读并学习使用 inspect viz 为 inspect AI 评估生成热力图,但如果打算跟着操作并重新创建图表,请先复制第一篇文章中的步骤,然后再回来。
注意:本博客系列包含 AI 生成的图表以及实际截图和两者的人工编辑。AI 还协助了轻微的文字编辑。
跟着做的要求
对于在家跟着做的读者,为了完成以下操作,你需要在环境中安装 inspect_viz 库(以及 inspect_ai 和 pandas)。
从这里,查看热力图脚本。虽然脚本有一些复杂性(例如建立其 CLI API),但脚本主要包装了 scores_heatmap(viz_data, orientation="horizontal", ...) 并整合我们的数据来组装热力图。
如果运行脚本:
python3 inspect_viz_heatmap.py logs -o heatmap.html
你将得到一个类似以下的可视化结果。

这个热力图有两个轴:模型轴(垂直)允许你将分析直观地分解到同一模型的技能包含情况,另一个是技能轴(水平),沿行向下允许你展示模型的变化如何影响评估。
利益相关者(如投资者或你的老板)现在可以一目了然地发现技能收益和模型上限,而无需逐行阅读日志值。一些快速要点:
高性能配置(如 3.6-flash + gemini_api_skill 达到 1.0)在高强度颜色中脱颖而出
在这个数据集的聚合二维热力图视图中,3.6-flash 在跨评估技能配置的平均分数上比 3.5-flash-lite 更高。
在保持其他条件相同的情况下,技能倾向于提高分数。

图注:inspect viz 热力图通过将各个任务样本和轮次折叠到模型和技能轴上的聚合精度单元格,将我们的完整评估矩阵投影到二维平面上。
认知负担与商业智能分析过渡
虽然矩阵记分牌可以快速显示跨模型的精度差异,但原始热力图存在关键限制:
二维约束:热力图只将两个轴映射到单一颜色强度(在我们这里是精度)。
缺失业务上下文:单一热力图无法同时显示 token 成本、系统延迟或操作可靠性。
隐藏方差:折叠给定配置的样本会移除确定结果是一致还是极度不稳定所需的信息。
为了将 CLI 日志与交互式、多维度和深入的报告连接起来,我们需要一个将原始遥测指标导出到电子表格和商业智能仪表板的管道。
在第三部分中,我们将构建一个 Python 脚本,首先在 Google Sheets 中处理输出数据,最终到 Data Studio!