用一套低成本问题清单快速识别 AI 宣传中的夸大成分:先用四个便宜问题排除大多数,再用两个贵问题深挖剩余可信声明。
这是这个聚类的摘要页:一套流程,对任何公告、论文摘要、帖子或标题,都可以在两分钟内跑完。问题按成本排序,因为便宜的问题能筛掉大部分 Claims,贵的只值得花在那些活下来的上面。
前四个问题什么都要跑。如果一个 Claim 活下来了,而且你有一个决策依赖它,就跑下一个四个。只有当决策成本很高时,才跑最后两个。重点不是对每个 Claim 给出裁决——大多数 Claim 根本不需要——而是快速判断哪些值得 attention。
两条规则让整个流程生效。第一,来源无法回答的问题,不是 Claim 为假的证明;它告诉你这个 Claim 是未验证的,这和"错误"是不同的状态,而且更有用。第二,把它用在你喜欢的 Claims 上。一份只用来挑刺那些让你不爽的 Claims 的检查清单,不过是用来确认你已有想法的工具。
1 · 到底在 Claim 什么?
用一句话、不带形容词地复述它。大多数看起来 impressively 的标题在这一步都会大幅缩水。"模型达到人类水平性能"通常会变成"模型在一个由作者选择的条件下、在一个小规模人类样本的一个基准上,得分在某误差范围内",这是一个真实的结果,但是不一样的结果。
2 · 这是一个能力 Claim、部署 Claim 还是预测?
这些需要不同的证据,而且经常被混在一句话里。"能做 X"、"在生产环境中做 X"和"到 2030 年能做 X"是三个有着三种不同证据标准的 Claims,而程序员替代这个 Claim 就是这个混淆的标准 worked example。
3 · 来源是谁,主要来源说了什么?
公司博客、新闻稿、预印本、peer-reviewed 论文和新闻摘要是完全不同的东西。最常见的失败不是捏造,而是漂移:每次转述都会漏掉一个限定词,到第四次时,一个留有余地的发现就变成了一个断然的断言。点击进去多看一层通常就能解决。
4 · 和什么比?
没有基线的数字不是结果。比上一个模型好、比人类好、比随机好、比明显的简单方法好——这些是非常不同的 Claims,而最后一个是最常被省略的,因为简单基线往往表现得出奇地好。
5 · 是怎么测量的,答案有没有可能已经在训练数据里?
对于任何基准测试结果,条件决定这个数字有没有意义,而污染问题适用于所有足够老的、已经被爬取过的公共测试集。直接处理这个问题的来源比不处理的来源在做一个强得多的 Claim——这就是为什么污染是默认假设。
6 · 效应量相对于噪声有多大?
把百分比换算回计数。几百条目的基准上差一两个点,往往就在抽样误差范围内,而需要多少条目才能让这个差异显著,算一算只要一分钟。
7 · 成功率是多少,试了多少次?
对于任何被演示而不是被测量的东西,这就是核心问题。一次记录的运行只告诉你一件事是可能的,但不能告诉你它有多经常发生——参见演示和产品之间的鸿沟。
8 · 缺了什么你期望看到的东西?
上一次出现了这一次没有出现的基准测试。轴上缺席的明显的比较器。质量声明旁边的成本。缺席是大多数公告中最informative的东西,也是最难注意到的,因为没有什么会吸引你注意它。
9 · 要让这个为假,什么条件必须为真?
如果你说不出任何一个能让这个 Claim 被证伪的观察,那它就不是一个经验性 Claim——而且这对乐观和悲观的 framing 同等适用。没有日期和没有反证观察的预测是一种情绪。
10 · 它在我自己的输入上能站住吗?
唯一真正能settle anything的问题。五十个来自你自己工作的例子,用你在意的方式打分,胜过发布 post 里每张图——因为基准测试是被一个不知道你在做什么的人选的。构建一小套你自己的测试需要几个小时,而且这是这里唯一产生证据而不是过滤证据的步骤。
像这样的检查清单有一个可预测的失败模式:它变成了一种用来 dismiss 东西的工具,被不对称地使用,而它的使用者最终会更加自信但更加不准确。三条 guard against that。
未验证不等于假。这些问题的输出通常是"我还不确定",而这是正确的输出。把它转换成"已被揭穿"是和相信标题一样的错误,只是姿势更好看。
怀疑也是一种预测。"这不会 work"是可以被打分的,而在这个领域,它已经对一些到来的能力判断错误过。记录你自己的 calls。
把它用在你希望为真的 Claims 上。只有当 Claim 的方向不改变你 press 的力度时,检查清单才值得一用。