Orionfold Proof 为每次评估生成 config hash 和 Rerun API,任何人用相同输入可重新执行并得到相同结果,解决 AI 基准测试不透明、无法复现的行业痛点。
大多数你看到的 AI 基准测试都是截图。一个数字,一张图表,一句自信的陈述说哪个模型赢了。你无法重新运行它们。你无法改动一个输入然后看结果如何变化。你只能相信作者的说法,而作者有充分的理由选择那个看起来最好的结果。
我不想再做一个生成截图的工具。我想要的是相反的东西:一个你可以拿起、重新运行、亲自验证的结果。所以 Orionfold Proof 生成的每张收据底部都带有一小段字符串,而那个字符串就是整个想法的核心。
这是来自一张真实收据的内容,那个四十亿参数的模型在我的笔记本上得了 18/21 分:
Run id: run_a9014d0871ab
Config hash: 50c38b0b7439 (identical inputs reproduce this hash)
Rerun: POST /api/runs { "dataset_id": "advisor-curveball-v0.2",
"candidate_ids": ["ollama:hf.co/Orionfold/Advisor-GGUF"], ... }
那个 50c38b0b7439 就是 config hash。它是根据所有决定结果的东西计算出来的:数据集、具体的例子候选项、prompt、评分标准。输入相同的配置,得到的就是同样的十二个字符,每次都一样。收据甚至告诉你如何复现它。Rerun 那一行就是生成这条结果的真实请求。
这不是输出的校验和(checksum)。而是配置的指纹(fingerprint)。这意味着两个在不同机器上、从未互相交流过的人,可以运行同一个 proof 并确认他们运行的是同样的东西,因为 hash 匹配了。结果变成了你可以验证的事实,而不是你必须信任的说法。
hash 有用是因为它对变化是诚实的。动了任何关键的东西,它就会变化。
换模型,hash 就变了:你证明的是另一个东西。在数据集中改一个例子,hash 就变了:你的测试已经不是你引用时的那个测试了。放宽评分阈值让模型看起来更好,hash 变了,任何持有旧收据的人都能看出你改了题目。
最后一种情况是静默保护。基准测试造假最常见的方式不是捏造数字,而是移动球门柱。运行一下,不喜欢结果,调一下阈值,再运行,发表那个好看的。这种操作在 config hash 下无所遁形。那张说 86% 且 hash 为 A 的收据,和那张说 86% 但 hash 为 B 的收据,不是同一个声明,区别就在那十二个字符里。
我上周在自己身上抓到了这个。我对同样的三个模型跑了两次相同的治理基准。第一次我忘了给模型指令,三个都惨淡地得了 1/21,hash 是 b6fa4ce299ef。第二次我提供了合同,它们分别得了 18、17、16,hash 是 88403c2fc4e7。两个不同的 hash,两个不同的结果,没有歧义哪个是哪个。hash 不允许我悄悄假装第一次运行从未发生,或者假装第二次才是唯一的运行。如果我只给你看那个好看的数字,收据上的 hash 就会和我声称运行的基准不匹配。即使在我宁愿不是这样的时候,指纹也让我保持诚实。
这背后有一个更深的原因,而且它回到这个工具是为谁服务的这个问题。
使用 Proof 的人通常是在为别人决定该信任什么:客户、团队、未来的自己(那时他们已经忘了细节)。仪表盘是用来观看的。收据是用来交接的。它是你附在提案上的 artifact,是你在 NDA 下给客户看而不会泄露 key 的东西,是你在六个月后仍能调出来重新运行以验证它仍然成立的那条记录。
所以收据才是产品,而 hash 是让它成为收据而不是截图的东西。它是被签名的。它是可以重新运行的。它有意地记录了失败和成功,因为只有讨好人的记录才是谨慎的买家会扔掉的那种。
config hash 并不能让结果变得正确。它只是让结果变得可复现,这是另一个不同且更小的承诺。可复现的基准仍然可能问了一个糟糕的问题、用糟糕的 rubric 打分、或者根本量错了东西。hash 只保证如果你运行了我运行的,你会看到我看到的。
但这个更小的承诺是几乎其他人都没有做出的,它是所有其他东西的基础。在你能同意"运行了什么"之前,你无法争论一个基准是否测量了正确的东西。hash 让你到达那条线。之后,争论就是关于问题本身,那是值得进行的争论。
这就是整个理念:在你自己的机器上自己证明,随时重新运行证明。你可以在 orionfold.com/proof 看到它产出的内容,包括其他故事背后的收据。
Originally published at orionfold.com.