前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
返回 AI 情报前线
All News · 全部资讯9295
  • Gemini 3.7 Flash 发布:编程+Agent 能力大幅提升,价格腰斩
  • LLM Agent 重试机制的可观测性设计实践
  • Qwen 3.8 27B 发布:本地运行出色但默认过度思考
  • 客服AI智能体架构详解:从问答型到工作流执行型
  • Anthropic在Claude输出中嵌入水印引发写作伦理争议
  • 免费AI接口429错误被吞?用Relay转发元数据
  • 用AI高效写API文档的5个实战技巧
  • 我用Python写了个检测硬编码密钥的CLI工具
  • Stripe超70亿美元收购AI网关OpenRouter
  • AI Agent盘活多仓库遗留项目:OpenCode+SpecKit实战
  • AI Agent五层架构详解:Graph Engineering为何是缺失的那环
  • GhostSplice攻击:利用MCP协议碎片化提示窃取SSH密钥
  • 本地优先AI宣言:模型主权与隐私保护新思路
  • 紧急:SharePoint认证绕过漏洞CVE-2026-55040正被积极利用
  • Agent的State、Memory、Checkpointing不是一回事
  • 受监管行业LLM基础设施检查清单
  • 无限画布性能架构:视口虚拟化与空间索引
  • AI 编程 Agent 的 harness 才是决定因素:同一模型最大 23.8 分差距来自它
  • OpenCode 源码解读:MIT 开源 AI Agent Harness 内部机制全解析
  • AI Coding Agent 的 prompt 格式正在标准化:规则/流程/记忆如何引导代码修改
  • Same input, same receipt:让 AI 基准测试结果可验证、可复现
  • Claude Mythos + Project Glasswing 已发现超一万个高危漏洞
  • GraphQL N+1 排查新法:数 Resolver 调用次数而非响应延迟
  • Grok 4.6:后训练优化突破Scaling Law,成本不变性能跃升
  • 用免费模型从数据库迁移文件自动生成Seed数据,告别手写Fixture
  • AI生成服务的安全审计:systemd能力边界检查实战
  • Attention机制原理深度解析:逐行代码讲解Transformer核心
  • 2026年AI API成本实测:开源开发者的省钱指南
  • 9个多模态API实战对比:成本与效果实测
  • Kimi K3的2.8T参数不是最难部分:MoE推理系统工程分析
  • 做AI产品别先上RAG:汽车检测AI架构教训
  • 向量检索的精确匹配盲区:RAG检索架构补全方案
  • AI日报:DeepSeek调价、智谱发布最强代码模型、Anthropic隐藏模型
  • AI生成文本中的隐藏字符:零宽空格等陷阱
  • 安全运行AI生成代码:E2B/Modal/Piston实战对比
  • DebugClip:把 DevTools 上下文一键贴给 AI 的 Chrome 插件
  • 我从月均$400 的 GPT-4o 切换到国产开源模型,节省了 95% 成本
  • AI生成代码的隐性维护成本:三个月后的真实代价
  • llama.cpp作者Georgi Gerganov:开源丰碑
  • DeepRead:溯源式AI阅读工具,区分事实与推断
  • 别把数据库连接串发给AI工具:正确做法在此
  • Claude Code周报:可靠性工程与工具链实践
  • 用HyperNexus消除MCP配置碎片化:企业级RBAC实践
  • dbctx:将PostgreSQL编译为LLM友好上下文的Go工具
  • SGLang 深度解析 CUDA Graph 推理优化技术
  • AI写令牌桶限流器的评测方法:假时钟+真实HTTP验证
  • AI改配置文件的变更账本:merge前的回滚保障机制
  • AI声称C++锁多余但竞态检测器打脸:真实案例分析
  • 免费模型输出必须加Schema校验层
  • 用toolcontract检测模型更新是否破坏Agent工具调用
  • 顶尖数学家:LLM 是强计算器但缺乏真正创造力
  • 已加载 51 / 9295
8.0
热点
AI SCORE
工具产品2026-08-17 03:28

Same input, same receipt:让 AI 基准测试结果可验证、可复现

dev.to · AI#AI 基准#可复现#开源
Editor brief · 编辑速览

Orionfold Proof 为每次评估生成 config hash 和 Rerun API,任何人用相同输入可重新执行并得到相同结果,解决 AI 基准测试不透明、无法复现的行业痛点。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

大多数你看到的 AI 基准测试都是截图。一个数字,一张图表,一句自信的陈述说哪个模型赢了。你无法重新运行它们。你无法改动一个输入然后看结果如何变化。你只能相信作者的说法,而作者有充分的理由选择那个看起来最好的结果。

我不想再做一个生成截图的工具。我想要的是相反的东西:一个你可以拿起、重新运行、亲自验证的结果。所以 Orionfold Proof 生成的每张收据底部都带有一小段字符串,而那个字符串就是整个想法的核心。

十二个字符

这是来自一张真实收据的内容,那个四十亿参数的模型在我的笔记本上得了 18/21 分:

Run id:      run_a9014d0871ab
Config hash: 50c38b0b7439   (identical inputs reproduce this hash)
Rerun:       POST /api/runs { "dataset_id": "advisor-curveball-v0.2",
             "candidate_ids": ["ollama:hf.co/Orionfold/Advisor-GGUF"], ... }

那个 50c38b0b7439 就是 config hash。它是根据所有决定结果的东西计算出来的:数据集、具体的例子候选项、prompt、评分标准。输入相同的配置,得到的就是同样的十二个字符,每次都一样。收据甚至告诉你如何复现它。Rerun 那一行就是生成这条结果的真实请求。

这不是输出的校验和(checksum)。而是配置的指纹(fingerprint)。这意味着两个在不同机器上、从未互相交流过的人,可以运行同一个 proof 并确认他们运行的是同样的东西,因为 hash 匹配了。结果变成了你可以验证的事实,而不是你必须信任的说法。

改一个输入,hash 就变

hash 有用是因为它对变化是诚实的。动了任何关键的东西,它就会变化。

换模型,hash 就变了:你证明的是另一个东西。在数据集中改一个例子,hash 就变了:你的测试已经不是你引用时的那个测试了。放宽评分阈值让模型看起来更好,hash 变了,任何持有旧收据的人都能看出你改了题目。

最后一种情况是静默保护。基准测试造假最常见的方式不是捏造数字,而是移动球门柱。运行一下,不喜欢结果,调一下阈值,再运行,发表那个好看的。这种操作在 config hash 下无所遁形。那张说 86% 且 hash 为 A 的收据,和那张说 86% 但 hash 为 B 的收据,不是同一个声明,区别就在那十二个字符里。

我上周在自己身上抓到了这个。我对同样的三个模型跑了两次相同的治理基准。第一次我忘了给模型指令,三个都惨淡地得了 1/21,hash 是 b6fa4ce299ef。第二次我提供了合同,它们分别得了 18、17、16,hash 是 88403c2fc4e7。两个不同的 hash,两个不同的结果,没有歧义哪个是哪个。hash 不允许我悄悄假装第一次运行从未发生,或者假装第二次才是唯一的运行。如果我只给你看那个好看的数字,收据上的 hash 就会和我声称运行的基准不匹配。即使在我宁愿不是这样的时候,指纹也让我保持诚实。

为什么是收据,而不是仪表盘

这背后有一个更深的原因,而且它回到这个工具是为谁服务的这个问题。

使用 Proof 的人通常是在为别人决定该信任什么:客户、团队、未来的自己(那时他们已经忘了细节)。仪表盘是用来观看的。收据是用来交接的。它是你附在提案上的 artifact,是你在 NDA 下给客户看而不会泄露 key 的东西,是你在六个月后仍能调出来重新运行以验证它仍然成立的那条记录。

所以收据才是产品,而 hash 是让它成为收据而不是截图的东西。它是被签名的。它是可以重新运行的。它有意地记录了失败和成功,因为只有讨好人的记录才是谨慎的买家会扔掉的那种。

config hash 并不能让结果变得正确。它只是让结果变得可复现,这是另一个不同且更小的承诺。可复现的基准仍然可能问了一个糟糕的问题、用糟糕的 rubric 打分、或者根本量错了东西。hash 只保证如果你运行了我运行的,你会看到我看到的。

但这个更小的承诺是几乎其他人都没有做出的,它是所有其他东西的基础。在你能同意"运行了什么"之前,你无法争论一个基准是否测量了正确的东西。hash 让你到达那条线。之后,争论就是关于问题本身,那是值得进行的争论。

这就是整个理念:在你自己的机器上自己证明,随时重新运行证明。你可以在 orionfold.com/proof 看到它产出的内容,包括其他故事背后的收据。

Originally published at orionfold.com.

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
AI Coding Agent 的 prompt 格式正在标准化:规则/流程/记忆如何引导代码修改
下一篇
Claude Mythos + Project Glasswing 已发现超一万个高危漏洞