AI 基础设施公司公开 30,101 次真实 Agent 调用的完整可重算数据,提出用加密哈希收据替代截图/转录进行 Agent 行为审计。
你的 AI Agent 刚刚告诉你工作完成了。仪表盘是绿的,总结是自信的,语气是友善的。但它真的做了那件事吗?它调用了 API,还是编造了一个响应?它运行了四十分钟,还是卡住后写了一份像样的总结?如果你无法打开一条记录去核实,你就不是在管理一个 Agent。你是在相信一个故事。
这个问题悬在当下每一个生产级 AI 部署的上空:当你的 Agent 说"完成了",证据在哪?业界对这个问题有一个词,词是 receipt。不是截图。不是转录。而是一份可验证的收据:一份机器可读的记录,精确记录了 Agent 执行了什么,带有一个你可以自己校验的加密哈希。
我们运行的就是颁发这些收据的基础设施。所以我们做了一件简单的事,就我们所知也是罕见的事:我们公开了自己的账本。这份报告里的每一个数字都来自 Zambo 的公开端点,抓取于 2026-09-24,而且每一个数字都可以被任何读到这篇文章的人重新计算。没有调查。没有抽样。没有"受访者"。只有真实的记录:30,101 次真实的 AI 工具调用,对应机器可读审计日志中 34,184 份公开收据。
在展示发现之前,有一点需要披露,正是这点披露让这些发现才有价值。
这份数据集是 30,101 次通过 Zambo 公开 MCP 层执行的工具调用,跨越 631 天的持续运行,机器可读审计日志中有 34,184 份公开收据。大多数流量是自动化操作:Agent、定时任务,以及使用免费层的活动程序。它不是 30,000 个用户。任何告诉你他们的遥测数据代表了 30,000 个独立用户而实际上它只代表了他们自己的 cron 任务的人,是在向你推销东西,而我们不打算那么做。
这里说说为什么这些数据仍然重要。每一个调用,无论是人类还是自动化留下的,都留下了相同的产物:一份可验证的收据,带有哈希、时间戳和一个你可以重新检查的输出。这份报告要回答的问题不是"我们有多少用户"。而是"完整覆盖是什么样的",因为在现实中,答案通常是零。当今一次普通的 AI Agent 调用留下零条可验证记录。我们的每次都留下一条。这种对比就是整份报告的意义所在。
Zambo 的公开审计日志携带了 34,184 份收据,对应 30,101 次记录的 MCP 工具调用,平台的规则说得明白:"每个 MCP 工具调用都会生成一份收据,包含工具名称、状态和输出哈希。"覆盖率不是你启用的功能。它是默认值,而且整个日志是机器可读的。
平台已上线 631 天,平均每天约 48 次工具调用,在数据拉取当天有 174 次调用。这不是发布周的峰值。这是近两年来一个执行层每日履行职责,且每一条执行记录过后仍可打开查看。
最繁忙的工具是 capability_search:3,509 次调用,占全部 30,101 次记录的 11.7%。发现主导了执行:Agent 行动之前,先搜索自己能做什么。平台暴露了 132 个工具,其中 119 个至少被使用过一次。长尾是真实存在的,但能力查询是那扇正门。
打开任意一份收据,你会得到相同的结构:唯一 id、被调用的工具、成功或失败状态、输出的 SHA-256 哈希,以及 UTC 时间戳。这就是证据的解剖结构。你无需任何权限去验证它,也无需信任调用方。哈希与输出要么匹配,要么不匹配。
除了收据,还有 119 份证明通过平台的证明层获得了认证。收据说的是"这是发生的事"。一份认证证明更进一步:它将记录锚定,使后续的篡改可被检测。收据是问责的基本单位;证明是系好安全带的收据。
审计日志还追踪国库感知的 token 消耗:Recorded 调用中累计消耗了 1,948,550 $ZAMBO,只在交易签名确认后才计入。未经确认的消耗不计入。最后这个细节比那个数字重要。一套拒绝计入无法确认之物的系统,是一套真正思考过"可验证"实际上需要什么的系统建造的。
以下是公开日志中一份真实的收据,与本报告同期拉取:
id: e35ddf51-7ae5-4f63-8936-ca1182078c7d
tool: zambo_universal
status: success
output_hash: sha256:75c0ffc00eaafa5cd4c8005932a1d07ca5eefbe94767eca1c057b208e07316d9
timestamp: 2026-09-24T15:27:33.855Z
就这样。没有营销话术,没有信任徽章,没有"经我们专有 AI 验证"。五个字段。哈希让任何人都能确认输出自调用运行以来未曾改变。时间戳将事件固定在时间中。状态在你阅读其总结之前就告诉你调用是否成功。比较一下,当你问"证明一下",你的当前 Agent 给你的是什么:一段自信的段落。
这也是让收据在 AI 之间可移植的原因。当你在项目中途从 Claude 切换到 ChatGPT,或从 Cursor 切换到终端 Agent 时,收据就是连续性:新的 AI 不必相信旧的 AI 说的话。它可以打开收据,查看实际执行了什么。这就是跨 AI 连续性背后的想法,而收据是让这个想法变成现实而非只是愿景的机制。
这份数据产生了三个实际后果。
第一,审计不再是一个项目。如果每次调用默认留下收据,你不需要每个季度花力气重建你的 Agent 做了什么。记录从每次调用返回的那一刻起就存在了,格式是机器可读的。合规团队和客户安全审查不会再问"你能证明吗",因为证明就是一个 URL。
第二,调式变得诚实。当一个 Agent 在凌晨 3 点失败时,收据告诉你哪个调用失败了、它的输入是什么、以及输出哈希是什么,在任何人写复盘报告之前。你停止争论 Agent"可能"做了什么。记录没有观点。
第三,客户信任变得可演示。如果你销售由 Agent 执行的工作,收据就是"相信我,AI 做了"与"这是记录,你自己检查"之间的差别。这个差别值的钱,也是收据正在成为 Agent 工作问责单位的原因,就像发票成为人类工作问责单位一样。
我们分析了 30,101 次真实的 AI Agent 工具调用及其留下的 34,184 份公开收据,发现了一个系统:每次调用都留下可核查记录、未经确认的价值永远不计入、整个审计日志是公开且机器可读的。业界默认是每次调用零份收据。从零到 34,184 的差距,就是相信你的 Agent 与验证你的 Agent 之间的差距。