用 MUD 作为 LLM 评估框架的低成本实验,为程序员提供新的模型能力评估思路。创意独特但实用性因项目而异。
任天堂的横井军平用这句话来描述一种设计哲学:采用成熟、廉价、易理解的技术,并以新的方式使用它。CrucibleBench 将这一理念应用于 AI 评估。
我们没有选择照片级逼真的模拟或浏览器自动化,而是从 MUD(多人地下城)入手——早期互联网的持久化文本世界。其约束正是关键:有限的命令空间使幻觉动作可被检测,具有信任和怀疑状态的 NPC 提供明确的社交反馈,而运行内持久化意味着拿走的物品会保持失踪,获得的信任会保持获得。
我们选择 MUD 不是因为它很有魅力。我们之所以选择它是因为其约束使行为可度量。
静态基准测试衡量的是模型在隔离状态下的知识。它们不衡量模型在需要建立信任、信息由关系把关、直接提问会引发怀疑的环境中的行为表现。
01 可枚举的动作空间 7 种命令类型、12 个房间、14 件物品。幻觉动作和错误房间交互是可检测的,动作效率也是可度量的。
7 种命令类型、12 个房间、14 件物品。幻觉动作和错误房间交互是可检测的,动作效率也是可度量的。
02 明确的社交反馈 4 个 NPC 携带信任和怀疑状态(0–100),这些状态根据对话做出响应:是模型可在运行中适应的反馈,或失败表现。
4 个 NPC 携带信任和怀疑状态(0–100),这些状态根据对话做出响应:是模型可在运行中适应的反馈,或失败表现。
03 运行内持久化 拿走的物品保持失踪;获得的信任保持获得。每次运行都会留下探索和规划的完整、可重放的文字记录。
拿走的物品保持失踪;获得的信任保持获得。每次运行都会留下探索和规划的完整、可重放的文字记录。
评分堆栈内单个 LLM judge 组件改变了排行榜顺序达 6 个位置,而每项汇总可靠性统计数据都保持沉默。我们在两种评分配置下报告了每项结果,并将分歧视为本论文最具通用性的发现。
四个已评分的维度中有两个通过对话分类器进行路由,其按模型的与独立 judge 的一致性从 21.7% 到 84.8% 不等,这种不稳定性是汇总 κ = 0.04 永远无法揭示的。移除依赖分类器的维度使六个排名超出场景采样噪声(90% 配对块自助法)。
最大变动的模型与分类器共享一个模型族。使用 LLM judge 的基准应报告每个被试对象的一致性和 judge 消融下的排名稳定性,而不仅仅是汇总可靠性。
在 1–5 标度的评分表上的平均分数,按分类器最小化的小计排序。每个模型 50 次运行:5 个种子 × 2 个目标 × 5 次重复,温度 0.3,通过 OpenRouter 验证费用。排名是探索性的;置信区间在前八名之间基本重叠。完整协议、CI 和统计数据见白皮书。
三种故障模式,每种都通过状态机遥测以算法方式检测,不涉及任何 judge。对话循环是测试的每个模型(包括前沿模型)的主要故障模式。
一次运行中对单个 NPC 执行八条或更多 talk 命令。Agent 重复一个失败的对话方法而不是适应:这是支持代理反复重述自己的持久化世界表现形式。
一次运行中对单个 NPC 执行八条或更多 talk 命令。Agent 重复一个失败的对话方法而不是适应:这是支持代理反复重述自己的持久化世界表现形式。
一个 talk 命令被回应为"没有人在这里"。揭示了世界状态跟踪的丧失,类似于调用不在范围内的 API。Grok 4 是唯一具有显著发生率(12%)的前沿模型。
一个 talk 命令被回应为"没有人在这里"。揭示了世界状态跟踪的丧失,类似于调用不在范围内的 API。Grok 4 是唯一具有显著发生率(12%)的前沿模型。
二十多回合中两个或更少的房间,或五个连续的 look 命令。信息收集永不转化为目标导向的行动。
二十多回合中两个或更少的房间,或五个连续的 look 命令。信息收集永不转化为目标导向的行动。
从运行 03(种子 20260399)的逐字记录:OLMo 向不存在的卫兵问好,试图与一件物品(street_crystal)进行对话,然后在最后 15 个回合中对队长进行循环。
持久化世界行为评估的概念证明。
一个具有隐藏社交目标和基于规则的机制的紧凑 MUD。
一种表面可度量、可解释故障模式的方式。
一项完整的工件发布:650 个文字记录、源代码、评分代码和完整的费用导出。
一个经过验证的通用社交智能的度量。
一个前沿模型的最终排行榜。
(反而)预测真实世界代理部署结果的能力。
关于 LLM judge 无用的声明(相反,这是证据表明它们需要每个被试对象的审计)。
CrucibleBench 是一项独立研究工作。第 2 阶段正在为校准而构建;现已发布一个临时的低/基础/高预算包,最终配额将在试点数据和预注册之后确定。有三种方式可以参与。
fund it · 临时 $3,500 包 build it · 环境、目标、校准 run it · 校准后试点队列
有问题或对私人评估感兴趣?联系 contact@cruciblebench.ai