MIT等机构提出"精神世界建模"框架,在传统物理模拟基础上加入信念、意图等心理变量,使弱模型也能在复杂社会场景中做出更准确的行为预测。
世界模型旨在成为自主 AI Agent 的底层基础设施,用于预测某个动作执行后场景如何变化。但一篇新论文指出,当前这代系统忽略了一个关键组件:相关人员头脑中正在发生的事情。
Sora、Genie 3、JEPA、Marble 等现有世界模型只建模了世界的物理层,论文指出:物体、位置、运动、遮挡。这些人所在世界中他们的信念、欲望或社会规范认知从未出现在他们的状态空间中。对于服务机器人、医疗助手或协作 Agent 而言,这远远不够——因为隐藏的心理状态在很大程度上驱动着人类行为。
作者用一个简单例子说明了这一差距。如果某个人的杯子在他没注意时被放进了橱柜,纯物理世界模型看到的场景是正确的。但它仍然会预测出错误的下一个动作。只有同时追踪这个人对杯子位置信念的模型,才能解释他实际会做什么。

他们的框架名为"心理世界建模"(Mental World Modeling,MWM),已在 GitHub 上发布,将心理变量(如信念、注意、目标、意图、情绪、规范和社会关系)引入经典世界模型。目标 Agent 只看到第一人称的部分视角,而世界模型则持有完整状态。
每个动作都分为物理载体(如说话、指向、抓取)和心理载荷(如安慰、欺骗或拒绝)。同一个把杯子滑过桌面的动作,可能是道歉、欺骗或关怀之举。只有世界模型持有区分这些的变量。
MWM 将物理和心理世界状态耦合,为目标 Agent 渲染第一人称视角,并模拟动作如何改变两种状态。

作者明确声明并不声称在模拟意识。心理状态是从行为和上下文推断的假设,而非测量结果。基于该框架构建的系统应该表达不确定性并保持其假设透明。
为了验证这一理论,研究者构建了 MENTIS,一个无需额外训练的模块化管道。它将过程分解为六个步骤。首先,解析场景并渲染自我视角。然后将动作选项分解为物理和心理组件,并在并行中模拟结果状态。
每个分支再根据三个标准评分:物理合理性、心理一致性和社会适当性。之后,管道做出确定性决策。每个阶段都会输出机器可读的中间结果,因此错误可以追溯到具体步骤。
MENTIS 将每个响应选项拆分到各自的模拟分支中,之后才进行选择,按心理一致性、物理合理性和社会适当性评分。

评估方面,作者构建了 Menti-Bench,这是一个包含 448 个决策场景的数据集:320 个文本描述、100 个图片故事和 28 个音视频片段。每个场景包含六个响应选项和一个人类创建的参考解决方案,记录的不仅是正确答案,还有底层心理和物理状态。其中 78% 的场景涉及至少两个角色。
团队测试了八个语言模型,包括来自 OpenAI 的五个(其中有 GPT-5.6-Sol 和 GPT-4.1)和来自 Anthropic 的三个(Claude Fable 5、Claude Opus 4.8、Claude Haiku 4.5)。作者使用 F1 分数作为准确率指标,结合了所选动作的精确率和召回率。
在所有模型中,随着每个建模层的加入,分数都在攀升。直接回答得分为 63.3。自洽性——即模型回答同一问题六次并选择最常见响应——将其推至 77.9。完整 MWM 管道达到 87.9。人类在同一协议下达到 98.5。
每增加一个建模层,预测效果都会提升,而移除心理或物理通道都会导致两位数的 F1 分数损失。

这些收益无法通过多次采样直接答案来复制。MWM 下最弱的模型(GPT-4.1,84.9)超过了使用直接回答加自洽性的最强模型(GPT-5.6-Sol,83.6)。进一步测试证实了框架的核心假设。没有心理通道,模型平均下降 12.1 分。没有物理通道,下降 16.5 分。当两个转换被独立预测而非耦合时,损失 6.4 分。
最大的单一效果来自提供正确的状态转换,确定下一状态模拟是核心瓶颈。

心理建模的影响在理论预测的位置最大。在人际场景中,F1 分数提升了 26.4 分。在以物体为中心的场景中,收益仅为 14.0。较弱的基座模型比较强的模型从显式结构中受益更多。MWM 与直接回答之间的差距在 GPT-4.1 上为 28 分,但在 GPT-5.6-Sol 上仅为 21 分。
完整世界模型的优势在隐藏心理变量驱动决策的地方最大,而在不同应用领域保持一致。

为了精确定位与人类表现剩余差距的来源,作者用人类参考解决方案替换各个管道阶段。最大的单一收益来自完美的状态转换(+3.5 分),其次是完美的初始状态(+2.8)和完美的观察(+1.7)。当所有中间步骤都被参考解决方案替换时,管道达到 97 分。
结构化状态弥补了图像和视频输入的缺点,对媒体通道的干预证实系统实际使用了视觉和音频证据。

大约 80% 的剩余差距可归因于中间阶段(主要是转换模拟)的预测错误。根据作者的说法,未来的改进应从这里开始。挑战不在于描述当前状态,而在于模拟耦合的物理-心理世界如何变化。
世界模型是继纯语言模型之后的重大押注。最近卸任 Google Deepmind 运营负责人的 Demis Hassabis 表示,他将大部分研究时间花在这一主题上,并预期这些系统将迎来"ChatGPT 时刻"。投资者正在向 Odyssey 等初创公司倾注数亿美元。但究竟什么才算世界模型仍然存在争议。由北京大学牵头的国际团队最近提出了一个更狭窄的定义,将 Sora 等文生视频模型排除在外,因为它们缺乏与现实世界的反馈循环。Yann LeCun 多年来一直认为生成式方法是死胡同,转而支持抽象表示。这篇新论文将 Sora、Genie 和 JEPA 归为同一家族,并批评它们都有同样的遗漏。
心理状态问题回到了语言模型一直苦苦挣扎的一个研究领域。Meta FAIR 实验室与华盛顿大学和卡内基梅隆大学的一个团队已经表明,模型在要求苛刻的心智理论测试中表现不佳,而在追踪世界状态方面比在归属信念方面做得更差。MWM 框架通过预处理管道从外部应用这些状态。然而,在模型内部本身,某种类似的东西正在自行形成。Anthropic 在 Claude 内部发现了一个"草稿垫",其中持有从不在输出中出现的类思维词汇,没有它,多步骤推理就会崩溃。