MindTopo 提出拓扑关系和空间推理新基准,揭示当前视觉语言模型在空间理解方面的能力边界和提升路径。
MindTopo 是一个用于测试 AI 拓扑推理的新基准,用来评估多模态模型是否能理解连通性、包围、顺序、分离和打结等概念。
该基准同时衡量推理和规划能力,不仅测试模型是否能识别静态图像中的拓扑关系,还测试它们是否能在一系列动作中保持和操作这些关系。
当前多模态模型在静态识别任务上的表现远好于交互式任务,这表明它们难以在时间维度上保持对拓扑的一致理解。
失败往往出现在规划阶段而非感知阶段,模型会在场景变化时丢失对结构关系的追踪,或提出违反物理约束的动作。
这些发现凸显了一个重要机遇:推进用于机器人和交互环境的 AI 系统,在这些场景中,理解什么保持连接、被包围、有序或打结,对可靠决策至关重要。
AI 能否判断在添加一堵墙后两个房间是否仍然连通?能否识别一只动物是否在围栏内,区分真正的结与看似打结的环,或者在不让绳子相互穿过的情况下重新排列多根绳子?
这些问题涉及 3D 拓扑,即一种基于结构关系的空间理解能力——这种关系在物体弯曲、拉伸或变形时依然保持。连通性、包围、有序性和打结性都是拓扑性质的例子。这些性质是认知科学中人类空间理解的基础层,但它们在多模态 AI 系统的评估中却基本缺席。
在一项新的研究中,我们推出了 MindTopo(在新标签页中打开),这是一个用于评估多模态大语言模型是否具备这种拓扑直觉的基准。我们的发现揭示了静态图像中识别拓扑与在规划和行动中保持拓扑的内在理解之间存在巨大差距。当前的模型有时能识别单个场景中的连通路径、被包围区域或结,但这种理解往往在模型必须通过一系列动作操作场景时崩溃。
MindTopo 如何定义拓扑空间
大多数针对多模态模型的空间评估都聚焦于欧几里得性质,如距离、方向、大小和相对位置。受 Piaget 和其他认知文献对拓扑能力的分类启发,MindTopo 将其任务组织为以下五类:
连续性:询问一条路径或一个物体是否保持完整。
分离性:询问相邻元素是形成一个结构还是独立的部件。
顺序:追踪元素沿路径或通过变换的排列方式。
包围:测试边界是否创造了内部和外部。
打结:测试绳子是真正打结或链接,而不是仅仅看起来缠绕。
每个类别在两个认知层次上进行评估。在推理任务中,模型检查一个或多个渲染场景,并回答关于其拓扑结构的问题:迷宫中的两点是否连通、羊是否在围栏内、绳子是否真正打结。在规划任务中,模型与模拟环境交互,选择必须创建、保持或移除特定关系的动作,例如旋转管道段、绘制分隔路径、重排方块、困住移动的智能体、或解开绳子。环境会强制执行合法动作,因此模型不能通过将一股绳子穿过另一股来解决绳子谜题。
图 1. MindTopo 将关于静态场景的问题与需要模型保持或改变相同拓扑关系的交互任务配对。

所有场景都由受控模拟器生成,提供精确的真值和可调的难度。这种控制使得区分两种 otherwise 难以分辨的失败模式成为可能:模型失败是因为场景视觉上复杂,以及模型失败是因为它无法在物体移动时保持底层关系。
图 2. MindTopo 将推理和规划任务映射到连续性、分离性、顺序、包围和打结。

看见拓扑与操作拓扑不是一回事
在一组广泛的自有模型和开源模型中,静态推理的表现始终强于交互式规划,两者都远低于人类表现。当成功依赖于在多次动作中保持一种关系时,这种对比尤为明显。
错误模式有助于定位问题。静态错误通常始于感知,例如遗漏了一堵墙、一个开口或一个交叉点。规划错误在场景被理解之后才出现。模型遵循了一个局部看似合理的移动却没有追踪其后续后果,在多个回合中丢失了任务目标,或提出了违反环境动态的动作。
生成工具揭示了什么
我们还测试了图像和视频生成是否能帮助模型保持对拓扑关系的理解。当相关关系在单帧中可见时,图像生成有时有帮助,但在跨一系列穿越或移动时仍然不可靠。视频 rollout 经常改变拓扑或违反任务动态。视觉模拟仅在能够随时间保持结构约束时才有用了。
构建能保持结构的智能体
MindTopo 旨在作为这一差距的受控诊断工具。机器人、无障碍工具和交互式助手不仅需要理解物体在哪里,还需要理解随着动作展开什么保持连接、被包围、有序或打结。弥合这一差距可能需要携带明确拓扑状态的模型,或其预测天然保持拓扑的世界模型。