D4RT 模型:4D 视觉重建突破速度提升 300 倍
Google DeepMind 发布高效 4D 重建追踪技术,推进计算机视觉但主要面向研究和专业领域。
Google DeepMind 发布高效 4D 重建追踪技术,推进计算机视觉但主要面向研究和专业领域。
Guillaume Le Moing 和 Mehdi S. M. Sajjadi
D4RT 正式发布:这是一个统一的 AI 模型,能够跨越空间与时间进行 4D 场景重建和追踪。
每当我们观察这个世界时,大脑都在完成一项非凡的记忆与预测任务。我们能够看到并理解事物在当前时刻的状态、片刻之前的状态,以及它们在接下来一刻可能呈现的状态。我们心中的世界模型始终维持着对现实的持久表征,并利用这个模型,直观判断过去、现在与未来之间的因果关系。
为了让机器像我们一样观察世界,我们可以为它们配备摄像头,但这只能解决输入问题。要理解这些输入,计算机必须求解一个复杂的逆问题:输入是一段由一系列平面 2D 投影组成的视频,而计算机需要从中还原或理解那个丰富、立体且处于运动之中的 3D 世界。
今天,我们正式发布 D4RT(Dynamic 4D Reconstruction and Tracking,动态 4D 重建与追踪)。这是一个新的 AI 模型,它将动态场景重建统一到一个高效的框架中,让我们向人工智能的下一个前沿更进一步:全面感知我们所处的动态现实。
为了理解 2D 视频捕捉到的动态场景,AI 模型必须在每个物体运动时,追踪其每一个像素在三个空间维度以及第四个时间维度中的位置。此外,它还必须将物体运动与摄像机运动区分开来,即使物体彼此遮挡,或者完全离开画面,也要始终维持连贯的场景表征。传统上,要从 2D 视频中捕捉这种程度的几何结构与运动信息,需要计算密集型流程,或者将多个专用 AI 模型拼凑在一起——有的负责深度,有的负责运动,还有的负责摄像机角度——最终得到的 AI 重建结果往往速度缓慢且彼此割裂。
D4RT 凭借简化的架构和新颖的查询机制,站在了 4D 重建领域的前沿,同时效率最高可达到以往方法的 300 倍——速度足以支持机器人、增强现实等领域的实时应用。
D4RT 采用统一的 encoder-decoder Transformer 架构。encoder 首先处理输入视频,将场景的几何结构和运动信息压缩成一种紧凑表征。不同于为各项任务分别设置独立模块的旧系统,D4RT 只计算自己真正需要的信息。它采用一种灵活的查询机制,围绕一个基础问题展开:
“视频中的某个给定像素,在任意时刻、从指定摄像机的视角观察时,位于 3D 空间中的什么位置?”
在我们此前工作的基础上,一个轻量级 decoder 会查询这份表征,从而回答上述问题的具体实例。由于各个查询彼此独立,因此可以在现代 AI 硬件上并行处理。无论只是追踪少量点,还是重建整个场景,这种机制都让 D4RT 具备极高的速度和可扩展性。
借助这种灵活的建模方式,该模型现在能够解决多种 4D 任务,包括:
点追踪: 通过查询一个像素在不同时间步的位置,D4RT 可以预测它在 3D 空间中的运动轨迹。更重要的是,即使某个物体在视频的其他帧中不可见,模型仍然可以对其位置作出预测。
点云重建: 通过固定时间和摄像机视角,D4RT 可以直接生成场景完整的 3D 结构,不再需要单独估计摄像机参数,也不必针对每段视频执行迭代优化等额外步骤。
摄像机位姿估计: D4RT 可以从不同视角生成同一时刻的 3D 快照并将其对齐,从而轻松还原摄像机的运动轨迹。
正如底层技术报告所详述的那样,D4RT 在广泛的 4D 重建任务中超越了以往方法。定性对比结果显示,其他方法难以处理动态物体——常常会生成重复的物体,或者根本无法完成重建——而 D4RT 能够对运动中的世界维持稳定、连续的理解。
至关重要的是,D4RT 并没有以牺牲效率为代价来换取精度。在测试中,它的运行速度达到此前最先进方法的 18 至 300 倍。例如,使用单颗 TPU 芯片时,D4RT 只需大约 5 秒即可处理一段 1 分钟的视频。以往最先进的方法完成同一任务可能需要长达 10 分钟——速度提升了 120 倍。
D4RT 证明,在 4D 重建中,我们不必在准确性与效率之间二选一。它灵活的查询式系统能够实时捕捉动态世界,为下一代空间计算铺平道路。相关应用包括:
机器人: 机器人需要在充满移动人员与物体的动态环境中行动。D4RT 可以提供安全导航和灵巧操作所需的空间感知能力。
增强现实(AR): AR 眼镜要将数字物体叠加到现实世界中,就必须以极低的延迟即时理解场景的几何结构。D4RT 的高效率,让真正实现端侧部署变得更加可行。
世界模型: D4RT 能够有效区分摄像机运动、物体运动和静态几何结构,让我们距离真正拥有物理现实“世界模型”的 AI 又近了一步——这是通往 AGI 道路上的必要一步。
我们将继续探索该模型的能力,以及它在机器人、增强现实等更多领域中的应用潜力。
Gemini Robotics 1.5 将 AI Agent 带入物理世界
Veo 3.1 与先进创作能力正式发布
Genie 3:世界模型的新前沿