Atlas 通过几张图片即可生成、重建并模拟 3D 场景,以 3D 空间为锚点而非平面序列,在机器人物理训练数据生成上有突破。
由 AI 研究员李飞飞联合创立的 World Labs 发布了 Atlas,这是一款能够仅凭几张图像就能生成、重建和模拟 3D 场景的世界模型。该公司声称,Atlas 在各项专业任务上击败了专门针对这些任务训练的模型,这让许多专项模型变得不再必要。
自成立以来,World Labs 一直追求"空间智能"的目标,即让人工智能像人类一样理解 3D 空间。Atlas 是该公司首个为此目标规模化打造的基础模型。它不仅输出平面图像或视频片段,而是能够理解场景从任意角度看上去的样子以及它如何随时间变化。
World Labs 将 Atlas 描述为一个全模态模型(omni-model),从零开始基于文本、图像、视频和 3D 数据进行训练。每种输入都被锚定在 3D 空间中的特定位置,而不是被处理为平面序列。该公司称这种共享的空间理解为"空间上下文"(spatial context),而这正是模型用于生成每一帧新画面或新视角的依据。World Labs 表示,这种锚定机制使 Atlas 区别于纯语言模型或视频模型。
李飞飞在 2025 年 11 月的一篇文章中恰好阐述了这个问题。她指出,当前多模态语言模型和视频扩散模型将数据分解为一维或二维序列,这让即便是简单的空间任务也变得不必要地困难。需要的是在 token 化、上下文和记忆层面都能以 3D 或 4D 方式组织的架构。
在摄像机控制的生成任务中,Atlas 接收一张或多张图像,并能在任意选择的摄像机位置和角度生成新的视图。摄像机运动作为直接的几何输入传递,而不是像许多视频模型那样通过文本提示来描述。
该模型最高可输出一分钟 1440p 视频。用户可以完全自主控制每一个镜头,而不是"拉动老虎机的拉杆",这是 World Labs的说法,意在区分受控生成与随机输出。

在空间重建方面,Atlas 仅凭一张到几十张输入图像就能重建真实场景,无需特殊采集设备。输入图像越多,它需要从自身知识中填补的内容就越少。
World Labs 表示,仅用两三张图像,Atlas 就能给出忠实的结果,并超越专门的 3D 模型。它也能处理超过一百张输入图像。在一个演示中,该模型从两张到 25 张地面照片逐步构建了斯坦福大学主广场,并生成了校园上空的俯视航拍图。

这正是现有模型容易崩溃的地方。在 OpenWorldLib 框架内的对比中,VGGT 和 InfiniteVGGT 等系统在摄像机大幅移动时立即出现了几何不一致和纹理模糊的问题。
Atlas 能够输出实际的 3D 数据,而不仅仅是图像或视频,因为它在处理 RGB 色彩信息的同时也处理深度信息。支持的格式包括点云和 3D Gaussian Splatting,后者通过许多小的空间数据点构建场景,可以从任意角度平滑查看。这与该公司现有产品 Marble 使用的表示方式一致。

作为仿真器,Atlas 将空间和时间一起建模。仅凭少数几台摄像机拍摄的 footage,它就能产生"时间凝固"效果,冻结场景并让用户从原本不可能的角度查看。演示 footage 是用几部智能手机和运动相机拍摄的,而非专业设备。
对于机器人技术,Atlas 充当真实到仿真(real-to-sim)的工具。它重建一个房间,并生成模拟机器人的传感器沿路径会看到的图像和深度数据。仅凭几张照片,用户就可以通过替换物体、位置、光照或背景来模拟和变换抓取与移动任务。其目标是机器人生成多样化的训练数据,而无需在真实世界中采集每一种情况。
World Labs 在 2026 年 8 月以独立产品的形式展示了这种真到仿方法。该引擎从单个现实世界任务中创建数千个变体,并完全在仿真环境中训练控制模型。该公司表示,在五个机器人平台上,模型各自主运行了一小时而无需人工干预。这项技术来自 World Labs 于 2025 年 7 月收购的初创公司 SceniX。
该公司表示,文本到图像生成不是主要方向,但 Atlas 也能遵循复杂提示、渲染文字、生成不同视觉风格,并创建 360 度全景图。
Atlas 结合了语言模型和视频模型的思想。它像语言模型一样逐片生成输出,因此可以使用相同的加速技术,如 KV 缓存。但它也使用了图像和视频模型中的扩散原理,即从噪声中逐步过滤出输出。这让它能够使用缩短去噪过程或提升图像质量的方法。
World Labs 表示,没有任何单一基准测试能够完整衡量 Atlas 的能力,但指向了两组测试。在由外部人类评估者评判的摄像机控制生成任务和少样本 3D 重建任务中,Atlas 的表现优于更加专业化的模型。

在摄像机引导生成的直接对比中,大多数评估者始终选择 Atlas。在重建任务中,Atlas 以 25.3 的中位误差领先于 Pi3X 和 VGGT-Ω 1B。

World Labs 由李飞飞于 2024 年创立,她创建了 ImageNet,并在 2017 年至 2018 年间领导了 Google Cloud 的 AI 部门。该公司成立时获得了 Andreessen Horowitz、AMD、Intel 和 Nvidia 的投资。
2024 年底推出的首个系统允许用户走动,但用户只能移动几米就会撞上看不见的边界。Marble 于 2025 年 11 月上线。2026 年 2 月,World Labs 获得了由 Autodesk、Andreessen Horowitz、Nvidia 和 AMD 领投的 10 亿美元融资。此前 Bloomberg 曾报道过估值为 50 亿美元的融资谈判。
关于什么是世界模型,研究人员之间仍存在争议。2026 年 4 月,一个由北京大学牵头的国际团队通过 OpenWorldLib 提出了一个统一定义,将纯文本到视频模型排除在外,因为它们缺乏与真实世界的反馈循环。Atlas 中的 3D 重建和仿真器等功能在该框架中被视为核心构建块,因为它们提供了可以验证物理规则的环境。