World Labs 发布 Atlas 世界模型:从一张图生成、重建、模拟整个世界

9 月 1 日,李飞飞创办的 World Labs 发布新一代世界模型 Atlas。官方对它的定位是全模态(omni)世界模型:从零预训练,在单一架构里原生处理文本、图像、视频和 3D,任务覆盖世界的生成、重建与模拟。Atlas 之后会驱动 World Labs 的下一代产品 Marble,早期访问申请已经开放。

Atlas 官方主视觉

一次输入,四类输出

官方页面把 Atlas 的能力分成四类:

  • 相机控制生成:从一张或多张参考图生成新视角画面,最高输出 1 分钟 1440p 视频;
  • 空间重建:从 1 张到几十张照片重建真实场景,同时给出新视角图像帧和显式 3D 结果;
  • 时空模拟:从输入视频建模空间与时间,支持改机位重拍和机器人 Real-to-Sim 工作流;
  • 图像生成:从文本生成图像和 360 度全景,支持复杂提示词、文字渲染和多种视觉风格。

官方在博客里明确写道,图像生成并非 Atlas 的主方向,世界建模才是核心目标。

像素级相机控制

现有的视频模型大多靠文字提示描述运镜,比如「镜头缓慢向左平移」。Atlas 把精确的相机几何作为原生输入类型,相机运动直接以相机位姿数值传给模型,省去了文字描述的模糊环节,每个机位、每段运动都可以手动指定。

单张输入图就能撑起一个场景。官方演示里,一张泳池边的机器人照片输入后,Atlas 生成了机器人背面的样子,还推测出泳池旁应该有一片草地。两张互不相关的参考图放进 3D 空间的不同位置,模型会生成一个在两者之间平滑过渡的世界,补出门、走廊、角落这类过渡结构。把相机运动和空间上下文管理组合起来,官方用少量参考图生成了 1 分钟 1440p 视频,整条相机路径由人工设计。

Atlas 相机控制生成演示

两三张照片重建一个场景

从稀疏视角重建 3D 场景是计算机视觉领域存在几十年的基础问题。Atlas 通常用 2 到 3 张照片就能给出忠实重建,官方称对比结果超过了专门为 3D 重建训练的专用模型;它的空间上下文最多能接收 100 张以上的输入图。输入越多,模型需要想象的部分越少。斯坦福主校区的演示里,输入从 2 张地面照片逐步增加到 25 张,模型可以生成从高空飞过的航拍视角,整个场景在换任何相机路径时保持一致。

输出侧,Atlas 原生处理 2D 图像帧和 3D 深度图,能把场景输出成点云或 3D 高斯泼溅(3D Gaussian splats)。高斯泼溅与 Marble 使用的表示一致,可以在设备端以高分辨率和高帧率渲染。

从 3 部手机到机器人仿真

「子弹时间」(bullet time)镜头传统上需要专业多机位阵列。Atlas 的做法是:用 3 到 5 台普通手机或运动相机拍摄视频,从 3 到 5 个视角重建场景,之后任意改变机位。官方演示的素材由工程师用三脚架和夹子拍摄,全部设备装进一个背包。

机器人方向是 Real-to-Sim 的完整链路。先用手机视频里的 24 帧重建大型环境,再让仿真机器人在场景中沿不同路径移动,Atlas 生成机器人身载相机视角的 RGB 图像和深度数据。操作任务的仿真可以捕捉物体如何移动和相互作用,改变物体、位置、动作、光照和背景,就能批量产生多样化的训练与测试环境。

Atlas 机器人 Real-to-Sim 数据采集现场

架构:LLM 与扩散模型的组合

Atlas 是一个多模态自回归扩散 Transformer(multimodal autoregressive diffusion transformer),四个属性分别对应一层设计:

  • 多模态:原生处理文本、图像、相机位姿和 3D 深度图,视频按图像序列表示;每张图像和深度图都绑定显式相机位姿,空间控制从架构层面内建;
  • 自回归:在元素序列上逐个生成,每个任务只是输入序列后接输出序列的一种排列;
  • 扩散:用 rectified flow 逐步去噪生成输出,去噪步数可以在速度与质量之间权衡;
  • Transformer:主体运算是大规模矩阵乘法,适配现代硬件。

官方把这套设计称为 LLM 与现代视频模型思路的混合体,两条技术线的工程积累都能复用:LLM 侧的 KV 缓存、缓存感知路由、分离式服务,扩散模型侧的蒸馏、无分类器引导、噪声调度与 VAE 设计。

基准测试怎么做的

相机控制生成的对比对象是一批顶尖视频模型。每轮测试给单张输入图和 1 到 3 段电影级运镜(摇镜、平移、升降等),Atlas 用原生相机格式接收路径,其他模型用文本描述同一路径,由第三方人类评审判断哪个模型更贴合目标轨迹。结果是 Atlas 胜出,且相机轨迹越复杂优势越大。官方同时说明,文本只是最常见的输入方式,更精细的提示工程可能改善部分模型的相机跟随表现。

3D 稀疏视角重建的评测里,模型接收一组带相机位姿的图像,为每个输入像素预测对应的 3D 点。官方在多个 SOTA 基准上复现了全部基线再统一对比,结论是这个同时做生成和重建的通用模型,超过了最好的专用开源重建模型。

规模化与入口

开发期间 World Labs 训练了一系列尺寸和训练算力递增的模型,每提高一档算力都解锁了新的能力,官方判断这条扩展曲线会延续下去。Atlas 现已通过早期访问向部分合作伙伴开放,官网可提交申请,团队同时在招聘研究和工程岗位。

来源:World Labs Blog《Atlas: A World Model for Spatial Intelligence》