World Labs 的 Atlas 模型仅用 2-3 张照片即可重建 3D 场景
核心要点
- 李飞飞的空间智能初创公司推出了一种全向世界模型,可以从少量图像中重建完整的 3D 场景,远远超过开源竞争对手 过去,重建 3D 场景需要数百张仔细拍摄的照片、昂贵的设备和足够的耐心。
- 结果是完整的 3D 场景重建、新颖的视图合成和摄像机控制的视频生成,所有这些都来自最少的输入。
- 阿特拉斯实际上做了什么

李飞飞的空间智能初创公司推出了一种全向世界模型,可以从少量图像中重建完整的 3D 场景,远远超过开源竞争对手
过去,重建 3D 场景需要数百张仔细拍摄的照片、昂贵的设备和足够的耐心。由斯坦福大学人工智能杰出人物李飞飞共同创立的空间智能公司 World Labs 将工作流程压缩为两到三个快照。
该公司的新模型称为 Atlas,是一种预训练的多模态自回归扩散变压器。更简单地说:它是一个人工智能系统,可以同时理解文本、图像、视频和 3D 数据,并可以利用这种理解来填充相机未捕获的所有内容。结果是完整的 3D 场景重建、新颖的视图合成和摄像机控制的视频生成,所有这些都来自最少的输入。
阿特拉斯实际上做了什么
Atlas 的运作方式被世界实验室称为空间智能的“全方位世界模型”。输入一到六张参考图像,它可以生成长达一分钟的 1440p 分辨率视频,同时沿着您指定的确切路径保持精确的摄像机控制。
3D 重建能力才是真正令人印象深刻的地方。传统摄影测量流程通常需要从精心规划的角度拍摄 100 到 300 多张图像才能构建可用的 3D 模型。 Atlas 将这一要求压缩为仅需两到三个输入图像,从而生成明确的 3D 表示,例如点云和高斯图,该公司称其具有卓越的保真度。
在稀疏视图 3D 重建基准(包括 DTU 和 ETH3D)上,Atlas 发布的平均绝对相对点图误差为 25.3。最接近的开源竞争对手得分为 28.7。
世界实验室的联合创始人将新的视图预测定义为“一个完整的人工智能空间智能原语”。换句话说:从从未拍摄过的角度想象场景的能力是一项基本能力,它可以解锁从机器人导航到视觉效果管道的所有内容。
人类的判决
在评估相机控制质量的消费者测试中,75% 到 94% 的时间里,人类评分者更喜欢 Atlas,而不是竞争型号。
Atlas还支持动态时空模拟,包括子弹时间效果。想象一下《黑客帝国》中标志性的慢动作旋转摄像机,但它是由人工智能生成的,而不是精心设计的同步摄像机装置。
该模型在统一的空间上下文中处理所有这些。 Atlas 没有将用于视频生成、3D 重建和新颖视图合成的单独工具拼接在一起,而是将这些功能整合到一个系统中。
从实验室到限量发行
World Labs 自 2024 年成立以来一直致力于实现这一目标。这家初创公司从一开始就引起了广泛关注,很大程度上是因为李作为现代计算机视觉架构师之一的声誉。她的 ImageNet 数据集和相关挑战在催化十多年前的深度学习革命中发挥了核心作用。
Atlas 于 2026 年 9 月 1 日宣布,目前正进入特定合作伙伴的抢先体验阶段。世界实验室尚未公开发布该模型的权重或代码,目前该技术仍处于受控访问墙后面。
