给AI一双真正的眼睛:李飞飞的Atlas要让机器住进三维世界

给AI一双真正的眼睛:李飞飞的Atlas要让机器住进三维世界

想象一个场景:你掏出手机,随手拍了几张自家客厅的照片。十几秒后,一个虚拟机器人已经站在了你客厅的数字孪生体里,正绕过茶几、推开阳台门,学习怎么帮你把快递从门口搬到桌上。

这不是科幻片的脑洞,而是李飞飞团队刚刚交出的最新答卷。

2026年9月2日,李飞飞创办的空间智能公司World Labs正式发布了名为Atlas的新一代世界模型。官方毫不吝啬地给它贴上了”全球首个多模态世界模型”的标签,号称一个模型就能同时搞定视频生成、3D重建和机器人仿真。这三件事在过去分属三个完全不同的技术赛道,各自养着一批专门的团队和工具链。

Atlas的野心,是把它们统统拉进同一个屋檐下。

一张照片背后的”空间大脑”

要理解Atlas为什么引发这么大的动静,得先聊聊当前AI视频生成领域一个尴尬的现实。

过去两年,视频生成模型卷得飞起。Sora、可灵、Seedance轮番登场,每隔几周就有新模型声称自己画面更逼真、时长更久、分辨率更高。但有个问题始终没人真正解决:镜头怎么动,全靠玄学。

你在提示框里写”镜头缓慢向左旋转,微微仰角”,模型收到之后呢?它其实只是在一堆像素里猜,下一帧大概长什么样。至于”向左”是向左多少度、”旋转”的圆心在哪、”仰角”有多仰,它心里没数。运气好,出来的镜头恰好顺滑;运气差,画面直接扭曲崩坏。

Atlas做了一件根本性不同的事。

它把相机在三维空间中的位置和姿态,变成了模型的一种原生输入。用术语说,叫Spatial Context,也就是空间上下文。通俗地讲,就是Atlas不仅知道”这张照片里有什么”,还知道”这张照片是站在空间中的哪个点、朝哪个方向拍出来的”。

这意味着什么?意味着当你告诉它”镜头沿着这条路径走”,你给的不再是一段模糊的文字描述,而是一串精确的三维坐标。Atlas沿着坐标一帧帧生成画面,空间几何关系从头到尾保持一致。

36氪报道,只需要给Atlas丢进去一到六张普通照片,定好运镜轨迹,它就能输出最长一分钟、1440p分辨率的视频。更神奇的是它的”空间脑补力”:给一张只拍到机器人正面的照片,把镜头绕到背后,它能把从未出现在输入中的背影和周围环境补全出来。

这种脑补并非凭空捏造。Atlas在训练过程中吃进了海量的真实世界图像和3D数据,建立起了一套关于”世界通常长什么样”的先验知识。当它看到花园的一角,它会根据这套知识推断出篱笆外面大概率有草坪和远山,然后把缺失的部分补上。输入的视角越多,模型需要想象的就越少。MIT科技评论中文版的报道里有个很精准的总结:两三张图片通常就能得到相当忠实的重建,而Atlas最多可以利用超过一百张图片作为空间上下文。

当然,必须承认的是,镜头一旦进入原图完全没覆盖的区域,模型本质上还是在”猜”。视角跨度越大,局部几何漂移和纹理闪烁越容易暴露出来。它生成的更像是一个视觉上合理的三维世界,未必是那个世界的精确数字复刻。

从”画面好看”到”空间真实”

如果Atlas只是拍视频拍得更稳,那顶多算是视频生成赛道的一次迭代。真正让业界坐不住的,是它同时展现出的3D重建能力。

传统做3D重建,门槛极高。不管是高斯泼溅还是点云扫描,都需要专业设备围着目标转上几十圈,拍几百上千张照片。而Atlas把这个过程压缩到了令人咋舌的程度:官方展示的斯坦福大学Main Quad案例里,只用了两到二十几张游客视角的地面平拍照片,就还原出了草坪、拱廊和纪念教堂外墙的完整细节,随后镜头直接拔地而起,给出了一段上帝视角的航拍漫游。

在公开数据集的基准测试中,Atlas也交出了亮眼的成绩单。据量子位报道,在DTU、ETH3D、ScanNet等测试集上衡量稀疏视角重建误差时,Atlas拿到了25.3的分数,超过了Pi3X的28.7和Depth Anything 3的39.3,在这个指标里,分数越低代表重建越准确。

更重要的是,Atlas输出的不只是一段”看起来像3D”的视频。它能同时预测每一帧的深度信息,把结果组合成点云,进一步生成3D高斯泼溅场景,可以直接导入游戏引擎、影视特效工具或建筑设计软件。生成和重建不再是两条割裂的管道,而是同一个模型的两个出口。

World Labs还掏出了一个”子弹时间”的杀手级演示。没有好莱坞几百台同步相机组成的环形阵列,研究人员只用了三到五台普通手机和运动相机,从几个方向同时拍摄一段动态场景。Atlas把这些视角重新对齐并建立空间模型后,用户可以在事件发生之后,从现实中根本不存在的机位重新观看同一个瞬间。用五台手机复刻《黑客帝国》的名场面,这在两年前是无法想象的事。

机器人的”星辰大海”才是终极目的

不过,如果你以为李飞飞折腾这一大出是为了跟好莱坞抢特效饭碗,那就低估她了。

Atlas最深层的野心,指向的是这一代AI最大的瓶颈,也就是具身智能,让机器人不只是”能聊天”,还能真正走进物理世界干活。

搞过机器人训练的人都知道一个残酷的现实:训练数据太贵了。让机器人在真实工厂里反复试错,速度慢、成本高、还有安全风险。换到仿真环境里训练呢?又得先花大量人力搭建逼真的3D场景、设定材质光照、摆放物体。业内有一种估算:如果完全依靠传统方式收集足够规模的机器人训练数据,最终成本可能达到天文数字。

Atlas给出的方案简单粗暴:用手机拍一段真实环境的视频,喂给模型,它直接吐出一个高精度的3D数字孪生空间。机器人钻进去就能开始训练。

更精妙的是,Atlas不只是搭了个静态布景。机器人走到哪,它就实时渲染出机载摄像头应该看到的RGB图像和深度数据;机械臂碰一下箱子、拉一下柜门、捏一下海绵,它都能模拟出相应的反馈。只要录一段真实现场,就可以改变光照、重新摆放障碍物,衍生出大量不同的训练场景。

这条路径被World Labs称为Real-to-Sim,从真实到仿真。英伟达机器人负责人Jim Fan在看到Atlas后评价说,这是机器人领域Real-to-Sim的关键一步。

把时间线往回拉一拉,Atlas的出现并不突然。今年6月,李飞飞亲自撰文把世界模型分成三类:负责画面的渲染器、负责物理环境的模拟器、负责决策的规划器,并明确指出”最关键的是模拟器”。7月,World Labs接连收购了机器人仿真公司SceniX、公开了Real-to-Sim-to-Real系统。到9月Atlas登场,这条战略路线图已经清晰得不能再清晰了。

技术底座:四种范式的混血儿

Atlas能一个模型干三件事,离不开一套相当精巧的底层架构设计。

官方给它起了个有些拗口的名字:多模态自回归扩散Transformer。拆开来看,其实是把当前AI领域最成熟的几种技术路线揉到了一起。

“多模态”意味着文本、图像、视频、相机位姿、3D深度图全都是原生输入,不需要额外的适配器或桥接模块。”自回归”就是大语言模型那套经典打法,根据上文预测下文,只不过Atlas预测的不是下一个词,而是下一个空间状态。”扩散”则借鉴了图像生成模型的去噪机制,确保高维视觉信号的画质和几何精度。最底层的”Transformer”架构,让它可以直接复用大语言模型领域已经打磨多年的KV Cache、分布式推理等工程优化。

这套混血架构带来了一个很实际的好处:不同的任务,本质上只是输入输出序列的排列组合不同。想生成视频?前面放图片和相机轨迹,后面输出视频帧。想做3D重建?前面放多角度照片,后面输出深度图和点云。想给机器人造训练场?前面放环境视频和机器人位姿,后面输出它应该看到的画面。同一个模型,同一套权重,切换任务只需要换一下序列的组成方式。

在相机控制能力的盲测中,Atlas的表现相当强悍。第三方标注者评估后,Atlas对Seedance 2.5的胜率达到94%,对Gemini Omni Flash为81%,对FLUX 3为93%。不过MIT科技评论也点出一个耐人寻味的细节:Atlas可以直接接收精确的相机轨迹参数,而对手们只能接收文字描述的运镜指令。这既体现了Atlas的设计优势,也意味着这不完全是一场同等条件下的比较。

冷静看:离”模拟现实”还有多远

Atlas固然令人兴奋,但把它直接等同于”能预测现实的物理模拟器”还为时过早。

目前公布的机器人案例主要验证了空间重建、视觉生成和简单物体交互的能力。但在碰撞、摩擦、材料特性、复杂动力学这些更硬核的物理层面,World Labs还没有给出系统性的测试数据。更关键的问题是:由Atlas生成的仿真环境,训练出来的机器人策略回到真实世界后表现如何?这个被称为sim-to-real gap的鸿沟,是整个领域公认的核心难题,Atlas尚未给出答案。

另外,Atlas至今没有公开模型参数规模、训练数据量和所用算力,也没有开源权重。它刚刚进入少量合作伙伴的早期测试阶段,公开的评测结果主要来自World Labs自己,缺少独立第三方的验证。

但这并不妨碍我们看到一条越来越明确的方向。

李飞飞曾经把当下的大语言模型比作”黑暗中的文字高手”,它们能谈论这个世界,却从未真正生活在这个世界里。一个模型可以解释杯子为什么会从桌上掉下来,但机器人真要伸手拿杯子,还得知道杯子离桌边多远、手从哪个方向够过去、碰到它以后整个场景会怎么变化。

语言模型把互联网里的文字知识交给了机器。世界模型接下来要做的,是把三维空间、物理规律和时间演化也交给它们。Atlas不是终点,但它可能是这场接力赛中,目前跑得最远的那一棒。

回头看李飞飞这二十年的轨迹,从ImageNet教会机器识别像素里的物体,到创办World Labs让机器理解像素背后的三维空间,她始终在追问同一个问题:机器看见一张图之后,有没有真正理解这个世界?

Atlas说,也许正在开始理解了。

延伸阅读

查看完整选型指南 →

Stay updated with our latest AI insights

Follow FuturePicker on Google
滚动至顶部