• 正文
  • 相关推荐
申请入驻 产业图谱

详解李飞飞的世界模型 Atlas:如何影响自动驾驶、人形机器人等Physical AI 产业

13小时前
277
加入交流群
扫码加入
获取工程师必备礼包
参与热点资讯讨论

最近,李飞飞创办的 World Labs 发布了新一代世界模型 Atlas。给 Atlas 这个世界模型一张客厅照片,它能生成这间客厅任意角度的画面,还能把它还原成一个可以走进去的三维空间;给它三台手机从不同位置拍下的同一次投篮,它能把球停在半空,让镜头绕着球员转一圈。

李飞飞把它的本事归成四类:

相机可控生成输入 1—6 张参考图加一条相机路径,输出最长 1 分钟的 1440p 视频

空间重建用 1 张到几十张照片还原真实场景,同时给出新角度的画面和点云等三维结果

时空仿真把几台手机拍的素材改成任意机位,也给机器人生成训练场景

图像生成文生图和 360 度全景,官方明说不是主业

对于这个模型还有一个最直观突破,就是采集量:扫描一个房间,过去要拍 100—300 张照片,现在 3 张就能开工。

不过 Atlas 模型目前只对少数合作伙伴开放,没有论文,也没公布参数量和价格。所以本文对世界模型 Atlas进行拆解,它的算法架构是什么样子的?有哪些独特性?对我们生活有哪些影响?对汽车自动驾驶人形机器人现在的算法路径是否产生颠覆性影响?世界模型下一个轰动时刻会是什么?

生成、重建、仿真,第一次装进同一个模型

这些效果单看并不新鲜。视频模型早就能换个角度生成画面,重建算法也早就能从照片里算出三维,不过之前只是两者一直分属两拨人、两套模型,一个负责想象,一个负责还原。但是现在Atlas 用一个模型把两件事都做了,两边的成绩还都压过了专门的模型。它背后的架构到底换了什么,能让一个模型既会想象、又能还原?

它独特在哪,又难在哪

计算机视觉里,重建是照着实物还原,规矩是不许编;生成是凭空造,规矩是必须编。两条路各走了很多年。

视频三维场景重建这条路已经走过了6年:

2020 年的 NeRF 用神经网络表示一个场景,画质惊人,代价是每个场景都要上百张照片、单独训练一遍,它的第一作者 Ben Mildenhall 如今是 World Labs 的联合创始人。

2023 年的 3D 高斯泼溅把场景表示成几百万个带颜色的半透明小椭球,渲染快到手机都能跑,照片却还是得拍够。

2025 年拿下 CVPR 最佳论文的 VGGT 能一次算出几百张照片的相机位置、深度和点云,可照片没拍到的地方它补不出来。

以上这些从特斯拉到国内新势力理想汽车都有用到此类算法。

而二维图片生成三维场景这条路上,Google 在 2024 年的 CAT3D 先用扩散模型"编"出缺失的视角,再交给重建算法拼成三维,等于把两个模型串起来用。按 World Labs 的说法,Atlas 是第一个把两件事放进同一个模型的。

为什么三维重建和生成非合不可?这是因为传统重建有个绕不过去的死穴。一个点至少要被三四个角度拍到,才能用三角测量算出它在空间里的位置,漏拍的地方在结果里就是一个洞。桌子底下、椅子腿之间、叶子的缝隙,再专业的人也会漏,普通人扫一个多房间的家可能要走两个小时。补洞只能靠想象,而想象就是生成。

难也难在这里,两件事的目标互相打架:重建要模型别乱编,但是生成要模型却必须编。Atlas 世界模型把分寸交给输入,喂的实拍照片越多,它想象的部分越少。官方演示里,只给一张花园照片时,花园准确、其余靠编;补一张小屋、再补一张主楼,编出来的部分逐次被实拍取代。

视频动态又是另一重矛盾。重建希望时间是冻住的,每个角度看到同一个瞬间,可纯静态的训练数据很难大规模凑齐,上一代产品 Marble 因此只能做静态场景。Atlas 预训练时把动态数据照单全收,让模型自己学会剥离会动的部分,这一版的后训练再往静态方向调,所以演示里只看得到水波和远处开过的小车,团队自己管这叫"婴儿级动态"。

输入照片的张数,就是 Atlas 在"忠实"与"想象"之间的旋钮。这件事以前要两个模型接力,现在一个模型就能拧。

它的架构,和视频模型、大模型差在哪

官方对架构的描述只有一句:多模态自回归扩散 Transformer。四个词各管一件事。

多模态原生处理文字、图像、相机位姿和深度图,视频被当作一串图像。相机位姿就是"这张照片站在哪儿拍、朝哪个方向、镜头多广",深度图记录每个像素离镜头多远。每张图都绑着一个明确的位姿,World Labs 认为此前没有人在预训练阶段这样做过

自回归像大模型一样按顺序逐个生成,任何任务都能写成"输入在前、输出在后"的一串序列

扩散从一团噪声出发一步步擦干净,少擦几步就快一些,这个是算法界的老法师了

Transformer骨架没变,看来这个transformer是AI界的基本了,不管大语言还是视觉再到空间只能说都用它,变的是前三样的组合

放在一起对比就清楚了。大语言模型预测下一个词,上下文是一串文字;视频模型预测下一帧,上下文是提示词加首尾帧,本质上仍是一条时间线;Atlas 预测一个新视角,上下文是一组钉在三维空间里的照片,官方称之为"空间上下文"。

落到用户手上,差别首先是控制方式。视频模型只能在提示词里写"镜头向左平移",理解成什么全凭模型,不满意就重抽,像拉老虎机;Atlas 直接接收相机路径的几何参数,镜头从哪走到哪由人指定,同一个场景换多少条路径都不变形。官方人评中,它在"按指定路线运镜"上对五个主流视频模型的胜率在 75% 到 94% 之间,不过对手只能用文字描述运镜,这个设定本身对它有利。

上半是架构示意:四种输入先钉进空间上下文,再由模型生成;下半是官方演示里以相机位姿输入的路径

其次是能吃下多少张图。大模型这几年把上下文窗口从 12.8 万 token 扩到 100 万,不过在图像和视频模型的方面却没人认真往这个方向推,主要是因为图片的上下文太大了。Ben Mildenhall 的看法是,重建本质上就是"上下文特别长的生成"。Marble 塞不进几张图,Atlas 能吃下一百张以上。

Atlas 也有来处。Marble 能生成三维世界,但输出锁死在高斯泼溅一种格式上;2025 年 10 月的 RTFM (world model实验室的Real-Time Frame Model)已经是自回归扩散 Transformer,每一帧都带空间位置,一块 H100 就能实时出画面。Atlas 把"预测新视角"定为最基本的单位,泼溅降为可选输出,工程上还能同时借用大模型的推理加速和视频模型的提速手段。

前两类模型的上下文是一条序列,Atlas 的上下文是一个空间。它知道每张照片是站在哪儿拍的,而这是关于几何最值钱的一条信息。

它能用来做什么,会怎么改变生活

离普通人最近的变化,是"拍几张照片就能得到一个空间"。影视、旧素材、设计和机器人是官方演示与团队提到的方向,看房和体育是顺着同一能力往前推一步:

影视定格时间、镜头绕飞的"子弹时间",过去要在绿幕棚里架上百台相机,现在三到五台手机架在三脚架上就能拍,装备一个背包装得下

旧素材家里的老视频、网上找来的照片、当年拍废的扫描,都可能重新变成三维场景;把一次扫描的照片扔掉九成五,重建出来的效果也差不多

设计与建筑三维设计里最磨人的是把评审意见改回模型,开一次会往往返工一周;空间能像捏泥巴一样直接改,这一环就会大幅缩短

看房与家装几张房源照片生成一套能走进去的样板间,买沙发前先把它"摆"进自家客厅看看,这类需求过去要专门的扫描设备

体育与现场业余联赛、学校运动会用几台手机就能做出多角度回放,以前只有电视转播车才办得到

那能不能在 4D 视频里散步?现在的答案是空间这一维可以,时间和交互还不行。你可以在生成的场景里随意走动,走几步场景也不会变形;但动态只有雏形,也还不能伸手把桌上的杯子挪开。可编辑性是 World Labs 的下一个重点,难处在于加了控制不能掉画质,否则只是个花活。

能在三维里散步,还不能在四维里散步。这一版交出来的,是一个刻意把时间按住的版本。

会不会颠覆智驾和人形机器人的算法路线

我们先分清世界模型的功能分类。李飞飞今年 6 月的文章,把"世界模型"拆成三种功能:

渲染器输出给人看的画面,例如 Google 的 Genie 3;

仿真器输出程序能拿去计算的几何和物理状态;

规划器输出动作,回答下一步该做什么。

如果我们照这个分法来看,Atlas 目前是渲染器加仿真器,并不输出动作,而智驾和机器人的路线之争,争的是规划器那一格。

仿真器这一格,车企并不缺人。Waymo 今年 2 月发布的 Waymo World Model 就建在 Genie 3 之上,经过专门的后训练,直接生成摄像头激光雷达数据;特斯拉用生成式高斯泼溅做"如果当时换一种开法"的反事实回放;英伟达用 Cosmos 造数据、Alpamayo 出动作;华为 ADS 5 在云端用世界引擎造场景,在车端用世界行为模型出控制。它们都已经和各家的里程、芯片、闭环长在一起。Waymo 的做法说明,通用世界模型进入智驾,是先做领域后训练,再作为仿真工具接进开发流程。

Atlas 能卖给自动驾驶和人形机器人这类Physical AI 的是场景采集成本,不过把官方基准表逐个数据集拆开算,结果并不乐观。七个数据集里只有 KITTI 是车上拍的。Atlas 在室内 RGB-D 场景上比最强基线的误差低 38.1%,在 KITTI 上只低 0.3%(60.0 对 60.2),在大场景实拍的 Tanks & Temples 上还落后 5.5%。同一个模型,车载道路上的误差是室内 RGB-D 的 9 倍。

上:逐个数据集的领先幅度(本文按官方图表计算);下:为什么沿车道前进时视差最小

当然,官方没有解释原因,我的推断是几何。多视角重建依赖同一个点在不同机位下的位移差,也就是视差。绕着物体走一圈,视差最大;沿着镜头方向笔直往前开,视差最小,这是三角测量最吃力的情形,却是车载相机的日常。户外深度动辄几百米、满街都是在动的车,而这一版偏偏往静态方向调过。

机器人那边的账好算得多。World Labs 今年 7 月收购了做"真实到仿真"的 SceniX,公开的 R2S2R 实验里,策略完全在仿真中训练,不用一条真实数据;每个版本跑 2000 次仿真加 100 次实机,仿真给出的排名和实机一致;多个任务能连续自主运行一小时。这些实验用的都是桌面级机械臂,室内、有边界、背景不动,也就是 Atlas 在基准上赢得最多的那类场景;而它们的仿真环境仍靠稠密重建搭建,Atlas 要替换的正是这一步。李飞飞的判断是,机器人现在最大的瓶颈是数据,芯片是以后的事。

人形机器人同理。眼下的主流做法是靠遥操作采集示范数据,训练视觉-语言-动作模型,数据又贵又慢;特斯拉也已演示把同一套神经世界仿真器用到 Optimus 上。Atlas 这类模型如果能把"拍几段视频、得到一个可训练的场景"做成流水线,最先改变的是人形机器人的数据从哪来,至于算法的策略架构怎么设计暂时还轮不到它。

两个大场景各只用了 24 帧手机视频;机器人那一侧的数字已经是实测

有可能动到算法路线的,是联合创始人 Justin Johnson 最近提的一个问题:一个仿真器既然已经懂得世界会怎样回应动作,为什么不能自己当规划器?方向说得通,但眼下只是路线图。判断它何时开始影响智驾,还需要关注三个点:行车视角的重建误差明显下降,模型开始输出动作,公布实时性和算力成本。不过,这三条目前一条都没有。

分类框架出自李飞飞 2026 年 6 月的《世界模型的功能分类学》,各家归类为本文判断

短期内,Atlas 能改写的是数据和仿真的成本,决策网络的结构还轮不到它来动。对机器人,它是新一代数据管道;对智驾,它还只是众多仿真器里的一个。

下一个轰动时刻会是什么

第一个看点是规模。按 Justin Johnson 的说法,模型每做大一档、训练更久、多上一批卡,效果都明显变好,眼下的瓶颈是训练算力;这次发布的尺寸是被发布日期倒推出来的,截止日前训得起多大就发多大。如果这条曲线还在早期,下一次跃升也许只需要更多的卡。

第二个看点是实时。RTFM 已经能在一块 H100 上实时出画面,Atlas 还没有任何实时指标。等 Atlas 的画质和 RTFM 的速度合到一起,再加上动态,人才能在生成的世界里实时走动,"在 4D 视频里散步"那天才算到来。

第三个看点更偏理论。OpenAI 联合创始人伊尔亚·苏茨克维有个著名的比喻:让模型读完一本推理小说,最后一句是"凶手是",它要是能填对下一个词,就说明读懂了整本书,所以"预测下一个词"被认为能通向通用智能。World Labs 主张"预测新视角"同样如此,李飞飞给的理由来自进化:自然给会动的动物长了眼睛,却没给树长,因为一动就会看到新的视角。她参与的 VSI-Bench 研究也发现,多模态大模型的空间推理明显不如人,让它多写几步推理没用,先让它画一张空间地图反倒有效。换句话说,空间能力不会从语言推理里自动长出来。

如果这个主张成立,下一个轰动时刻就不会是一段更炫的演示,而是"涌现":一个只练过预测新视角的模型,在没专门训练过的空间和物理任务上突然表现出能力,并从场景仿真器走到控制规划器。

在那之前,Atlas 更准确的定位是一套把三维采集成本打下一到两个数量级的基础设施,以及一场关于"下一个视角"能走多远的公开下注。

写在最后

虽然,Atlas 发布时没有论文和评测代码,基线是自己复现的,人评的题目也是自己出的。但是,演示足够惊艳,给了我们足够的想象空间,空间智能成为目前人工智能行业最值得期待的事情,他也会像LLM征服人类的表征世界一样去征服人类的潜在空间物理世界.

最后的最后来个小广告:
Vehicle联合机工社权威出版的《自动驾驶产品经理》,端到端了解自动驾驶产品技术以及如何做自动驾驶产品经理。

*未经准许严禁转载和摘录-获取本文参考资料方式:加入我们的知识星球可以下载公众号海量参考资料包含以上参考资料。

相关推荐

助力汽车行业、企业以及个人成长。公众号:Vehicle