在今年的GTC 2026 的最后一天,英伟达 AI 研究副总裁、多伦多大学教授 Sanja Fidler 讲了一场 40 分钟的自动驾驶专题。前 25 分钟是演讲,后 15 分钟是两位华人研究员在台上做现场演示:先让英伟达自己的驾驶策略模型 Alpamayo 在一个完全由世界模型实时生成的城市里闭环开车,再把方向盘交给人,最后拉了两位观众上台体验其产品。
当然这次演讲,主要是推广其名为AlpaDreams 的世界模型:一个基于Cosmos 基础模型,用了 2000 万小时视频、9000 万亿 token 训练,再用 2 万小时自动驾驶数据做后训练形成的,只有 20 亿参数,去噪从 50—100 步压到 2 步,单块 GPU 上 220 毫秒出 12 帧、54 FPS的仿真世界模型。
这场会有几个数字值得先放在前面:英伟达自动驾驶产品团队每天在重建场景里跑 200 万次测试,一年训练几千个策略版本;
但比数字更值得看的,是英伟达对"仿真"这件事的定位。Fidler 的原话是:"最终装进车里的那个模型是明星,但每个明星背后都有一个巨大的剧组。"她讲的不是车端模型,而是那个剧组:用什么方法、多快的速度、多大的规模,去挑出哪一个策略版本可以上车。中国行业过去两年把"世界模型"讲成了车端能力的一部分,英伟达这一场把它讲成了开发基础设施。
所以,本文按演讲的章节走,每一章先把 PPT 和演讲原话里的信息讲清楚,再从中国汽车自动驾驶行业学习和点评的角度给出看法。来分析英伟达的仿真世界模型以及其背后透露的自动驾驶算法训练和仿真的方法论。
S82446《用世界模型推进自动驾驶》,演讲人 Sanja Fidler,英伟达与多伦多大学
一、开场:AI 的四次浪潮与"第一个到来的机器人"
从 AlexNet 到物理 AI
2012 AlexNet → 感知 AI → 生成式 AI → 智能体 AI → 物理 AI;英伟达把自动驾驶和通用机器人放在曲线的最高点
Fidler 用一张 AI 演进曲线开场。AI 在 80 年代甚至更早就存在,但 2012 年是让人相信"新时代要来了"的时刻。她讲了一段亲历:当时她在多伦多大学做博士后,亲眼看到 Hinton 和学生做出 AlexNet,"Alex 每三周来一次组会,展示他又打破了哪些记录,你能感觉到有什么东西要变了"。然后是不到五年前的 ChatGPT,AI 第一次触达大众;再到这届 GTC,智能体 AI 是全场主角,已经在给企业创造价值。
下一步是物理 AI——最终会遍布身边的机器人。她把自动驾驶汽车定义为"可能第一个到来的机器人,极难构建,但很可能是第一个带来大规模价值的"。
AV 1.0 到 AV 3.0
AV 1.0 感知 AI → AV 1.5 感知加基于模型的规划 → AV 2.0 生成式 AI / 端到端 → AV 3.0 智能体 / 物理 AI(推理型 VLA)
自动驾驶的技术演进被她分成四段:最早 AI 只做感知,理解周围有什么;然后机器学习进入控制和规划;再到生成式 AI 的端到端系统,从传感器数据直接到动作,"完全靠数据训练,变得更加以数据为中心"。她把正在到来的这一代叫 AV 3.0:基础模型、大语言模型、世界模型一起驱动机器人的大脑,去解决最后那一批边缘案例。
Vehicle 点评
第一,英伟达的分期和中国行业的叙事对得上,但重心不同。国内头部车企和供应商从 2025 年起普遍把"VLA""世界模型""端到端 2.0"作为下一代方案的名字,本质上和英伟达的 AV 3.0 是同一件事。区别在于国内讲的是车端模型的推理能力,Fidler 这一场几乎没花时间讲车端策略 Alpamayo 本身,全部篇幅给了"怎么评价和训练它"。这个重心差异贯穿全场。
第二,"第一个到来的机器人"这个定位对中国智驾行业是利好,也是提醒。英伟达把自动驾驶当成物理 AI 的先导市场,意味着 Cosmos、NuRec、仿真框架这些通用机器人工具会先在汽车上打磨成熟,再复用到人形机器人和工业机器人。国内做智驾的团队手里的能力是可以往机器人迁移的,反过来,做机器人的公司也会进入智驾的供应链。
二、明星与剧组:为什么仿真是 AV 开发的核心工具
这是大家常见的那张图:驾驶策略是机器人的大脑,接收传感器数据和指令,输出一段推理,再输出一个动作——通常是一条轨迹,再由控制模块执行。"这是所有人最兴奋的模型,是明星。"
然后她讲了一个开发流程里的算术题。在开发过程中要训练很多版本的策略,"我想英伟达一年是几千个"。不可能把每个版本都装上车、开一圈、看有没有变好、再回来改,"已经没有时间这么做了"。选策略的方法只能是一个像游戏引擎一样的仿真器,立刻给出信号。但这也意味着仿真器必须超级真实、足够多样,"基本上得看起来像真实世界"。
她给了一个结果:在一年里,英伟达的策略从第一次做出端到端模型,到年底已经能"非常非常出色地驾驶",她上周六刚和英伟达汽车业务负责人吴新宙一起试驾过。
Vehicle 点评
第一,"一年几千个策略版本"这个数字是仿真的需求方定义。国内对仿真的讨论常常从供给侧出发——重建精度、渲染速度、场景库规模。英伟达从需求侧倒推:每年几千个候选模型,每个都要被评价,所以要有每天 200 万次的闭环测试能力。国内车企可以拿这个口径自问:一年迭代多少个版本,每个版本用什么信号决定上不上车,这个信号多久能拿到。
第二,"仿真训练"如何靠谱是难题。国内头部车企有几十万到上百万辆车在路上回传数据,"影子模式"让实车信号相对便宜。但影子模式给的是开环信号——模型的输出和人类驾驶员的差异,不是模型真的开了之后世界怎么反应。英伟达这一场的核心是闭环:策略开出去,世界做出反应,再回到策略,当然我们之前写特斯拉的文章《特斯拉世界模型专利全解读:从“看见”到“想象”,Physical AI 的进化奇点》也点到,特斯拉就是采用这种闭环训练。车队规模能替代的是数据收集,替代不了闭环评价。
三、仿真 1.0 到 2.0:从游戏引擎到神经重建
手工建模的天花板
仿真 1.0 图形学:美术师手工制作全部资产、光线追踪、可做物理保真仿真;仿真 2.0 神经重建:从真实行车数据重建资产、神经基元光追、视觉保真地重演真实路况
Fidler 七年前加入英伟达时,评估器还是基于图形学的游戏引擎。问题是所有内容都要人工制作:"如果我想在旧金山某个新路口测试,要等一两个月,等美术师把环境做出来",这样的流水线没法扩展到全世界。
2020 年神经辐射场(NeRF)出现,之后是高斯泼溅,"那篇论文出来的第二天,我们就说这个技术的杀手级应用会是自动驾驶仿真"。原因很直接:自动驾驶有几十万小时的真实录制数据,每一段现在都能用 AI 重建成 3D,变成一个可以回放、可以让策略去经历新情况的仿真环境。
NuRec:已经在产线上跑了一年
显式高斯粒子表征,静态与动态部分解耦,动态物体可用现成行为模型控制;英伟达每一个量产策略模型都要过闭环评价,"多数版本过不了这一关";几十万个重建场景,每天 200 万次测试
她简单讲了重建的工作方式:先得到一个网格,作为路面的碰撞几何,让车知道该在哪开、哪有减速带;再把所有动态资产重建出来,之后可以基于行为模型重新摆放。整个场景被解耦成"非常容易操控"的形态。
这套技术栈叫 Omniverse NuRec,"是我们在英伟达交付过的最大的一次技术落地":已经在生产环境运行,过去一年一直在给自动驾驶产品团队创造价值,重建了几十万个场景,每天跑 200 万次测试,"就是用来选哪个策略上车的那个工具"。PPT 上还有一句演讲里没念的话:英伟达每一个训练出来的量产策略模型都要通过闭环评价,多数版本过不了这一关。
这周开放了什么
工具与库:NCore 时序视频数据格式(GitHub);生成式模型:Fixer 去伪影、Asset Harvester 图像到 3D 资产(Hugging Face);数据:1000 个预重建场景、Physical AI 数据集中 30 万个场景;工作流:NuRec 容器(NGC)、AlpaSim 开源仿真框架(GitHub)
英伟达已经开源了一部分,GTC 上又发布了新的代码和模型,"接下来几个月还会有更多"。她点了三类:数据工具,高效处理视频数据、快速重建;生成式模型,用来增强仿真——重建通常只在离原始轨迹几米范围内有效,生成模型可以让你做一次甚至两次变道;资产采集(Asset Harvesting),本周刚发布,"每一个动态物体,即便只从侧面看到,我们也能在所有方向上补全",包括行人,代码已经放出。
Alpamayo 在旧金山行驶的原始场景,右侧四格:原轨迹重建、插入滑板车、新轨迹加摩托车、新轨迹加锥桶;NuRec 流水线给 Alpamayo 开发提供 10 倍场景多样性
她放了一组视频:左边是原始录制,然后是完整重建,再从别的场景里"采集"来的滑板车、摩托车、锥桶被放进这个场景。"这样你可以给同一个场景做很多变体。" PPT 的标题写的是这条流水线给 Alpamayo 开发带来 10 倍的场景多样性。
随后播放的一段宣传片补了几个信息:NuRec 不只用于道路,也用于厨房、办公室、仓库里的机器人;3D 高斯场景已经支持物理交互;NuRec 与 Cosmos 结合后可以用一句文本提示生成 3D 仿真环境,这项"文本到 3D 环境"的新版本本周末发布。
Vehicle 点评
第一,"每天 200 万次闭环测试"是一个可以拿来对标的运营指标。国内车企公开讲仿真时,常用的口径是"仿真里程 X 亿公里"或"场景库 Y 万个"。英伟达的口径是每天的闭环测试次数和被筛掉的策略比例,这更接近一个研发流水线的吞吐量指标。两种口径不能直接换算,但后者更能说明仿真是否真的嵌在了发版流程里,而不是一个平行的展示项目。
第二,"多数版本过不了闭环评价"这句话值得国内团队认真读。它的含义是:在英伟达内部,仿真不是给模型加分的,是给模型判死刑的。国内不少团队的仿真环节仍然偏向"回归测试"——确认新版本没有把已知场景做坏,而不是主动用它淘汰候选版本。仿真的价值上限,取决于组织愿不愿意让它拥有否决权。
第三,资产采集和开源策略对国内仿真供应商是双刃剑。NCore 数据格式、Asset Harvester、AlpaSim 全部开源,1000 个预重建场景直接放出。这一方面压低了"重建型仿真"作为独立产品的价值——国内做重建仿真的初创公司会面对一个免费的基线;另一方面,英伟达的重建工具链默认是 Omniverse 和自家 GPU 的生态,国内车企用它就意味着仿真侧也绑在英伟达上。车端芯片的国产替代讨论了很久,仿真侧的依赖度反而在上升。
四、仿真 3.0:生成式世界模型
重建做不到的事
仿真 3.0:渲染与仿真完全由生成完成,内容创造不再受数据湖限制,可仿真复杂的视觉和行为效果(关节运动、恶劣天气等)
NuRec 已经在创造价值,"但我们是研究人员,这不是停下的地方"。有很多东西重建做不到:"车顶绑一张床垫,这就已经很难;任何天气,比如加上雪、路上有雪泥,超级难。"然后她放出一段雪天画面:这是 AI 生成的。
生成式仿真建立在"学会如何仿真"的模型上。这些模型不是从一段片段学习那段片段,而是从海量数据里学会世界如何运作,"给定过去的帧,无论策略接下来想做什么,它都能凭数据先验生成接下来的帧"。她对天花板的判断是:"考虑到大语言模型的成功,很难想象它会在哪里失败。"
Cosmos-Drive-2 的文本条件视频生成、Gen3C 的大偏移新视角合成、ChronoEdit 的场景编辑(移除路上物体、在路边加一群幼儿园小孩)
她放了几段结果,并特意解释了两句:这些画面里没有人受伤,"全部是生成的",而且看起来不真实是因为"我们没有那种数据";在驾驶里其实不需要仿真碰撞,"一旦碰撞就停止,游戏结束,机器人本来就不该那样"。生成模型的价值是三件事:能做重建能做的新视角,而且可以远远偏离原车轨迹;编辑变得极其容易,"写一句提示词,加个行人、换辆车、全部抹掉、在路上加几个小孩";以及重建做不到的天气和长尾。
Vehicle 点评
第一,"重建为主、生成为辅"是英伟达此刻的真实姿态,和国内的宣传口径有落差。国内不少发布会把"世界模型生成训练数据"讲成主线,但英伟达这一场说得很清楚:在产线上每天跑 200 万次的是重建,生成式模型刚刚做到实时,主要用途是"增强"重建——补几米之外的视角、加天气、加长尾物体。生成的上限高,重建的下限稳。国内团队如果在两条路线上只能押一条,英伟达的答案是先把重建做成基础设施。
第二,"不仿真碰撞"是一个评价哲学,国内应该讨论。国内讨论世界模型时常提"生成极端 corner case,让模型学会处理事故"。Fidler 的立场是碰撞发生即终止,不需要生成碰撞后的画面,因为策略在那之前就已经失败了。这背后是把仿真当成裁判而不是教材。两种思路都成立,但把两者混在一起会导致对"世界模型需要多真实"的要求完全不同。
五、Cosmos:一切的底座
Cosmos Predict 2.5(世界生成,可完全定制)、Cosmos Transfer 2.5(照片级数据增强)、Cosmos Reason 2(物理 AI 推理视觉语言模型);Hugging Face 下载超过 600 万次,Azure / AWS / GCP 可用
接下来展示的一切都建在 Cosmos 上。Cosmos 一年前的 CES 首发,已经迭代到 2.5 版本,有三个模型:Predict,给一帧图和一句提示,生成几秒视频;Transfer,可以给更详细的条件,比如分割图或带车道线和物体立方体框的 HD 地图,"这时 Cosmos 更像一个高级渲染器";Reason,接收视频、进行推理和分析、生成描述。今天主要用前两个。
预训练数据分布:驾驶 11%、手部与物体操作 16%、人体运动 16%、空间感知与导航 16%、第一人称 7%、自然动力学 20%、相机动态 8%、合成 4%;2000 万小时视频、9000 万亿输入 token、2000 多小时训练;后训练:2 万小时多传感器英伟达自动驾驶数据加外购数据集,公开 1700 小时多相机数据
Cosmos 用 2000 万小时视频训练。"英伟达承担了这个成本——难以置信的成本——不只是数据,还有训练这些模型的基础设施,而且全部开源。"然后按应用做后训练:在自动驾驶这一块,"拿吴新宙团队手上的几万小时数据做后训练,它突然就能仿真行车视频了"。PPT 上的口径是 2 万小时英伟达自有多传感器数据加外购数据集,公开了约 1700 小时多相机数据(演讲口头说的是"将近 2000 小时")。
Vehicle 点评
第一,数据分布这张图是国内车企最该看的一页。Cosmos 预训练里驾驶数据只占 11%,其余是人手操作、人体运动、导航、自然动力学等通用物理视频。英伟达的逻辑是:世界模型的"物理常识"来自通用视频,驾驶只是后训练的一个下游。国内车企手里几十万辆车的行车数据很多,但几乎没有通用物理视频的积累,这意味着国内自研世界模型如果从头训,物理先验的来源是短板;如果用开源基座,就要接受基座在别人手里。
第二,"2 万小时后训练就够用"对国内是好消息。后训练所需的驾驶数据量级是几万小时,不是几百万公里,这是国内任何一家头部车企都拿得出来的规模。真正的门槛不在数据,在基座和算力:2000 万小时视频、9000 万亿 token 的预训练,国内除了少数几家没人会重做。所以国内的现实路径大概率是"开源基座 + 自有驾驶数据后训练",这也是英伟达开源 Cosmos 想要的结果。
第三,注意合规边界。Cosmos 开源、Hugging Face 可下载,但英伟达发布的 1700 小时多相机数据采自美国。国内车企如果用海外数据做后训练再上国内车,或者反过来把国内数据送进海外托管的模型,都会撞上数据出境和地理信息的监管。技术上"拿来就能用",流程上要过几道门。
六、AlpaDreams:从几分钟一段到实时可交互
第一位驾驶员是黄仁勋
因果自回归视频模型,可与策略交互生成长达数分钟的驾驶,B300 上实时推理最高 54 FPS(此前需要数分钟),已集成进闭环系统;右图是黄仁勋在办公室试驾
GTC 上宣布的 AlpaDreams 是这个模型第一次做到实时。去年生成五秒视频需要几分钟,现在实时、可交互、可以让用户在环。"我们的第一位驾驶员是 Jensen"——一个月前的一次研究会议上,团队把设备搬进他的办公室,他第一个开。"他抱怨说和他的法拉利不一样,但总体上给了绿灯,让我们在 GTC 讲。"
2026 年 3 月 AlpaDreams:因果自回归、策略在环生成数分钟、2B 模型质量相当、B300 上最高 54 FPS、闭环集成;2025 年 3 月 Cosmos-Drive-Dreams:双向视频扩散、生成 5 秒片段、7B 模型、延迟数分钟、只适合开环
对比一年前:上一代模型从文本提示生成五秒视频,要更长就得逐段接续,几步之后质量退化,最多 20 秒高质量;每段几分钟,"能看到未来,但完全不实用";而且只适合开环——没有策略在环,只是给一段视频。AlpaDreams 变成自回归的,能对策略或用户的每一步动作快速反应,并且实时。
闭环怎么接起来
策略模型(Alpamayo 1)或人类用户输出动作 → 仿真运行时 AlpaSim 更新抽象状态(含交通参与者)→ 世界模型 AlpaDreams 渲染合成相机帧 → 回到策略
整体架构是:左边策略输出动作;进入仿真运行时 AlpaSim,它编排各种 API,比如一个交通模型来移动动态物体的框;再调用世界模型 AlpaDreams 做渲染;渲染出的帧回到策略,循环往复。
输入:下一步的抽象世界状态(HD 地图与物体框)、文本提示、历史帧缓存;自回归因果视频生成;输出:下一步传感器画面
模型接收三类条件:文本提示,指定场景里发生什么;第一帧和之后的历史帧缓存,"这意味着你可以直接拿真实世界的一帧当起点";以及地图——车道线在哪、动态物体在哪。给地图条件有两个原因:一是能真正控制场景长什么样,二是质量好得多——"驾驶太复杂了,路上有太多东西,不给条件就只能生成比较无聊的场景"。
Vehicle 点评
第一,"HD 地图 + 物体框"作为条件是 AlpaDreams 和国内多数世界模型的一个关键差异。国内讨论世界模型常常强调"端到端生成、不依赖结构化输入",英伟达反而把结构化的抽象状态作为主条件,理由很朴素:可控、质量高。这带来一个连锁:AlpaSim 里的交通模型决定别的车怎么动,AlpaDreams 只负责把它画出来——行为和外观被拆成两层,各自可替换。国内团队如果把行为和渲染揉在一个模型里,好处是省了中间表示,代价是场景不可控、评价不可复现。
第二,"用户在环"不是噱头,是一个新的评价手段。让工程师握着方向盘在生成的世界里开,能在几分钟内感知模型的物理一致性——转弯时车身是否跟着动、雨天雨刮是否自动出现、开上人行道会不会穿模。这是自动化指标很难捕捉的东西。国内团队多数把世界模型的输出当训练数据或离线指标,很少把它做成"可以开"的东西。
七、怎么训出来的:四阶段后训练
Cosmos 基座模型 → Cosmos-Drive 后训练 → 因果训练 → 自强迫与蒸馏 → AlpaDreams 模型
Fidler 说"想要极致速度",所以选了 20 亿参数的 Cosmos 模型做起点,然后分阶段后训练,让它既实时又可交互。她愿意讲得技术一点,下面按她的顺序。
预训练视觉基础模型 Cosmos-Predict2.5-2B 加真实驾驶场景(RDS)数据集;加入 HD 地图条件实现精确布局控制;扩展到多视角生成
后训练拿 2 万小时自动驾驶数据继续训练 Cosmos。训练末期加入新条件——车道线(HD 地图)和动态立方体框,"现在这个模型变得可控了"。然后是多视角:机器人不止一个摄像头,这里聚焦相机,演示用四视角模型,目前最多可以做到七个相机。
因果注意力,适配自回归生成,配合 KV 缓存实现高效推理;Causal DiT 从历史干净帧和当前噪声帧生成下一帧
因果化原来的模型是把多帧一起去噪、一次性生成五秒。这里要改成循环的方式:从噪声出发生成一张干净图像,然后反复。"这是基于扩散的,如果有人了解的话。"这又是一轮后训练,"训出这样的模型大概几天"。
双向多步教师模型蒸馏为因果两步学生模型;从噪声自回归展开;英伟达开源库 FastGen 实现了这些算法
蒸馏扩散模型从噪声到干净图像通常要 50 甚至 100 步去噪,"如果要让方向盘控制这个模型,显然承受不起"。所以再做一轮后训练,把去噪压到两步。"每一步都有一点质量损失,但实际上非常接近原始模型。"她给了一个链接:英伟达开源的 FastGen 库实现了这些算法,"大家也可以自己搭"。
Vehicle 点评
第一,"20 亿参数、两步去噪"是一个工程取舍,而且是可复现的。和一年前的 70 亿参数、几分钟一段相比,AlpaDreams 走的是"小模型 + 蒸馏 + 因果化"的路。四个阶段各自都有开源的算法和代码(Cosmos、FastGen),训练周期是"几天"。这对国内团队的含义是:做一个能实时交互的驾驶世界模型,门槛已经从"要有基座模型团队"降到"要有一个懂扩散蒸馏的小组"。差距不在方法,在数据和迭代速度。
第二,"七个相机"是英伟达对量产传感器配置的一个默认假设。四视角演示、七相机上限,对应的是英伟达自己车队的传感器布局。国内车企的相机数量和布局各不相同(7 到 11 个相机是常见区间,有的还有激光雷达),用开源模型做后训练时,多视角一致性这一层大概率要自己重训。
八、性能与效果:220 毫秒、54 FPS、一块 B300
单视角模型:1 GPU 220 ms / 54 FPS,16 GPU 146 ms / 82 FPS;四视角模型:1 GPU 1290 ms / 12 FPS,16 GPU 152 ms / 105 FPS;单视角每块 12 帧、四视角每块 16 帧,两步扩散,704×1280 分辨率
横轴是 GPU 数量,推理可以跨多卡并行;纵轴是延迟——等多久拿到一批帧。模型不是逐帧生成,而是一次 12 帧,模型是 30 FPS,所以一批大约三分之一秒的内容。单视角模型在一块 GPU 上 220 毫秒,16 块能降到接近一半;四视角模型在一块 GPU 上要超过一秒,但多卡之后可以和单视角一样快。"100 毫秒左右,加上方向盘实现上的一些小技巧,就跨过了实时的门槛,人会觉得自己在开一个游戏引擎。"吞吐上,每批 12 帧折算下来单卡 54 FPS。
效果上她挑了几点:模型对弱势道路使用者(VRU)——行人、自行车——生成得不错;雨天会自动出现雨刮,"我们没告诉它要刮,它从数据里学到下雨就该刮,而且非常一致,物理某种程度上被学进去了";多视角一致性完全是学出来的,"没有特殊技巧,就是一个 Transformer 去关注多个视角,学到跨视角的 3D 一致性"。
同一段原始场景,一句"改成夜晚"、一句"下雪",四个相机同步变化,冬天的树也跟着变了
编辑是她最喜欢的部分:"神经重建根本做不到这一点,或者至少难得多。这里一句提示词,同一个场景可以变成夜晚、变成下雪,它甚至把树也改了,因为冬天的树看起来不一样。"
最后是全链路对比:左上是条件,对两个渲染引擎相同;右上是 AlpaDreams,右下是重建;左下是真正在开的自动驾驶软件,输出轨迹。两者看到的第一帧一样,但重建看的是整段原始片段,一旦偏离原轨迹就会变差,"生成模型会继续画下去,也许开始编造,但它继续画"。她特别点了人:"人很难重建,特别是腿,因为动得快,从行驶的车上重建尤其难;生成式做得相当好,它从数据里学会了人长什么样。"(现场这段视频没放出来。)
Vehicle 点评
第一,性能数字要连着分辩率和批次读。54 FPS 是单视角、704×1280、每批 12 帧、两步去噪的结果;四视角单卡只有 12 FPS,要 8 卡以上才过实时。国内如果有团队对标这个数字,要对齐同样的口径,否则"我们也做到了实时"没有意义。另一个细节是演示跑在一块 B300 上——这是英伟达最新一代数据中心 GPU,国内可以买到的算力和它有代差,同样的模型在国内可用的卡上延迟会是另一个数字。
第二,"重建看整段、生成看首帧"这个对比设计很公平,也很说明问题。它把两种方法的边界画得很清楚:在原轨迹附近,重建更真实;离开原轨迹,生成更稳定。国内团队评价世界模型时常用 FID、FVD 这类离线指标,英伟达用的是"同一条规划轨迹下两种渲染谁先崩",这是更贴近用途的评价方式。
第三,雨刮自动出现是一个小细节,但说明了后训练数据的价值。模型学到"下雨就刮"不是因为有人标注,而是英伟达自有车队的数据里雨天和雨刮总是同时出现。国内车企手里的数据在天气、路况、车型上的多样性远超英伟达的 2 万小时,这是国内做后训练的真正优势——不是数据多,是数据的分布更接近国内的真实路况。
九、现场演示:先让模型开,再让人开,最后让观众开
演示由英伟达空间智能实验室的两位研究员 Jia Liang 和 Rui Long 完成,Fidler 介绍说"他们过去几个月没睡觉"。设备是一台桌面 DGX 加一套带力反馈的方向盘和踏板,"这是 Jensen 一直在玩的东西"。
第一段:Alpamayo 闭环"第一次在舞台上展示":策略模型 Alpamayo 生成轨迹,作为 AlpaDreams 的输入;AlpaDreams 生成下一帧,Alpamayo 再在里面导航,全部闭环。画面是一片生成的城区,方向盘自己在转,"因为策略决定从这里转弯",有阴影、阳光和多视角一致性。Rui Long 强调这是真正的实时生成,"看起来像视频,是因为一切都在闭环里"。然后换了一次天气——"只是替换了第一帧和文本提示",同一个场景变成雨天;再在路中间放了一个箱子,屏幕顶部滚动的是 Alpamayo 的思维链:"稍微向左偏一点,因为有个箱子,要留出空间。"
第二段:人开Rui Long 接过方向盘,单视角模式,"这台小 DGX 里就能跑,一切本地运行"。他的方向盘输入被渲染成 HD 地图,作为视频模型的条件,模型在 DGX 里自回归地生成画面。过程中他开进了自行车道、逆行、开上人行道、做了一个掉头,"我不知道怎么掉头,但我就这么做了";切到雪天时雨刮自动开了,"这是新东西";切到雨天时镜头模糊到看不清路。Jia Liang 解释一致性来自 KV Cache 存下的历史生成结果,并且特意讲了一句:长时程自回归视频生成"一直是整个学界很有挑战性的研究问题",而 AlpaDreams 可以连续开几分钟仍然合理、一致。速度加到 60 时 Jia Liang 喊了"太快了"。
第三段:观众开"为了证明不是事先安排好的",两位观众先后上台。一位开进了一栋楼,一位开出了地图边界,"它还能正常工作"。Fidler 在台下的评价是"力反馈不错";上台的观众下来后说:"这比看起来难。"
Vehicle 点评
第一,这是一场"敢让它失败"的演示,国内发布会很少这么做。让观众随机上台、开出地图、撞楼,任何一步都可能出现穿模或崩坏。英伟达敢这么做,说明他们对模型在分布外的行为有把握,也说明他们把"崩了也没关系"当成研究演示的正常状态。国内发布会的智驾演示多数是预录或高度受控的,这不是技术差距,是文化差距,但它会影响外界对技术成熟度的判断。
第二,"一切本地运行"这个细节对国内有实际意义。单视角模式在一台桌面 DGX 里就能跑,意味着这类世界模型不需要机房,可以放进每一个算法工程师的工位。国内车企的仿真资源普遍集中在云端集群,排队等算力是常态;如果世界模型可以下沉到工位,迭代节奏会完全不同。
遗憾的是,本次演讲中,Alpamayo 策略模型本身的架构、参数量、训练细节都没有展开。
十、写在最后:中国行业能从这场演讲里拿走什么
把九个章节拢起来,英伟达的答案其实是一句话:先用神经重建把闭环评价做成每天 200 万次的基础设施,再用生成式世界模型补重建做不到的部分,两者共享同一个运行时、同一套抽象状态,策略模型在其中被反复淘汰。站在中国行业的角度,我认为有五条可以直接拿走。
一、"世界模型"在英伟达是研发工具,不是车端卖点。整场演讲没有一页讲车端算力、没有一句讲量产时间,全部在讲怎么训练和评价。国内过去两年把世界模型和 VLA 当成向消费者讲的差异化,但真正决定迭代速度的是仿真侧的世界模型。两件事都叫世界模型,投入的团队、算力和考核指标应该分开。
二、重建先于生成,否决权先于场景数。英伟达在产线上跑的是重建,每一个量产候选都要过闭环评价,"多数版本过不了"。国内团队如果仿真还停留在回归测试和演示,第一步不是上生成式模型,而是让现有仿真对发版拥有否决权。
三、开源基座会把"世界模型"的门槛拉平,差距转移到数据分布和迭代速度。Cosmos、NuRec 工具链、AlpaSim、FastGen 全部开源,训练一个实时交互的驾驶世界模型只需要几万小时数据和几天时间。国内头部车企的优势是数据分布更贴近国内路况;短板是基座、算力和最新一代 GPU 的可得性。用开源基座加自有数据后训练是现实路径,但要接受仿真侧对英伟达生态的依赖在上升。
四、把行为和渲染拆开。AlpaSim 决定交通参与者怎么动,AlpaDreams 决定画面长什么样,HD 地图和物体框是两者之间的接口。这个分层让场景可控、评价可复现、模块可替换。国内团队在设计仿真架构时,值得把这个接口定义下来,哪怕生成模型本身用的是别家的。
五、让工程师握上方向盘。用户在环、桌面 DGX 本地运行、观众随机上台,这一串动作的共同点是把世界模型从"离线指标"变成"可以开的东西"。物理一致性的很多问题——雨刮、掉头、开上人行道——是人开几分钟就能感知、自动化指标却很难捕捉的。这是一个成本很低、但国内很少做的事。
最后说一个细节。Fidler 讲到一年前那代模型时说:"你能看到未来,但它不实用。"一年之后,她把方向盘交给了随机上台的观众。中国行业在世界模型上不缺"看到未来"的发布会,缺的是把它变成每天跑 200 万次、每个人工位上都能开的那个剧组,也就是落地。
最后的最后来个小广告:
Vehicle联合机工社权威出版的《自动驾驶产品经理》,端到端了解自动驾驶产品技术以及如何做自动驾驶产品经理。
参考资料以及图片
- 【PPT】Advancing Autonomous Vehicles With World Models / Sanja Fidler
*未经准许严禁转载和摘录-获取本文参考资料方式:加入我们的知识星球可以下载公众号海量参考资料包含以上参考资料。
327
