2026年,世界模型成为自动驾驶领域的新热点,蔚来、小鹏、理想、华为、特斯拉、Waymo,几乎每一家主流玩家都在谈世界模型,也都拿出了各自的技术方案。但细看下来,虽然都叫世界模型,各家的技术路线、落地方式和对这个概念的解读,差别其实不小。
01、蔚来,让世界模型直接开车
2026年6月,蔚来向超过70万用户推送了最新版世界模型,覆盖蔚来和乐道两个品牌、四个平台、两套完全不同的芯片平台。
蔚来世界模型最核心的特点是端到端直控。传统的智驾系统一般先由模型规划出一条轨迹,再由控制模块去执行。蔚来的做法是让世界模型直接输出方向盘、加速和制动踏板信号,不再经过中间层。路径更短,延迟也更低,这种端到端的运动学建模方式,被蔚来视作下一代智驾系统的控制基础。
在训练方法上,蔚来走的是世界模型+监督微调+闭环强化学习三层架构。2026年1月的版本首次将完整的闭环强化学习用于智驾研发,简单说,就是让算法先在NWM模拟的未来场景里试错和训练,学到能力之后再部署到车上。这种方法,让模型可以在虚拟环境中经历大量极端场景,而不需要真实车辆去冒险。
蔚来其实还面临一个挑战,那就是如何将同一套世界模型部署到跨度长达四年的十几款车型上。由于覆盖Orin-X和自研神玑NX9031两套芯片平台,这背后考验的不仅是算法能力,更是工程化能力。模型如何上车,数据如何回传,老款车型如何完成系统更新,测试流程如何设计,安全验证如何闭环,这些都需要逐一解决。
02、小鹏,VLA与世界模型两条腿走路
小鹏在CVPR 2026上首次公开了其世界模型技术图谱,小鹏的路线和蔚来不太一样,他们选择让第二代VLA与世界模型共同构成物理AI基座模型。
小鹏团队对这两者的分工讲得很清楚,第二代VLA主要从人类驾驶行为中学习,将视频流、指令与动作输出进行统一建模,使系统掌握在复杂交通环境中合理行动的能力;世界模型则通过对未来状态和场景演化的预测,学习物理世界的运行规律。
仔细区分两者做的事情,前者是让模型学习如何行动,后者是让模型理解行动之后世界会如何变化。
对于自动驾驶领域关于VLA还是世界模型的路线之争,刘先明在CVPR演讲中明确回应,小鹏物理世界基座模型,既是第二代VLA,也是世界模型。两者不是替代关系,而是通过不同的训练信号共同提升模型的能力。
小鹏汽车通用智能中心负责人刘先明在CVPR 2026上还阐述了其对世界模型的理解。他认为,世界模型的核心价值在于提供了远比人类驾驶行为更密集的监督信号。人类驾驶行为的监督信号是稀疏的,只能监督最终的行为结果,而世界模型可以预测每一帧画面、每一次运动、每一次交互,监督信号要密集得多。小鹏的世界模型借鉴了大语言模型中下一个Token预测的思路,通过在海量未标注视频上进行下一帧或下一状态的密集预测,逐步学习物理世界的规律。
基于这些理念,刘先明提出了优秀世界模型应具备主动思考、可控生成和长时序推演三大核心能力。小鹏随后正式发布了X-Mind技术框架,通过内嵌预测性世界模型,让车辆在做出动作之前先进行脑内推演,使自动驾驶从被动反应转变为主动决策。
03、理想,从底层技术入手,夯实基础
理想的路线和前面几家都不太一样,在CVPR 2026上,理想共有12篇论文入选,其中4篇聚焦世界模型。这4篇论文分别对应了世界模型从构建到应用的三个关键环节,从如何精确还原三维物理世界,到如何理解交通场景中的规则,再到如何预判危险后果,形成了一条完整的技术链路。
在场景重建层面,InfiniDepth将深度建模为神经隐式场,突破了传统离散网格的分辨率瓶颈。Unposed-to-3D则可以从真实驾驶图像直接生成高精度三维车辆,降低了仿真资产构建的成本。在交通规则理解层面,DriveCombo则是一个面向复杂交通规则推理的评测基准,用来评估模型对真实交通场景中各类规则的理解能力。
理想的世界模型布局更偏向于底层技术积累,他们不是在某个具体时间点发布了一个世界模型产品,而是通过持续的基础研究,将世界模型所需的关键能力一项一项做扎实。这种做法的好处是技术根基更深,但缺点是外界感知到的产品化进度不如蔚来那么直观。
需要说明的是,理想也在推进MindVLA-o1和马赫VLA司机大模型,走的是VLA路线。
04、华为,云端车端协同,强调安全
华为乾崑ADS 5的核心升级就是WEWA 2.0世界行为模型,其路线有一个鲜明的特点,那就是云端和车端分工明确。
在云端,华为的世界模型首次引入了多智能体博弈机制,训练强度提升了10倍。同时还采用在线强化学习,实现边生成、边学习、边验证,训练效率同样提升了10倍。在车端,WEWA 2.0引入了安全风险场理论,通过实时生成风险热力图来辅助决策。
华为明确表示,他们跳过了VLA这条中间翻译层的路线,直接采用世界模型架构,这样做的目的是降低时延和算力消耗。从技术选择上看,华为更看重世界模型在实时决策中的效率优势,而不是VLA带来的可解释性。
05、小米,把两条技术路线捏到一块
小米在2026年5月开源了Xiaomi OneVL,这是一个将视觉语言动作模型、世界模型和潜空间推理三条技术路线统一到同一套框架里的方案。在此之前,VLA和世界模型在自动驾驶领域是两条相对独立的技术路线,小米的做法是通过潜空间推理把两者打通。
OneVL采用双模态潜变量标记设计,视觉潜变量标记负责编码场景的物理因果结构,语言潜变量标记负责编码驾驶意图的语义表达。训练阶段还配了双辅助解码器,一个负责预测未来画面,一个负责重建推理过程,推理时这两个解码器全部移除,不增加额外开销。
这套设计可以让推理速度更快,OneVL的推理延迟最低0.24秒,大约只是传统VLA自回归推理方式的5.4%。在NAVSIM基准测试上,PDM-score达到88.84,第一次在潜空间推理这个方向上超过了显式思维链的88.29分。小米还把模型权重和代码全部开源了。
不过需要指出的是,OneVL目前仍处于学术验证阶段,从模型开源到真正工程化上车,中间还有不少距离。
06、Momenta,三层架构打通的供应商方案
Momenta在2026年4月发布了R7世界模型,和大多数世界模型不同,R7被定义为强化学习世界模型,也就是世界模型和强化学习共同构成物理AI的两大支柱。
R7的架构分三层,第一层是世界模型预训练,通过海量真实驾驶数据把物理规律、常识和因果关系压缩进模型,让系统形成对物理世界的基础认知;第二层是世界模型仿真,把世界模型用于自动驾驶的闭环仿真,让系统能够推演自身行为变化时环境会如何演变,同时对长尾场景进行性能评估;第三层是在前两层基础上构建高度真实的虚拟训练场,让系统在接近真实的环境中反复探索和试错。Momenta认为,这套机制可以让模型在罕见极端场景下的表现超越人类驾驶员水平。
相关报道提到,R7在预判前方车辆掉落物品、小动物突然横穿等突发状况方面,误制动指标优化超过3倍,车道内避让性能提升近5倍。R7已于2026年4月实现量产上车,基于超过120亿公里行驶里程和1亿段关键场景数据训练。凯迪拉克宣布将首发量产搭载R7世界模型的车型,上汽大众ID.ERA 9X也将率先搭载。
07、特斯拉和Waymo,两种不同的世界模拟器
特斯拉和Waymo代表了另一种世界模型的应用方式,那就是侧重于云端仿真。
特斯拉在2026年1月公布了一项名为《Ground Truth Heuristic Engine》的专利,公开了一种将真实车辆摄像头画面重建为3D模型的技术方案,并以此为基础生成近乎无限的训练场景。特斯拉AI软件副总裁Ashok Elluswamy在CVPR 2026上透露,其端到端大模型的运行频率达到36赫兹,远高于行业主流的10赫兹。Elluswamy还表示,特斯拉的目标是用单一端到端神经网络取代模块化架构,实现从自动驾驶汽车到人形机器人Optimus的基础模型统一。
Waymo的世界模型则建立在Google DeepMind的Genie 3之上。Genie 3已经不再只是一个生成模型,而是一个能够理解现实世界运行规律的世界模拟器。Waymo的训练框架分为预训练、中期训练和后训练三个阶段。预训练阶段直接利用Genie 3的通用世界理解能力,中期训练加入Waymo专属的传感器数据(多摄像头、激光雷达、毫米波雷达、高精地图),后训练阶段则针对具体驾驶任务进行微调和蒸馏。
但特斯拉和Waymo有一个共同点,它们都将世界模型当作一个强大的仿真引擎来用,用于生成海量训练场景和进行闭环测试。这和蔚来、华为把世界模型直接部署到车端做实时决策的思路,有本质区别。
08、怎么看这些差异?
表面上看,大家都在做世界模型,但仔细分析就能发现,各家对世界模型应该解决什么问题的回答并不一样。
蔚来将世界模型当作一个可以直接控制车辆的执行系统,追求的是更低的延迟和更细腻的控制;小鹏把世界模型当作基座模型的一部分,与VLA协同工作,一个负责理解物理规律,一个负责学习人类驾驶行为;理想从底层技术入手,先把深度估计、三维重建这些基础能力做扎实;华为强调云端车端协同,在云端用多智能体博弈提升训练效率,在车端用安全风险场保障安全;特斯拉和Waymo则把世界模型当作仿真工具,用来生成训练数据和测试极端场景。
这些差异背后,其实是各家对技术演进路径的不同判断,也跟各自的资源条件有关,有自研芯片和大量存量车辆的车企更倾向于将世界模型推上车端,而算力和数据积累深厚的公司则更侧重云端仿真。没有哪条路线是绝对正确的,但有一点可以肯定,世界模型正在从一个学术概念变成自动驾驶系统里真实运转的组件,这个过程还在加速。
#自动驾驶 #世界模型
151
