端到端被公认为实现L3级自动驾驶的最优路径,在端到端刚出来的时候,自动驾驶行业很多人都认为这一技术是实现 L3甚至L4自动驾驶最有可能的路径。但其黑箱特性使其在面对边缘场景时只能猜。面对施工路段、侧翻车辆等极端情况时,这个短板足以致命。端到端技术发展到现在,也延伸出了 VLA和世界模型技术,在这两者的加持下,自动驾驶系统处理边缘场景的能力是否会有所提升?
01、VLA给自动驾驶装上了理解的能力
VLA,即视觉-语言-动作模型,是在端到端视觉架构的基础上引入了自然语言推理能力。之所以会延伸出VLA的方向,是因为纯视觉端到端模型只有感知能力、没有理解能力,那就给它加上一个能思考的模块。
VLA模型由视觉编码器、大语言模型骨干网络和动作解码器三个核心组件构成。视觉编码器可以将摄像头画面转化成高维特征向量,大语言模型则对这些特征进行逻辑加工,动作解码器再把推理结果转化成转向、加速等物理动作。
三者放在同一个Transformer框架里,可以让感知、推理和执行在同一个语义空间里完成对齐。这种架构可以让系统不再只是看到障碍物和车道线,而是能理解这些元素背后的语义逻辑。如在一个人车混行的城市路口,传统端到端模型可能只知道哪里有个物体在移动,但VLA能理解这个行人可能正要横穿马路这样的意图。
理想汽车在2026年GTC上发布的MindVLA-o1,就是围绕3D空间理解、多模态思考和统一行为生成这几个方向做的尝试;英伟达推出的320亿参数Alpamayo 2 Super,也是将推理能力作为VLA模型的核心卖点。
不过VLA方案也不是没有短板。理想汽车基座模型负责人詹锟在GTC 2026上指出当前业界VLA方案存在三个关键痛点。分别是3D空间理解与语义推理之间的对齐效率不够理想,视觉语言行动传递链路过长导致决策延迟,以及长尾场景仅靠真实数据规模扩展难以覆盖。
吉利汽车集团CTO李传海也提出VLA有三大局限。即仅能匹配标准答案而缺乏规律性认知,依赖有限驾驶操作数据而非互联网海量视频,难以建模物理世界运行规律。三维空间感知能力薄弱也是VLA需要解决的问题之一。早期很多方案直接采用2D视觉语言模型,空间感知能力天然受限;即使引入3D空间表示来增强空间理解,又会面临与语言模型原有推理能力之间的平衡难题。
推理延迟同样棘手,自回归推理过程占据大部分延迟,高速场景下毫秒级延迟就可能影响驾驶行为。虽然2025到2026年的架构创新正在缓解这一问题,但延迟依然是VLA上车的核心障碍之一。此外,长尾场景数据覆盖成本高,靠真实路测难以穷尽,VLA参数量庞大,对车载算力和系统成本构成压力。有些学术研究还表明,这类模型对输入扰动高度敏感,推理可信度有待验证。这些问题说明,VLA虽然打开了新方向,但从理论到大规模可靠部署之间仍有不少问题需要解决。
02、世界模型让系统学会了预判
世界模型走的则是另一条路,它跳过语言中间层,直接在三维空间里做建模和预测。其可以让系统具备主动推演的能力,即在内部构建一个动态的、符合物理规律的虚拟交通场景,基于惯性、摩擦力、运动轨迹等物理因果,预判周边车辆、行人、障碍物未来的运动轨迹,从而提前几秒规划最优路径。这种能力对边缘场景尤其重要。
如前方突然出现一辆侧翻的卡车,搭载世界模型的系统可以在识别的同时就开始推演这个障碍物接下来会怎么运动、采取不同刹车力度会有什么结果,从而做出更合理的决策。而VLA方案在面对这类场景时,更多依赖的是从人类驾驶数据中学到的行为模式,缺乏对物理过程的直接建模和推演能力。这也正是两者在应对未知场景时推理路径存在的本质差异。
小鹏在CVPR 2026上展示了X-World世界模型,其输入包括历史多视角视频和未来自车动作,输出是未来一段时间内车辆可能看到的画面。这可以让自动驾驶系统做到如果车辆接下来执行某个动作,周围世界会变成什么样这样一个预判。
Waymo在2026年初发布的Waymo World Model,基于Google DeepMind的Genie 3架构,可以生成包含龙卷风、道路积水乃至大象闯入道路等罕见情形的仿真环境。这种生成能力让系统可以在虚拟世界里提前遇见那些真实路测中几乎不可能碰到的极端场景。但世界模型也并非全能,它的强项是底层物理推演,即判断物体会怎么动,但缺乏高层语义推理和社会规则理解,也就是无法做到应该怎么反应。它知道前方车辆可能会减速,但不太确定这种情况下按照交通规则应该怎么做。
03、两条路正在走向同一条
2026年下半年,VLA和世界模型融合的路线已经压过了两者相争的路线。小鹏在CVPR 2026上明确提出了双支柱的架构,其第二代VLA与世界模型共同构成物理世界基座模型的两大支柱。VLA的逻辑是向人类学习,即从驾驶视频和指令中学习人类在复杂路况下的决策习惯;世界模型的逻辑是向世界学习,也就是在海量未标注视频上进行逐帧预测,逐步习得物理世界的动力学和因果结构。前者提供稀疏但高密度的行为监督,后者提供密集的物理预测信号,两者正好互补。
理想汽车走的则是另一条融合路径。2025年,理想将空间理解、语言理解与行动决策统一到同一模型框架,构建了基于VLA、世界模型与强化学习三大技术栈的VLA司机大模型。2026年GTC上发布的MindVLA-o1进一步升级,在语言模型承担语义理解的基础上引入了预测式隐世界模型,在隐空间中高效模拟未来场景的变化。理想将这套架构定义为面向物理世界的通用智能体,同一套VLA模型可同时控制车辆与机器人。
从技术原理上看,这种融合确实提升了系统应对边缘场景的能力。传统端到端模型面对没见过的场景只能靠概率猜,而VLA+世界模型的组合让系统有了两条独立的信息来源,一条来自人类驾驶数据的语义理解,一条来自物理规律的因果推演。
当两条路径给出的结论一致时,决策的置信度会更高;当两条路径出现分歧时,系统也有了更多冗余和校验的空间。不过融合这个路径仍然存在不少问题,世界模型的实时响应、物理真实性和轻量化部署都还在突破当中;大模型本身的幻觉问题也没有完全解决。另外,VLA和世界模型都需要巨大的算力和数据支撑,这本身就是一道不低的门槛。
04、最后的话
那随着VLA和世界模型的技术成熟,是否会让自动驾驶汽车应对边缘场景的稳定性更高?从技术演进的方向来看,答案是肯定的。
VLA补上了端到端模型看不懂的短板,世界模型补上了想不到的短板,两者的融合让系统在面对未知场景时有了更多可依赖的推理路径,而不只是依赖训练数据里的统计规律。但智驾最前沿以为,更高不等于足够高,边缘场景的本质就是罕见和不可穷举,任何一个模型,无论训练数据多大、参数多少,都不可能见过所有可能的极端情况。VLA和世界模型的作用,是让系统在面对没见过的场景时,能够基于对语义和物理的更深入理解做出相对合理的判断,而不是完全依赖模式匹配去猜一个结果。
从这个方面说,这两项技术的价值不在于消灭边缘场景,而是让系统在面对未知时多了一些思考的能力,少了一些瞎猜的成分。这种转变对安全性的提升是肉眼可见的,但离真正的稳定可靠还有一段路要走。
#自动驾驶 #端到端 #边缘场景
121