• 正文
  • 相关推荐
申请入驻 产业图谱

从模仿到强化,端到端大模型走到了哪一步?

2小时前
132
加入交流群
扫码加入
获取工程师必备礼包
参与热点资讯讨论

2025年,全球端到端神经网络自动驾驶系统市场规模约为6.719亿美元。到2026年,这一数字预计将增长至7.415亿美元。

若将统计口径放宽至端到端智能驾驶解决方案,2026年全球市场规模预计将达到100.35亿美元,并有望在2033年增长至873.59亿美元。

市场的高速扩张背后,是技术路线的快速迭代。

过去两年间,端到端架构已基本完成了对传统模块化方案的替代。如今,行业关注的焦点正从能不能开转向能不能开得更好,这场转变的核心,其实是模仿学习向强化学习的技术跃迁。

01、模仿学习为什么不够用了?

过去几年,端到端自动驾驶系统的主流训练方式是模仿学习,这一方案就是让神经网络观看海量的人类驾驶数据,学习人在特定场景下会如何操作。

在这种框架下,原本独立的感知、预测、规划等模块被整合到一个统一的神经网络中,模型直接从摄像头等传感器的输入学习驾驶策略。

特斯拉在FSD V12上率先实现了这一思路,其将感知到控制的整个流程压缩进一个神经网络,从摄像头画面输入到方向盘、刹车指令输出,全部由一个模型完成。

模仿学习虽好,但其天花板很快就显现出来,因为模仿学习的本质是复现人类已有的驾驶行为,模型能学到的行为分布不会超出人类驾驶员曾经历过的范围。

这就导致了一个问题,自动驾驶最需要应对的安全关键场景,恰是人类驾驶员也很少遇到的极端状况。

这类场景在真实道路上的出现频率极低,数据采集成本极高,但它们直接决定了系统的安全边界。

即便采集了海量常规驾驶数据,模型在长尾场景上的泛化能力依然没有保障。

此外,模仿学习的训练目标仅仅是行为复现,而不是行为优化。

真实驾驶数据中混杂着大量不够安全或不够舒适的操作,如果训练目标只是让人工神经网络尽量拟合这些数据,系统会把人类驾驶员的缺陷一并学会。

同时,开环训练与闭环推理之间的分布偏移也影响着模型能力。

模型在离线数据集上表现良好,一旦部署到真实环境中与动态世界交互,每一步的微小误差都会逐帧累积,最终偏离正常轨迹。

这种现象称为协变量偏移,它是模仿学习在自动驾驶落地中最棘手的问题之一。

02、强化学习如何改变训练逻辑?

强化学习的训练逻辑与模仿学习完全不同,它不要求模型去模仿谁,而是给模型设定一个如安全、高效地完成驾驶任务这类的目标,然后让模型在一个环境里自己尝试、获得反馈、逐步优化自己的行为。

在自动驾驶场景中,强化学习主要采用深度强化学习框架,将深度神经网络与强化学习相结合。

由于驾驶涉及连续动作空间(方向盘角度、油门、制动等)和高维状态输入(多传感器数据),常用的算法包括深度确定性策略梯度(DDPG)、软演员-评论家(SAC)以及近端策略优化(PPO)等。

其中PPO因其训练稳定性和相对较高的样本效率,获得了最广泛的应用。

强化学习其实是一个持续的试错循环,智能体感知环境状态并做出动作决策,环境回馈一个奖励信号,智能体再根据这个信号调整后续决策。

在这个过程中,奖励函数的设计最为关键,需要同时兼顾安全性、舒适性、通行效率等多个维度,设计难度相当高,它直接定义了什么样的行为是被鼓励的、什么样的行为是需要避免的。

2026年,强化学习在端到端自动驾驶中的应用正在加速落地。

地平线6月发布的HSD V2.0,核心升级就是世界模型+端到端强化学习双技术底座;蔚来在2026年1月将世界模型+闭环强化学习架构全量推送至数十万辆车;Momenta在4月北京车展上宣布了强化学习世界模型的量产首发。

此外,高通AI研究院提出的CLEAR框架,通过在预训练VLA策略基础上学习残差路径点策略,实现了端到端自动驾驶的大规模闭环强化学习训练。

在CARLA longest6 v2和Bench2Drive等基准测试上,CLEAR取得了新的最优成绩。

香港大学李弘扬团队也联合华为、清华大学等提出的World Engine框架,将真实驾驶失败场景转化为可闭环交互的仿真世界,并利用强化学习进行后训练,在华为ADS的闭环验证中实现了碰撞事件降低45.5%。

03、世界模型,强化学习的训练场?

强化学习要发挥作用,需要一个可以让模型反复试错的环境,真实道路显然不允许这样做,没人会让一辆车在高速公路上通过试错来学习如何避险,这里就引出了世界模型的概念。

世界模型的作用就是在决策之前先模拟一下未来几秒内世界会怎么变化。

如当前方有一辆车正在减速,世界模型可以推演出这辆车接下来可能完全停下、也可能变道离开等多种可能性,并评估每种可能性下自车应该采取什么行动。

这种先想后做的能力,为强化学习提供了必要的训练环境。

2026年,世界模型与强化学习的组合几乎成了头部智驾企业的标配,智驾最前沿也探讨过这一趋势:为什么头部智驾玩家都在押注强化学习?

地平线HSD V2.0的世界模型+端到端强化学习双引擎驱动架构,让智驾系统在虚拟的物理世界中通过强化学习自主试错与成长。

英伟达于2026年6月1日在GTC台北大会上发布了Cosmos 3,该模型被定位为统一视觉推理、世界生成与动作生成的物理AI全基座模型。

在后续的CVPR 2026上,英伟达展示了基于Cosmos 3的物理AI智能体技能工具集,用于面向场景重建与闭环强化学习等任务。

在CVPR 2026上,理想汽车也一次性入选了12篇论文,其中4篇聚焦世界模型方向,分别从深度估计、三维重建、交通规则认知评估和安全风险预判四个层面展开,覆盖了世界模型从底层感知到高层决策的关键环节。

04、从开环到闭环,行业正在经历什么?

当前端到端自动驾驶正处于从开环模仿学习向闭环强化学习过渡的关键阶段。

开环模仿学习的优势在于训练效率高、实现相对简单,但泛化能力受限;闭环强化学习虽然能让模型在交互中持续优化,但面临仿真与真实环境的域差异以及计算效率等挑战。

正因如此,目前的主流做法是两阶段策略,即先用模仿学习进行预训练,让模型具备基本的驾驶能力,再用强化学习进行精细化后训练。

蔚来最新的技术架构就是世界模型+监督微调+闭环强化学习的三层训练框架。

除此之外,模型规模也正从百万参数迈向十亿参数级别;数据体量从TB级升级至PB级;训练迭代节奏也由月度压缩至每日迭代。

这些变化在技术维度上重新定义了端到端模型的能力上限,而市场需求的变化同样说明了这一趋势。

2024年L2及L2+级别智能驾驶渗透率为60%,2025年升至88%,预计2026至2027年将突破95%。

渗透率的快速攀升意味着自动驾驶系统需要在更广泛的场景中保持稳定表现,这对训练范式的升级提出了更迫切的需求。

与此同时,行业的技术路线也在持续分化与融合,VLA(视觉-语言-动作)模型在端到端框架中引入大语言模型作为推理中枢,让系统能够理解场景并做出可解释的决策。

而世界模型则让系统在内部模拟环境演化,预测行动之后世界会如何变化。

2025年到2026年初,这两条路线的争论非常激烈,但进入2026年下半年,越来越多的企业意识到,VLA和世界模型并非替代关系。

这两者一个负责理解现在该怎么做,一个负责预测这么做之后会发生什么,二者完全可以整合进同一个框架。

可以预见,随着强化学习训练框架的成熟和世界模型能力的提升,端到端自动驾驶系统的能力上限还将被持续刷新。

#自动驾驶 #模仿学习 #强化学习 #端到端大模型

相关推荐

登录即可解锁
  • 海量技术文章
  • 设计资源下载
  • 产业链客户资源
  • 写文章/发需求
立即登录