2026年,Waymo研究团队在CVPR 2026发布了WOD-E2E(又称Rare-E2E)端到端驾驶数据集。该数据集从约640万英里真实路测中挖掘出4,021段、约12小时的驾驶片段。其中专门整理了日常驾驶中发生频率低于0.03%的长尾场景,并提出了RFS(Rater Feedback Score)评估指标,用以衡量驾驶行为是否合理、稳定。其实当端到端自动驾驶系统能够稳定处理大量常见驾驶场景后,真正暴露模型能力边界的,不是那些重复出现的正常道路,而是这些少见、复杂、容易出问题的场景。
01、为什么系统越成熟越要主动找错?
端到端自动驾驶需要从大量驾驶数据中学习环境变化与车辆行为之间的关系。跟车、变道、通过普通路口等高频场景,可以通过持续积累获得大量训练数据,但真实道路中还有另一类数据,它们出现得少,却更容易让系统暴露问题。像是前车突然切入,行人从遮挡区域出现,施工导致原有道路结构发生变化,或者多个交通参与者同时做出非预期动作。
这些场景在海量正常驾驶数据中占比很低,却可能直接决定模型在复杂环境下的表现。这就导致了一个急需解决的问题,即越常见的场景越容易获得大量数据,越罕见的场景反而越缺数据。因此,当常见场景已经积累到一定规模后,继续增加大量高度相似的正常驾驶数据,对发现模型长尾能力不足的问题,边际价值可能逐渐下降。此时,更值得关注的是那些能够暴露模型问题的数据。
02、真正有价值的数据不一定已经犯过错
如果只把发生碰撞或者车辆做出明显错误决策的数据拿出来训练,还是远远不够。自动驾驶真正需要关注的,是在错误造成严重后果之前,就尽可能发现模型存在的薄弱环节。如一辆车在复杂路口最终安全通过,但在面对遮挡、横穿行人和对向车辆同时出现时,模型输出的驾驶行为明显不稳定。这段数据虽然没有造成事故,却可能非常有价值,因为它暴露了模型面对特定场景组合时的不稳定性。
还有一些数据,车辆最终完成了驾驶任务,但制动过急、轨迹频繁调整,或者在相似场景下表现出了明显不同的驾驶行为。这些情况同样值得被挖掘和分析。从数据闭环的角度看,这类数据比单纯记录发生了什么更有价值。
此时需要对这类数据进行复盘,这到底是偶然事件,还是某一类场景反复出现的问题?是感知信息不足,还是模型对场景关系理解不充分?是训练数据覆盖不足,还是模型在某些条件下出现了泛化问题?
也就是说,真正值得挖掘的并不只是已经犯错的数据,而是能够帮助工程团队找到为什么会犯错的数据。边缘场景正是其中重要的一类。预期功能安全(SOTIF)相关研究也指出,这类场景虽然出现频率较低,却可能暴露自动驾驶系统的功能局限,并对系统安全构成更大的挑战。WOD-E2E提出的RFS指标,正是为了解决这类问题。在传统距离误差指标无法捕捉驾驶行为多模态性的长尾场景中,RFS引入人类对驾驶行为的偏好评分,使评估从轨迹像不像转向开得合不合理、稳不稳定。
03、找到错误之后数据还要怎么用?
对于端到端自动驾驶来说,并不是说找到一个边缘场景,就可以将其丢进训练集。真实道路产生的数据非常复杂,同一个异常表现背后可能对应完全不同的问题。数据挖掘之后,还需要结合车辆行为、模型输出、场景特征等信息进行分析,判断这个样本究竟属于偶发情况,还是具有重复出现的规律。如果大量相似场景都出现了相同问题,它的价值就会明显提高。工程团队可以针对这类场景补充数据、完善标注,并将其加入训练和测试流程。
模型更新后,还需要重新验证原来的问题是否得到改善,同时检查是否引入了新的问题。这样才形成真实道路运行→发现异常→挖掘困难数据→分析问题→训练与测试→重新验证的完整数据闭环。这个闭环中最难的其实不是收集数据,而是从海量数据中找到真正值得学习的部分。这也是为什么端到端智驾进入更成熟阶段后,单纯追求训练集的规模不再是首要工作。并不是说数据规模不重要,而是在持续积累数据的同时,越来越需要主动寻找那些能够暴露模型短板的数据。因为对于已经能够处理大量常规场景的系统来说,真正决定下一步提升空间的,不是它已经会多少,而是它还在哪些情况下容易做错,以及能不能把这些错误变成下一轮模型改进的数据。
#自动驾驶 #端到端大模型 #边缘场景
404