• 正文
  • 相关推荐
申请入驻 产业图谱

自动驾驶如何筛选出高价值的训练数据?

09/08 10:47
466
加入交流群
扫码加入
获取工程师必备礼包
参与热点资讯讨论

一辆L4级测试车每天能产生20TB原始数据,可其中绝大部分都是高速巡航、直道行驶这类废片。真正有价值的,可能只有短短几秒。比如鬼探头,行人突然从遮挡物后窜出,这类场景在路采中极少遇到,却是衡量系统安全上限的关键考题。

在2026年7月举办的2026世界智能网联汽车大会上,工信部披露,2026年以来L2级智驾渗透率已达70.5%。模型参数也从十亿级跃升至百亿甚至千亿级别,头部企业的训练迭代周期已从按天缩短至12小时以内。数据规模井喷,但瓶颈早已不是能否采得到,而在于能否捞得出,即如何从每天PB级的数据流里将这几帧、这几秒真正有价值的数据捞出来?

01、什么样的数据才算有价值?

在聊如何将有价值的数据捞出来前,我们要先厘清什么才是有价值的数据。其实定义有价值本身就是一个技术活。对于自动驾驶系统来说,有价值的数据一般指的是那些模型当前处理不好的场景,或者训练数据中占比极低的长尾场景。

长春工业大学2025年发表的一项研究提出了一种基于“主车行为—周车交互—场景风险”的层级场景价值定义方法。这种方法从交通参与者的个体特征和社会特征出发,先筛选出具有复杂交互行为的场景,再通过三类风险评估模型从多角度评估数据价值,最终锁定高风险片段作为高价值场景。

2025年IEEE发表的一篇论文《Subset Selection for Autonomous Driving Datasets via Fine-Tuning Vision Foundation Models》则提出了另一种思路。这种方法利用视觉基础模型进行自监督数据筛选,通过对比学习微调视觉编码器,在嵌入空间中进行密度聚类,只保留那些能最大程度保持语义多样性的样本。实验表明,在这种方法筛选出的子集上训练的模型,性能甚至超过了在完整数据集上训练的模型。

另一项2025年的研究《Scene-Level Triggers Using Foundation Model Embeddings》提出了一种场景级触发机制。这一机制是利用大规模预训练基础模型提取的全局图像嵌入来捕捉驾驶场景的高层语义和上下文信息,通过将新数据的嵌入与现有数据集进行比对。系统能自动检测具有独特特征的样本,将其标记为潜在的高价值候选。实验证明,这种方法能有效识别之前未见过的驾驶场景和模型难以处理的困难案例。

主动学习则是另一条重要的技术路径。2025年arXiv上发表的一项研究提出了SEAD框架,该框架利用端到端模型中的BEV特征来表征场景,先基于驾驶环境信息选择初始数据,再基于BEV特征选择增量数据。实验显示,仅用nuScenes训练数据的30%就能达到接近全数据集训练的性能。

此外,2025年发表于第十届ACM/IEEE边缘计算研讨会(SEC'25)的FRAMEscope则提出了一种时序数据价值评估框架,将神经正切核理论扩展到时序领域,实现了对流式视觉数据的原理性价值评估。从规则驱动到模型驱动,再到可解释的AI评估,行业对什么是好数据的定义正在变得越来越精准、越来越自动化。

02、如何从数据流里捞出金子?

知道了哪些数据是高价值数据,接下来要做的就是怎么去捞取这些数据。传统做法是依靠人工设定的触发器。根据理想汽车在ICCV 2025上披露的信息,其数据闭环中设置了超过200个触发条件来生产15到45秒的片段数据。当车辆行驶中触发急刹车、方向盘大角度转动、感知置信度低于阈值等条件时,系统会自动截取并回传这段数据,车端问题上报后1分钟内即可在云端获取完整数据。触发器虽然可以及时获取关键数据,但只能捞到提前定义好的东西,对于那些从未见过的、完全未知的异常场景,触发器根本抓不到。理想汽车也意识到了这个问题。

2025年10月,在ICCV 2025(国际计算机视觉大会)上,理想汽车VLA团队负责人詹锟发表了题为《世界模型:让我们从数据闭环走向训练闭环》的主题演讲。理想汽车在演讲中指出,数据闭环虽然有效,但仅靠数据闭环解决不了所有问题,尤其是如交通管制、烟花燃放、突然变道等长尾场景的收敛问题,自然采集的数据难以充分覆盖。当AI模型的训练数据扩展到1000万Clips之后,基础的端到端模仿学习遇到了边际效应,技术提升再次出现瓶颈。

为此,理想汽车提出了将世界模型与强化学习闭环落地于量产自动驾驶系统的完整架构。该训练闭环的核心思路从有什么数据就锻炼哪些能力转向按需训练,设定好训练目标,通过合成特定数据来支撑模型训练。理想在云端构建了一套世界模型训练环境,通过区域级仿真、合成数据生成和强化学习三项关键技术来训练车端VLA模型。其中世界模型主要支撑构建仿真系统使车端模型进行长时序仿真评测、合成全新数据丰富场景多样性,以及作为强化学习的世界引擎让模型在其中自由探索并获得反馈等三大应用场景。

轨迹则由VLA的Diffusion和基于世界模型的强化学习共同优化。这套架构标志着理想汽车正从依赖人工触发器的数据采集模式,向以世界模型和强化学习为核心的主动训练模式演进。视觉语言模型和向量检索技术也是解决触发器问题的一个技术方向。

RefAV是2025年由卡内基梅隆大学的Cainan Davidson、Deva Ramanan和Neehar Peri三位研究人员提出的一种场景挖掘方法,论文于2025年5月27日提交至预印本平台arXiv。该方案利用视觉语言模型来判断一个描述的场景是否出现在驾驶日志中,如果出现则精确定位其时间和空间位置。研究者构建了一个包含一万条自然语言查询的数据集,这些查询描述了与运动规划相关的复杂多智能体交互。换句话说,可以直接用自然语言去问系统:“有没有行人突然从遮挡物后面冲出来的场景?”系统会从PB级数据里把符合条件的片段全部找出来。

此外,一些企业也已基于向量数据库构建了多模态检索引擎,场景挖掘平台采用视觉语言模型对视频或图像进行向量化处理,支持基于图像或文本的检索。当测试中发现某个问题,系统可以在全局场景库中开展相似场景挖掘,结果按比例分配到训练集和测试集。这种方式将高价值数据筛选从规则触发升级到了语义检索,挖掘能力和灵活性都上了一个台阶。

将视野回归到实际的应用案例,各家车企在数据挖掘上的投入和路径各有侧重。小鹏汽车在2025年科技日上披露,其第二代VLA直接利用海量真实驾驶视频进行训练,无需任何人工数据标注,训练数据量接近1亿clips,相当于人类司机65000年的驾驶经验。小鹏搭建了3万卡的云端算力集群,运行效率保持在90%以上,云端部署了720亿参数的基座模型,实现了每5天全链路迭代一次的进化速度。

华为乾崑发布的ADS 4及WEWA架构,其核心突破在于利用生成式AI彻底重构了智能辅助驾驶数据的生产方式。华为云同步发布了基于盘古多模态大模型的世界模型,为智能驾驶训练构建数字物理空间。吉利旗下极氪品牌的千里浩瀚智能驾驶解决方案,云端算力储备达到23.5 EFLOPS,是中国车企中规模最大的算力平台,吉利具备L2级以上辅助驾驶的车辆超过850万辆,海量数据可通过算力和算法支撑模型快速迭代。

03、从挖掘到可用的数据中间还差几步?

对于自动驾驶来说,捞出来的原始片段并不能直接使用。一辆自动驾驶汽车采集的数据来自摄像头激光雷达毫米波雷达等多个传感器,这些数据需要在时间上和空间上精确对齐,然后才能进入训练流程。随着自动驾驶进入端到端时代,传统2D和3D标注已经无法满足需求,行业正在向4D标注(三维空间加时间维度)的方向演进。东风汽车构建了大模型驱动的4D真值标注体系,支持2D、3D、4D全模态一体化标注,覆盖多类别目标与全场景标签。

学术界也在同步推进相关技术。4D-CAAL就是一个统一的4D雷达-相机校准与自动标注框架,由Shanliang Yao等11位作者于2026年1月提出;AutoBox作为代尔夫特理工大学S.M. Tan的硕士论文成果,提出了通过系统化组合视觉基础模型来生成密集的3D标注。这些技术的共同目标是让标注从人工为主、机器为辅转向机器为主、人工质检为辅。即便采集的数据再多,一些驾驶场景依旧很难碰到,对此合成数据成为填补数据缺口的重要手段。

根据佐思汽研发布的《2025年中国智能辅助驾驶数据闭环研究报告》,2023到2025年间,合成数据在训练数据中的占比从20%至30%升至50%至60%,成为填补长尾场景的核心资源。前文也提到,理想汽车在ICCV 2025上分享了从数据闭环迈向训练闭环的思路,数据闭环是采集、训练、评估、部署的循环,但无法覆盖所有边缘场景。训练闭环则是在此基础上,让模型通过环境生成和环境反馈持续迭代。

04、最后的话

随着数据闭环的迭代周期大幅缩短,行业头部企业的闭环迭代周期已从过去的约5天缩短至约12小时。更快的迭代意味着更多的高价值数据能被及时挖掘出来投入训练,也意味着模型能以更快的速度收敛。在这个以月为单位计算技术差距的行业里,数据挖掘的效率本身就是核心竞争力。

#自动驾驶 #数据训练 #长尾场景

相关推荐

深耕智能驾驶、自动驾驶领域技术、资讯等信息,解读行业现状、紧盯行业发展、挖掘行业前沿,致力于助力无人驾驶落地与普及!

微信公众号