• 正文
  • 相关推荐
申请入驻 产业图谱

车企是怎么解决占用网络效率问题的?

08/06 09:31
179
加入交流群
扫码加入
获取工程师必备礼包
参与热点资讯讨论

占用网络自2022年进入行业到现在,网络效率一直是难以解决的问题,将车辆周围几百米的三维空间切成小方块逐个判断,这个思路本身不复杂,但要在车载芯片上实时跑起来,这个难度其实不小。

分辨率每提高一倍,体素数量就变成八倍,计算量也会跟着暴涨。而车载芯片的算力和功耗都有严格限制,不可能像数据中心那样随意堆硬件。那各车企是如何解决这个问题的?今天就聊几家比较具有代表性的企业。

01、特斯拉靠什么把算力用在刀刃上?

特斯拉2026年3月公布了一项名为《Artificial Intelligence Modeling Techniques for Vision-Based High-Fidelity Occupancy Determination and Assisted Parking Applications》的专利。这套系统的核心是用8颗车外摄像头的图像数据,通过神经网络预测车辆周围三维空间中每个体素是否被有质量的物体占据。

为了提高效率,特斯拉在专利中采用了动态分辨率的设计。

默认情况下,每个体素的边长是33厘米,这个精度对远处的物体或者路面以外的区域来说已经够用了。但在车辆附近已经被占用的区域,体素可以动态缩小到10厘米。

当物体形状弯曲、单个大方块没法准确描述轮廓的时候,网络还会预测部分占用,把被占用的空间进一步划分成更小的子体素来拟合曲线。这种做法可以让算力只花在真正需要精细描述的地方,远处的空旷区域用粗粒度处理就够了。

专利中还提到,系统可以用三线性插值的方法来估计体素内任意特定点的占用状态。

在训练方法上,特斯拉采用了无监督训练策略。由于手工标注三维空间里数以百万计的数据点耗时太长,成本极高,无监督训练绕开了这个瓶颈,让模型能够通过大规模实车数据自我迭代。

特斯拉的占用网络还引入了时间维度,系统不是只看当前这一帧画面,而是可以用Transformer架构将当前的三维表征和过去多帧的数据融合在一起。这种时空数据的结合让网络能够计算出占用流,也就是移动体素的速度。

在此基础上叠加三维语义信息,系统就能判断某一团体素是正在移动的车辆、固定的建筑还是路沿。系统还会根据语义对不同的物体分配不同的计算优先级,如靠近本车的移动车辆会比远处静止的建筑得到更细致的分析。

FSD会基于所有体素及其对应的占用属性生成一个数据集,这个数据集是可查询的,专门用于向车辆的自动驾驶协议传输体素的占用状态。FSD可以持续查询这个数据集来获取实时的占用信息,并做出导航决策。

02、小鹏如何在纯视觉路线上跑通占用网络

小鹏走的是和特斯拉类似的纯视觉路线,2024年取消激光雷达之后,占用网络成了感知架构的核心环节,小鹏在2025年CVPR上展示过相关技术成果。

小鹏的方案是靠5颗800万像素高清摄像头,配合自研的图灵芯片实现的。

他们宣称实现了行业首个量产的2K纯视觉占用网络,用超过200万个网格来重构三维空间,建模精度达到5立方厘米每个体素,感知半径扩展到约180米。

精度提上去了,效率怎么保证?小鹏的做法是在芯片和模型优化两个方向同时发力,一方面用自研芯片来做算力支撑,另一方面在模型上做剪枝和架构优化。有数据显示XNet在英伟达Orin芯片上的GPU利用率从122%降到了9%;城市道路识别精度提升了约40%,系统功耗反而降低了约20%。

小鹏也在往端到端的方向走,他们的世界基座模型具备链式推理能力,系统在做驾驶决策时不只是看当前状态就做反应,而是持续进行我在哪、发生了什么、要怎么走这样的内部推理。

这种推理能力建立在占用网络提供的三维空间理解基础上。

03、华为的多传感器融合方案有什么不同

华为走的是多传感器融合路线,他们的ADS 3.0方案已经彻底放弃了传统的BEV网络,只保留GOD网络。GOD的全称是General Obstacles Detection,本质上就是占用网络,但华为的版本融合了摄像头、激光雷达和毫米波雷达的数据。

激光雷达提供厘米级的三维点云,毫米波雷达提供速度信息,这些和图像数据在特征层面做融合。多传感器融合的好处是冗余度高,逆光、暴雨、大雾这些视觉容易失效的场景下,激光雷达依然能工作。但代价是硬件成本更高,数据融合的算法也更复杂。

截至2026年7月初,搭载乾崑ADS系统的车型总量已接近190万辆,这么大的车队规模意味着大量真实场景数据可以用于模型迭代。

04、最后的话

从这几家车企的做法来看,效率优化的思路大致可以分成几类。

一类是在分辨率上做文章,该精细的地方精细,该粗糙的地方粗糙,把算力花在刀刃上,特斯拉的动态体素就属于这一类;另一类是在模型架构和芯片上做优化,小鹏的模型剪枝和自研芯片就是例子;还有一类是多传感器融合,用激光雷达来补视觉的短板,华为是代表。

这三种路线的出发点不太一样,动态分辨率是在空间维度上做取舍,本质上是一种折中方案,算力有限就主动分配,不追求全空间均匀的高精度;模型剪枝和自研芯片走的是硬件和算法协同优化的路径,把模型做小、把芯片做专,用更少的算力完成同样的任务;多传感器融合则是从输入源头入手,用不同模态的传感器相互补充,让系统在各种条件下都能拿到可靠的数据。

但这三种思路并不互斥,实际上各家车企或多或少都在同时采用其中的几种方法。动态分辨率解决的是计算分配问题,芯片和模型优化解决的是基础算力问题,多传感器融合解决的是数据质量问题,把这三个方向都做扎实了,占用网络才能在各种场景下稳定运行。

#自动驾驶 #占用网络 #网络效率问题

相关推荐

登录即可解锁
  • 海量技术文章
  • 设计资源下载
  • 产业链客户资源
  • 写文章/发需求
立即登录