• 正文
  • 相关推荐
申请入驻 产业图谱

智驾行业为什么一边追求更大的模型,一边压缩车端模型?

13小时前
232
加入交流群
扫码加入
获取工程师必备礼包
参与热点资讯讨论

现在行业内很多企业都在做一件事,那就是将云端智驾模型越做越大,但在车端却想办法把它压缩部署。9月,小鹏公布第二代VLA最新版本,端侧模型参数量提升至此前的3.5倍,同时又通过学习式Token压缩、蒸馏训练等方式降低车端计算压力。与此同时,车载芯片算力也在持续增长。这个看似矛盾的两件事,其实指向了同一个问题,那就是当模型能力不断增加之后,车端到底需要多少算力,又该如何把这些算力真正用起来?

01模型越来越大算力为什么也必须跟着增长?

模型规模增加让计算需求也不断增加。智驾模型从过去相对独立的感知任务,逐渐走向端到端、多模态和VLA,需要处理的信息越来越复杂。模型不仅要识别车辆、行人和道路,还需要理解不同交通参与者之间的关系,并结合连续的时序信息进行预测和决策。
图片源自:网络这意味着模型需要更强的表达能力,也带来了更大的计算需求。但这里有一个容易被忽略的问题,模型参数量并不能直接等同于实际计算量。参数量决定模型记住多少,计算量决定模型算多少。一个模型到底需要多少车端算力,还与输入Token数量、模型结构、推理方式、数据精度以及软硬件实现有关。尤其是VLA这类需要持续处理视频的模型,计算压力不仅来自模型本身,还来自不断增加的视觉Token。摄像头输入的图像经过视觉编码之后,会形成大量Token。如果摄像头数量增加、分辨率提高、历史视频上下文变长,模型每次推理需要处理的信息量也会增加。所以,智驾模型的计算压力其实来自模型侧和输入侧,模型本身越来越复杂,输入给模型的信息也越来越多。这也是为什么单纯增加芯片算力,并不能彻底解决问题。

02算力越来越高为什么还需要模型压缩?

不可否认,现在的车载算力一直在增长。比亚迪发布的4nm智驾芯片璇玑A3,官方披露三颗芯片协同可以提供超过2100 TOPS的总算力,同时还强调功耗控制和算力利用率。这说明行业并不是不愿意增加车端算力,而是想在模型增长和算力增长之间寻找新的平衡。车企也不再盲目追求车端模型参数规模,而是更看重参数规模、算力开销和实际体验之间的匹配。
图片源自:网络但车端算力不像数据中心算力那样可以无限扩展。增加车载算力,会同时带来芯片成本、功耗、散热、内存带宽和系统设计等多方面的压力。对于量产车辆来说,计算平台还需要满足长期稳定运行和规模化装车的要求。更重要的是,增加TOPS并不是说这些算力都会转化成实际的模型性能。如果模型存在大量冗余计算,或者数据搬运、内存访问、算子执行效率不高,即使芯片提供了更高的峰值算力,也可能无法充分利用。因此,车端真正需要解决的不是有没有更多算力,而是能不能用更少的计算完成同样的任务,或者用同样的算力完成更复杂的任务。这就是模型压缩真正有价值的地方。

03压缩的不是能力而是无效计算

这里需要区分一个概念。模型压缩并不是简单把一个大模型删除一部分参数,然后得到一个小模型。其真正的目标是减少不必要的计算,同时尽可能保留模型能力。Token压缩就是一个很典型的例子。对于连续的视频输入,并不是每一个视觉Token都具有相同的信息价值。有些Token包含道路结构、交通参与者等关键内容,有些则可能存在较强的空间或时间冗余。如果能够识别这些冗余信息,就可以减少后续模型需要处理的Token数量。这样做并不是让模型少看,而是让模型把有限计算资源用在更有价值的信息上。
图片源自:网络除了Token压缩,还有知识蒸馏、量化以及模型架构优化。蒸馏就是让更强的模型帮助较小的模型学习,使部分能力能够迁移到更适合车端部署的模型中。量化则是通过降低数值精度,减少计算和存储压力。架构优化则进一步改变了模型内部的计算方式,让模型更加适合具体的车载芯片。这些技术解决的问题不同,但最终目标是一致的,即在有限车端算力下,将更多计算资源留给真正影响智驾能力的部分。

04真正重要的是模型和算力怎么一起增长

说了这么多,其实可以发现,智驾模型越来越大、车端算力越来越高,同时又不断进行模型压缩,并不是三个相互矛盾的趋势。它们实际上是一条完整的技术链。模型能力提升,需要更大的模型容量和更复杂的计算;模型变大,又推动车端算力持续升级;但单纯增加算力会带来功耗、成本和散热等工程约束,于是又必须通过Token压缩、蒸馏、量化、架构优化和软硬件协同,让计算效率进一步提高。最终形成的不是模型越大,芯片就越强;芯片越强,就继续堆更高算力这种单向加码。而是形成了模型能力增长,车端算力随之增长,同时计算效率同步提升,最终让更多模型能力真正进入车端的正向路径。
图片源自:网络这也是为什么现在车端AI的优化不再是模型本身的问题。模型怎么设计、输入多少Token、哪些信息需要保留、芯片怎么执行、编译器怎么优化、内存数据怎么搬运,这些因素最终都会影响一套智驾模型在汽车上能不能真正跑好。所以,模型压缩不是在和大模型对着干。云端追求更强的模型能力,车端追求的是用有限的计算资源承载更多能力。未来真正值得关注的,是在同样的车端算力下,究竟能跑出多少真正有价值的智能。#自动驾驶大模型 #模型蒸馏 #模型压缩

相关推荐

深耕智能驾驶、自动驾驶领域技术、资讯等信息,解读行业现状、紧盯行业发展、挖掘行业前沿,致力于助力无人驾驶落地与普及!

微信公众号