• 正文
  • 相关推荐
申请入驻 产业图谱

小鹏二代VLA拆解:四张图看懂智驾与座舱前沿车端大模型架构

08/31 12:05
410
加入交流群
扫码加入
获取工程师必备礼包
参与热点资讯讨论

最近,小鹏开了一场技术沟通会,小鹏汽车通用人工智能人负责人Liu xian ming 先生讲了一个小时围绕车端大模型的技术以及如何赋能产品体验。

但是,讲到模型架构那一页,Xian ming 把图藏了起来,说了句"要不然公司会找他要五百万"。

图没给,但一个小时的口述里,模块、连接关系、每一跳传什么,其实透露了不少东西。

所以,我们这篇文章结合小鹏发布会信息以及当前行业中最新舱驾驶模型的架构和相关论文信息,重新画出如下3张模型架构图和1张科普图:

座舱大模型架构,帮助大家了解爆火的座舱Agent架构

智驾VLA大模型架构图,帮助大家了解前沿的自动驾驶VLA算法架构

仿真训练闭环架构图,帮助大家了解典型的数据闭环架构

数据引擎平台 - 向量湖。科普数据前沿的数据工具向量湖

希望给智能汽车行业带来一些舱驾大模型上车的架构技术和趋势信息,读懂行业黑话。

座舱大模型Agent架构图

我们首先分享相对明晰和有行业共识的架构图,座舱大模型Agent架构图,这个基本上照搬电子世界的Agent逻辑。

根据Xian ming发布会上的信息整理:

M1 用户输入

整条座舱链路的起点。关键在"模糊"两个字:用户说的不是指令,是意图,比如"望京那家很有名的、名字四个字挺拗口的面馆"。传统语音助手要求人把话说成命令,这套架构反过来要求模型把话听懂。

进:用户语音、车内外视觉、当前行车上下文 出:原始多模态输入流

M2 自研 Omni 全模态

端侧部署的全模态模型,解决"看、听、想"里的看和听,是双系统里的快系统

最关键的一点:音频不先过 ASR 转成文本,模型直接吃声音——语气、停顿、犹豫这些信息不会在转写那一步被丢掉。同时它接入车内外视觉,才能理解"前面那个"这类指代。

进:音频波形 + 视觉画面 + 车辆状态 出:统一的多模态表示(不是文本)

之前汽车行业座舱模型的旧架构是一套传统的语音控制流程:把你的话转成文本,匹配到预设指令,执行,当然目前不少还是采用此类架构。

 

但是新的座舱如果有车端大算力,例如配置了AI box和新的8797等芯片,他本地跑多模态的VLM模型例如阿里的Qwen和豆包,基本上都是如小鹏讲到的输入的是声音波形而非转换成文本。

M3 大模型 Reasoning

双系统里的慢系统。把"我想吃那家面"这种意图,结合环境信息,拆解成一串有先后、有约束的子任务。

它做的是任务分解与约束满足,不是简单的问答。

进:M2 的多模态表示 + 地图 / 环境 / 车辆状态 出:结构化子任务序列

M4 MCP

MCP(Model Context Protocol,模型上下文协议)是标准的数字AI用词,它的作用就是让大语言模型调用相关工具或者skills。

这里要有一个前提,主机厂要把车端能力,例如导航、空调、座椅、车窗、泊车、行车控制抽象成统一的工具接口供大模型调用。

这一步做成了,"汽车即机器人"才从口号变成架构:模型不再只是回答问题,而是拥有了一个可组合的动作空间

进:M3 的子任务序列 出:结构化工具调用(函数名 + 参数)

M5 车辆执行

调用落到具体执行器上。这里同时覆盖两类:座舱应用(加途经点、空调、播放等)这个其实其实前者传统语音助手也能做;车辆控制(靠边停车这类要通过智驾控制底盘的),就需要配合输入给智驾系统。

进:工具调用 出:座舱应用状态变化 + 车辆动作

车辆执行中,车辆控制部份是最难的,也是大家方法不统一的,最直接的方法是让座舱大模型直接输入控车指令,智驾模型接受控制指令即可;另外一种方法可能就是座舱模型输入上下文给到智驾大模型。至于小鹏哪一种不得而知。不过第一种是当前行业内较多的方案。

不过,这套座舱架构算是目前的主流做法,大部分家的思路都是这么走的。真正的差别在于 M2 / M3 步骤是放在云端还是放在本地的 AI box 里;而多模态 VLM 这一层,当前有 Qwen、豆包等一批大模型可选,并不构成壁垒。

智驾大模型 VLA 架构图

总体听下来,小鹏VLA是一套标准的 VLA(Vision–Language–Action)骨架:视觉分支和指令分支并行汇入一个大模型主干,视觉、语言、状态就不再区分模态,主干后面挂动作专家,最后吐轨迹。

①–⑪ 是主链路,右侧竖轴是按真实比例画的时间窗,底部 Ⓐ–Ⓔ 是 ⑥ 的内部展开

我们根据发布会信息参考行业VLA的架构整理如下:

① 多路 RGB 帧

整条链路唯一的原始输入。关键是它是连续视频,不是单帧快照,要理解时间,就必须处理一段长序列。

进:物理世界的光,多路摄像头同步采集 出:原生动态分辨率的 RGB 帧序列

② TuringViT

TuringViT 是小鹏的视觉编码器,行业内一般就是ViT,小鹏给他用营销的方法命名了。

他的作用就是把每一帧切成 patch(patch就是一小块小块的像素,一般是16*16像素),各编码成一个高维特征向量。

这一格是全链路计算量最重的一环。原因是在长时序下,它的开销是"每帧成本 × 帧数",是唯一随上下文长度线性膨胀的乘法项。所以做蒸馏版的时候,小鹏选择重新设计它,而不是简单把主干参数砍半,口径:官方说法是"从底层重新设计整个计算量最 heavy 的部分"。

进:RGB 帧 出:patch 级稠密视觉特征

③ 剪枝 + 投影

两件事合在一格。剪枝按"重建重要性"扔掉冗余 patch,小鹏与北大的 FastDriveVLA 论文给的数字是整体 FLOPs 降 7.5 倍;投影就是把留下的特征映射进大模型的词嵌入空间。

这里发生了全链路的第一次语言切换:从像素变成 token。从这一步起,图像和文字说的是同一种语言。

进:稠密 patch 特征 出:稀疏化的视觉 token,已在语言空间

④ 导航指令 · 用户意图 · 自车状态

VLA 里 "L" 的另一半输入,它决定的是模型"想去哪"。

为什么重要?因为多家横评里普遍存在的"导航错路"通病,症结就在这条链路和动作之间的因果没打通,模型看懂了路,但没把导航意图正确翻译成动作。

进:导航 App 指令、语音意图、速度 / 加速度 / 转向角等车身状态 出:文本 token + 状态 token

⑤ LLM 主干(VLM)

这个LLM的主干,之前有信息表示采用的是阿里Qwen,有知情人士可以确认下,它把 ③ 和 ④ 两串 token 拼成一条统一序列逐层处理。"统一"的物理位置就在这里。

规模方面,小鹏与北大原来的公开论文里的核心 VLM 是 30 亿参数级别的基座,但量产车端跑的到底多大,有信息表示小鹏第一代VLA综合大概4B,这次发布会说第二代增加了3.5倍参数量,所以推测大概10B左右。

进:视觉 token + 指令 / 状态 token 出:逐层隐状态

⑥ 注意力子层 · Infini-attention

这是小鹏基于主干里大模型的第一处改造:把标准注意力换掉,让模型在有界算力下握住 30 秒历史。

Xian ming在发布会上讲特点是"架构上无限长、端侧只留 30 秒"。架构本身支持无限长时序,端侧截断在 30 秒,是因为很少有驾驶决策需要更久的上文。内部机制下面单独讲。

进:当前段的 token 表示 出:融合了局部与长期记忆的隐状态

⑦ 专家子层 · MoTE

小鹏主干里大模型的第二处改造。MoTE 是 Mixture of Task Experts,不同驾驶任务激活不同专家,例如行车激活行车、园区停车场激活园区、漫游激活漫游等,避免所有场景共用一套参数被"平均"成平庸解。

演讲中有一个比较特别的:⑥ 攒下的时序记忆,会以一种通用的、可扩展的形式在各个专家之间复用,目的是防止任务切换时状态断裂。这个问题在多数 MoE 文献里是没人处理的。

需要说明的是,MoTE 挂载的确切位置小鹏没有公开,图上是按 MoE 的通行位置(专家 / 前馈子层)画的。

进:注意力子层输出 出:经专家加权的隐状态

这里要强调一句:⑥ 和 ⑦ 不是前后两级,只是画图为了表达,其实他们是同一层里的两个位置。

⑧ X-Foresight 预测式世界模型

这是这次小鹏重点宣传的地方,表示它能根据历史推演未来。它在同一个 token 空间里同时预测未来的多视角画面和自车动作,这是它和纯视频生成式世界模型的区别。

数字上,小鹏的上车版把 12 帧未来压成 96 个 token,推演未来 6 秒;在AI界 96个 Token(令牌)大约相当于 60到70个英文单词,或者 40到50个汉字,其实可以推测X-Foresight 预测式世界模型可能就是给出一些比较精炼的预测,例如前方车辆可能减速,可能维持xx速度等。

当然,小鹏表示在实验中最长支持到 21 秒,但推演消耗算力,6 到 7 秒对自动驾驶是比较合理的取舍。

进:主干的时空条件隐状态 出:96 个未来 token

⑨ Flow Matching 动作头

Flow Matching(流匹配)动作头是具身智能(机器人)和大模型中用于生成连续、平滑动作序列(Action Chunk)的一种生成式预测模块,在机器人行业应用广泛。

简单来说,传统的动作头是直接输出一个具体的动作数值(比如多少速度和位置),后来有了 扩散模型(Diffusion Policy) 从一团随机噪声(混乱状态)开始,通过学习一个“速度场”(Velocity Field),像水流一样把噪声一步步“推向”正确、连贯的未来动作序列。 例如之前分享的理想VLA采用。现在小鹏提出采用 Flow Matching,按照现在行业共识 Flow Matching 是扩散模型(Diffusion Policy)的一种更快、更直观的升级替代方案。

另外,动作专家。从噪声出发,沿学到的向量场积分,拟合多峰轨迹分布。

为什么非要多峰?因为"可以左绕也可以右绕"这类多解场景,如果用单峰去拟合,会被平均成中间那个直接撞上去的错误答案。多峰意味着采样多次得到多条候选,再从中择优。

这里发生第三次语言切换:从 token 变回连续量

进:主干隐状态 + ⑧ 的 96 个未来 token 出:连续轨迹(一串航点)

⑩ 轨迹输出 → 车控执行

现在到了VLA 的终点。这里要注意:输出的是轨迹,不是方向盘角度,航点加速度剖面交给下游控制器,再由控制器转成执行器指令。

这是驾驶 VLA 和机器人 VLA 的一处结构性差别:机器人 VLA 经常直接吐关节量。

进:择优后的候选轨迹 出:航点 + 速度剖面 → 控制器

⑪ Streaming Inference

Streaming inference 也是小鹏提到的词,其实它不是一个模块,是整条链路的运行方式,所以在图上画成贯穿全图的虚线回路。

传统做法是"看 → 算 → 输出 → 再看",必须等一整段算完才能处理新画面;流式是边看、边想、边吐轨迹,新观测持续注入。

官方给的数字是端到端响应提速 300%。

进:持续到来的新观测 出:持续吐出的轨迹段

把 ⑥ 拆开:什么是压缩记忆

图的底部那一条 Ⓐ–Ⓔ,是单层 Infini-attention 的内部。要看懂它,先得说清 Q / K / V。

注意力机制里,每个 token 都会经三个不同的线性变换,得到三个向量:

Q(Query):我在找什么。

K(Key):我是什么,供别人来匹配。

V(Value):我携带的内容,被匹配上就被取走。

一次注意力,就是拿每个 token 的 Q 去和所有 token 的 K 算相似度得到一组权重,再用这组权重对 V 加权求和。打个比方:Q 是检索词,K 是书脊上的索引条目,V 是书里的正文:先用检索词比对索引,再把命中的正文取出来。

明白了这个,Ⓐ 那个分叉就好懂了。同一段 token 生成的这三个向量,两条路各取所需:

Ⓐ 当前段 token:序列被切成定长的段,一次处理一段。本段每个 token 都生成自己的 Q、K、V,然后分两路。

Ⓑ 局部注意力:段内标准点积注意力,Q·K·V 三件套全用。窗口有界,所以这一路的算力是可控的常数,不会随历史变长而膨胀。

Ⓒ 压缩记忆 M:整套机制的要害。一块固定大小的键值关联矩阵,可以理解成把无数「K → V」条目叠加在一起的一张表,跨段保留。写入时只写 K 和 V,不写 Q:因为记忆存的是"什么内容能被什么线索检索到",而 Q 是"此刻我想找什么",属于当下这一瞬,存进去没有意义。更新规则是先读出旧值、只写差值,避免重复写入把空间挤爆。

Ⓓ 门控融合:简单来说,它就像一个“智能阀门”:模型会根据输入内容自动计算权重(通常在 0 到 1 之间),决定让哪些特征多通过一些、贡献更大,让哪些无用或冲突的噪声信息少通过甚至被过滤掉。

动态决定这一步该更信近处还是远处。堵车缓行时更依赖局部,路口博弈时更依赖记忆。

Ⓔ 本层输出:送进下一层;同时被更新过的 M 带入下一段,形成跨段递归。

一句话概括:K 和 V 是入库的,Q 是查库的。

Ⓒ 这一格解释了记忆容量与序列长度是解耦的。序列再长,M 也不变大。这是"无限长时序"和"有界算力"能同时成立的技术前提,但同样是它的代价:容量有上限,压得越久,越可能只记得"发生过什么",而取不回细节。

右侧那条时间轴,是小鹏这次发布会的核心

图右侧的竖轴是按真实比例画的,1 秒等于同样的像素长度。青色的记忆窗口 30 秒,橙色的预演窗口 6 秒,橙色虚线是实验上限 21 秒。

记住过去的 30 秒,预测未来的6秒。

数据与仿真闭环架构图

前两张图讲的是车上跑的大模型架构图,这张图讲的是这些模型怎么被数据喂出来的,里面的创新就是数据的向量湖。

D1–D5 是一个环:模型跑出问题,问题回到数据,数据训出更强的模型

D1 更强的模型

环的起点,也是终点。每一轮迭代的产物是新的 VLA 2.0 或蒸馏后的 Lite 版本。

进:定向训练数据 出:每天大量的新模型

D2 闭环仿真

这一格解决的问题是:模型迭代速度已经快过实车验证速度。每天迭代大量模型,靠实车一台台去验证,来不及给模型传递足够的反馈。

现场给的数字是从 6 月到 8 月中,每天新增的仿真模型数量增长 290%,接近三倍。这个数字说明两件事:测试量在大幅增大;仿真的指标体系已经足够收敛稳定,能媲美实车端的实际测试。

另外,仿真同时是闭环强化学习的训练场,没有仿真,闭环 RL 无从谈起。

进:待验证的模型 出:闭环回放结果与暴露出的问题

D3 问题定位

把仿真失败样本和用户上报的问题收拢成可查询的形式。

进:用户上报 + 测试失败样本 出:一条语义查询

D4 向量湖

这是整个环路的枢纽,速度由它决定。它接收"这个场景出问题了"这样一条语义查询,返回"这些数据能修它"。下一图我们单独讲。

进:失败样本编码成的查询向量 出:召回的相似样本 + 判定为缺失的分布区域

D5 定向训练数据

最终喂给模型的那一批。现场给的量级是 1.1 亿 video clips,而为了筛出这 1.1 亿有意义的训练数据,整体数据量要超过两到三亿个 clip,达到几千 PB 的规模。

进:向量湖的检索结果 出:定向训练数据集 → 回到 D1

通过这种数据与仿真闭环模式就能够不断解决不知道的未知问题。

数据引擎平台 - 向量湖

在有了模型和方法之后,搞AI算法的都知道什么最重要了,就是数据。但是有了成堆的数据之后,管理和挖掘数据却是最难的了。

小鹏构建了数据引擎平台,统一存储、多模态检索、规模化挖掘。

这个平台里面最重要的一个工具就是数据向量湖。

这是一个很有意思的工具,他能够数据总体可视化,能够主动发现数据缺失和异常,下面我们构建一个流程图帮助大家了解什么是自动驾驶数据向量湖。

① 原始数据层 · Data Lake

车端采回来的东西:视频、雷达激光雷达、刹车与车身传感器、定位,以及其他各类传感器信号。

数据湖的特点是什么都能装,但只能按时间和文件名找。你可以说"给我 8 月 12 日下午那台车的数据",但你没法说"给我所有被大车遮挡后急刹的片段"。

② 语义抽取

这一步是关键:用一套大模型底座,对原始数据本身做理解、推理和聚类,从中提取出有意义的语义信号

抽出来的东西大致分两类。一类是车辆驾驶行为,带时序和因果:驾驶行为描述、行为 embedding、行为标签、根因分析、根因 embedding。另一类是图像帧,静态的:帧 embedding、帧标签,以及帧里的对象——比如遮挡物,它自己又带 embedding 和标签。

③ 向量湖 · Vector Lake

抽出来的语义连同它们的向量一起写进向量索引,就构成了向量湖。它存四样东西:embeddings(向量)、labels(标签)、summaries(摘要)、links to raw data(回指原始数据的链接)

向量湖不复制原始数据,它只存语义并保留指回原始数据的指针。

④ 于是通过向量湖在自动驾驶算法训练方面可以做四件事

召回相似样本:给一个 corner case,找出所有像它的。

发现分布缺失:在向量空间里看哪一片是空的——这是"我缺什么",而不是"再给我一些像这样的"。

判断离群点:识别出分布之外的异常数据。

corner case 检索:对任意数据做有效检索与分析。

举个具体的:一句"找出所有被大车遮挡、随后急刹的片段",在数据湖里做不到,在向量湖里是一次近邻检索。

这也是为什么现场把"每一个测试和用户上报的问题,都能快速定位到该用哪些数据去训"当成核心能力来讲。相应地,6.1.0 发布之后一个月就发了 6.2.0,很快又到 6.3.0。

多数数据引擎只能回答"再给我一些像这样的";能在向量空间里发现"我缺什么",才是这套闭环真正的护城河。

写在最后

总的来讲,信息量比较大,也是智能汽车行业大模型应用热点。当然由于能力有限,难免有疏漏和错误,欢迎大神留言讨论和更正,帮助大家更好的学习、进化。

最后来个小广告:
Vehicle联合机工社权威出版的《自动驾驶产品经理》,端到端了解自动驾驶产品技术以及如何做自动驾驶产品经理。

*未经准许严禁转载和摘录-获取本文参考资料方式:加入我们的知识星球可以下载公众号海量参考资料包含以上参考资料。

小鹏汽车

小鹏汽车

小鹏汽车成立于2014年,是一家专注未来出行的科技公司。我们一直坚持饱和式研发投入,构建全栈自研的核心能力,今天小鹏汽车已经成为中国领先的智能电动汽车公司之一。小鹏汽车的使命是,用科技为人类创造更便捷愉悦的出行生活。也是自动驾驶及机器人技术研发商,产品包括飞行汽车、家庭机器人。

小鹏汽车成立于2014年,是一家专注未来出行的科技公司。我们一直坚持饱和式研发投入,构建全栈自研的核心能力,今天小鹏汽车已经成为中国领先的智能电动汽车公司之一。小鹏汽车的使命是,用科技为人类创造更便捷愉悦的出行生活。也是自动驾驶及机器人技术研发商,产品包括飞行汽车、家庭机器人。收起

查看更多

相关推荐

助力汽车行业、企业以及个人成长。公众号:Vehicle