• 正文
  • 相关推荐
申请入驻 产业图谱

为什么小鹏第二代VLA开始强调时间?

09/01 11:29
300
加入交流群
扫码加入
获取工程师必备礼包
参与热点资讯讨论

每当谈及自动驾驶领域的大模型升级,聊的多是参数变大了、数据变多了、识别更准了这些内容。但小鹏2026年8月公布的第二代VLA新版本,核心词却是在时间上。

为什么小鹏第二代VLA开始强调时间?时间会给自动驾驶带来什么改变?

01、从单帧感知到理解连续发生的道路事件

自动驾驶系统真正面对的从来不是一张静态图片,而是一个持续变化的环境。譬如一辆相邻车道的车辆正在逐渐向本车道靠近。单看某一时刻的画面,系统可以识别车辆的位置,但仅凭这一帧,很难判断它究竟是在正常行驶,还是正在准备变道。

如果把过去几秒的信息加入进来,情况就不一样了。车辆之前的位置、速度和运动方向,都可以成为判断其当前意图的重要依据。行人横穿、车辆加塞、路口通行以及大型车辆遮挡后的目标出现,也都存在类似问题。

很多场景下,让自动驾驶系统真正犯难的不是看到了什么东西,而是这个东西接下来要做什么。小鹏第二代VLA引入的Infini-VLA长时序架构,就是在解决这个问题。

图片源自:小鹏汽车

小鹏公布的信息显示,它最长支持30秒有效时序,使较早发生、但对当前决策仍然有价值的信息能够继续参与模型判断。这里的30秒并是说模型只是简单保存30秒完整视频,而是可以通过时序建模保留有效的历史信息。

因此,它更接近于让模型拥有一个持续更新的驾驶上下文。这也是第二代VLA与单纯扩大视觉输入范围的重要区别。该模型不仅可以知道现在看到了什么,还可以知道这个场景是怎么发展到现在的。

02、Streaming Inference让模型持续理解和持续行动

有了长时序信息,还需要解决另一个问题,即车辆不可能等一段完整数据处理结束之后再做决定。道路环境是连续变化的,车辆也必须持续接收新的传感器信息、更新判断并输出动作。因此,第二代VLA进一步引入Streaming Inference,也就是流式自回归推理。它的思路是让模型随着新的输入持续进行推理和更新,而不是把每次处理都看成相互独立的计算过程。

这一点对于实时自动驾驶非常重要。因为驾驶决策本质上是一个连续过程。前方车辆刚刚减速、行人突然改变运动方向或者相邻车辆开始向本车道靠近,模型都需要在新的信息进入之后尽快更新自己的判断。小鹏官方公布的数据中,第二代VLA的端到端响应速度提升约300%。

这里并不只是说模型跑得更快,而是指减少了环境信息进入模型到车辆产生相应动作之间的时间。但需要注意的是,Streaming Inference的加入并不意味着此前的自动驾驶系统完全没有时序处理。传统系统同样存在状态估计、轨迹预测等连续处理机制。真正的变化,是第二代VLA进一步把连续时序信息和统一模型推理结合起来。

03、从预测现在到推演未来

自动驾驶模型能理解过去和当前状态之后,下一步要做的自然就是预测未来。传统自动驾驶中本身就存在轨迹预测,会根据车辆、行人等交通参与者的历史运动状态,对其未来轨迹进行预测。小鹏第二代VLA的变化是试图让未来状态预测与视觉理解、驾驶动作之间建立更加紧密的联系。

对此小鹏在第二代VLA中加入了X-Foresight。小鹏公开资料显示,X-Foresight与VLA 2.0架构融合,在统一Token空间中联合预测未来多视角视觉信息和自车动作,并对未来约6秒的环境变化进行推演。这里的关键并不是6秒这个数字,而是模型开始把未来可能出现的状态纳入当前驾驶决策。比如前方车辆正在向本车道靠近,系统需要考虑的就不只是它当前有没有越过车道线,还需要判断它继续运动后可能产生什么结果,再决定自己是否应该减速、保持距离或者调整行驶轨迹。

因此,X-Foresight的价值其实是让模型具备一种面向未来进行决策的能力。当然,预测并不意味着准确知道未来会发生什么。交通参与者的行为存在很强的不确定性,更准确的理解是,模型能对未来可能出现的状态进行推演,再利用这些预测结果辅助当前动作选择。

04、为什么还要引入MoT和VLA Lite?

当模型开始同时处理更长的历史信息、当前环境和未来状态之后,计算量也会随之增加。这也是第二代VLA进行架构调整的另一个原因。其中,MoT混合架构的思路,是让不同专家针对不同场景承担相应的计算任务,同时保留跨场景的视觉信息。城市道路、高速公路、复杂路口等场景,对模型能力的要求并不完全一样,因此并不是所有输入都需要经过完全相同的计算路径。这种架构本质上是在模型能力和计算效率之间寻找平衡。

其实对于量产车来说,另一个更现实的问题是模型如何部署。第二代VLA端侧模型参数量较此前提升约3.5倍,但汽车上的计算资源受到芯片算力、功耗、成本和实时性的限制。因此,模型规模扩大并不意味着可以直接把最大的模型装进所有车辆。这也是VLA Lite存在的意义。

小鹏通过学习式Token压缩和模型蒸馏,将更大模型中的部分能力迁移到算力更低的平台,使同一套基础模型能力能够覆盖不同算力条件的车辆。这其实是自动驾驶大模型走向量产必须解决的问题。未来自动驾驶真正重要的并不是模型能做到多大,而是能不能在不同算力平台上,以足够低的成本和延迟稳定运行。

05、VLA真正可能改变的是自动驾驶的决策方式

如果把这些技术放在一起看,第二代VLA的变化就比较清楚了。Infini-VLA解决的是过去的信息如何参与现在的判断;Streaming Inference解决的是模型如何持续处理新的环境信息;X-Foresight解决的是如何把未来可能状态纳入当前决策;MoT和VLA Lite则更多解决模型能力扩大之后如何提高计算效率并实现规模化部署。它们最终指向的是同一个问题,也就是如何让自动驾驶模型对道路环境的理解不再局限于某个瞬间。这可能改变自动驾驶大模型在复杂场景中的决策方式。

例如面对加塞车辆,系统不只是识别有车进入本车道,而是可以结合此前的运动过程判断其变化趋势,再根据未来可能的运动结果提前调整自身行为。面对突然出现的行人,也是类似逻辑。模型不仅要识别行人,还需要结合其连续运动状态判断其是否可能进入车辆行驶路径。这种能力如果能够稳定实现,自动驾驶就有机会从单纯的发现问题后处理,进一步向根据趋势提前调整发展。

最终给消费者带来的可能不是一个明显的新功能,而是车辆在复杂道路环境中的动作更加连续,减少不必要的急刹、犹豫和频繁调整。当然,这一能力仍然处于演进过程中,并不意味着上述问题已经被完全解决。长尾场景、极端天气、异常交通行为以及模型在罕见场景中的稳定性,依然需要大量真实数据、仿真验证和安全工程共同解决。

06、最后的话

小鹏第二代VLA最值得关注的地方,其实不是3.5倍参数、30秒时序或者6秒预测这些单独的数字,而是这些能力形成的一条完整的信息链。过去的自动驾驶模型更多强调对当前环境的理解。随着端到端模型的发展,感知、预测、规划等多个环节已经逐渐被融合进统一模型,而VLA又进一步把语言、视觉、动作以及时序信息联系起来。因此,VLA路线并不是简单地用VLA取代传统模块,也不是说传统感知、预测、控制系统已经没有意义。而是在统一模型的基础上继续扩大信息之间的关联范围。

小鹏同时推进VLA与VLM融合以及Master Agent,也说明这种模型能力正在向整车任务扩展。但这属于更广义的整车智能,并不等同于VLA驾驶模型本身的能力。同样值得区分的是X-World和X-Foresight。前者更多用于数据生成、闭环仿真和强化学习等环节,后者则与VLA结合,用于未来状态和自车动作的预测。二者共同构成的是从数据、训练、仿真到模型运行的更完整体系,而不是两个功能完全相同的世界模型。

所以,如果一定要用一句话概括第二代VLA这次升级,它并不是简单让自动驾驶看得更清楚,而是让模型开始更系统地理解道路环境在时间上的变化。从理解现在,到利用过去,再到推演未来,这可能正是下一阶段自动驾驶模型继续提升复杂场景决策能力的一条重要技术路径。

#自动驾驶 #小鹏第二代VLA

小鹏汽车

小鹏汽车

小鹏汽车成立于2014年,是一家专注未来出行的科技公司。我们一直坚持饱和式研发投入,构建全栈自研的核心能力,今天小鹏汽车已经成为中国领先的智能电动汽车公司之一。小鹏汽车的使命是,用科技为人类创造更便捷愉悦的出行生活。也是自动驾驶及机器人技术研发商,产品包括飞行汽车、家庭机器人。

小鹏汽车成立于2014年,是一家专注未来出行的科技公司。我们一直坚持饱和式研发投入,构建全栈自研的核心能力,今天小鹏汽车已经成为中国领先的智能电动汽车公司之一。小鹏汽车的使命是,用科技为人类创造更便捷愉悦的出行生活。也是自动驾驶及机器人技术研发商,产品包括飞行汽车、家庭机器人。收起

查看更多

相关推荐

深耕智能驾驶、自动驾驶领域技术、资讯等信息,解读行业现状、紧盯行业发展、挖掘行业前沿,致力于助力无人驾驶落地与普及!

微信公众号