• 正文
  • 相关推荐
申请入驻 产业图谱

自动驾驶中世界模型和占用网络有何区别?

08/25 11:45
364
加入交流群
扫码加入
获取工程师必备礼包
参与热点资讯讨论

这两年,自动驾驶领域对环境建模的讨论正在发生变化。过去大家主要关注目标检测、BEV、轨迹预测等具体模块,后来3D Occupancy开始受到重视,而随着端到端驾驶进一步发展,World Model又成为新的研究热点。

这也带来了一个很容易混淆的问题,世界模型和占用网络有什么区别?

如果简单说成Occupancy负责感知,World Model负责预测,其实并不准确。因为今天的Occupancy已经开始预测未来,World Model也可以直接使用Occupancy作为环境表示。其实更准确的理解是,占用网络主要解决如何表示和预测驾驶环境的空间状态。世界模型则进一步建模这些状态如何随时间演化,以及不同自车动作可能带来的未来结果。

01、从目标检测到Occupancy核心变化是如何表示世界?

传统自动驾驶感知主要以目标为基本单位。系统检测到一辆车,就输出它的位置、尺寸、类别等信息。这种方式比较成熟,但面对施工区域、散落物以及各类不规则障碍物时,难以用目标框准确描述。Occupancy的出现,本质上是在改变环境表示方式。

它不再只问场景里有哪些目标,而是把车辆周围的三维空间划分成大量空间单元,判断这些位置是否被占据,并进一步预测对应的语义信息。这样,车辆、行人、道路、护栏甚至不规则障碍物,都可以在统一的三维空间中表达。

因此,Occupancy带来的价值并不是简单替代目标检测,而是提供了一种更加密集、统一的空间状态表示。对于规划系统而言,这种表示也更加直接,因为规划真正需要关注的是哪些空间被占据、哪些空间可以通行,以及自车与这些空间之间的关系。

从这个角度看,3D Occupancy解决的核心问题可以概括为,将当前驾驶环境从离散的目标信息,进一步转换成连续的三维空间状态。从这个角度看,3D Occupancy完成了从离散目标信息到连续三维空间状态的关键转变,但问题也由此出现。

如果车辆在十字路口看到一辆横向行驶的汽车,Occupancy可以比较准确地描述这辆车此刻在哪里,却不能仅凭这一张当前状态告诉系统它几秒后会在哪里。对于自动驾驶而言,真正影响决策的往往不是现在是什么,而是接下来会发生什么。这就把问题从空间表示推向了时间维度。

02、从3D Occupancy到4D Occupancy系统开始预测世界怎么变化?

最初的3D Occupancy主要关注当前空间状态,但随着研究深入,Occupancy本身也开始加入时间维度。所谓4D Occupancy(即3D空间+1D时间),可以简单理解为除了描述三维空间中的占用状态,还进一步预测这些空间状态在未来时间里的变化。系统不再只输出现在这里有一辆车,而是尝试预测未来不同时间点这辆车及其他交通参与者可能占据哪些空间。

这一步非常重要,因为它实际上让Occupancy从单纯的空间表示开始进入时空预测。因此,今天再说Occupancy只描述现在,已经不够准确。更严谨的说法应该是,传统3D Occupancy主要描述当前空间状态,而新一代Occupancy正在向未来状态预测扩展。但到了这里,另一个问题就出现了。如果Occupancy已经可以预测未来,那它和World Model还有什么区别?答案并不是简单的一个是4D,一个不是。

03、World Model进一步建模的是未来为什么会这样

World Model并不是一种固定的数据结构,也不是某一种具体网络架构。它可以使用图像、BEV、Occupancy、点云甚至潜在空间作为环境状态表示。真正重要的是,World Model试图学习环境状态如何随时间发生变化,并在此基础上预测不同情况下可能出现的未来状态。这和普通的未来轨迹预测有一个重要区别。普通预测仅输出一个既定未来,而World Model能够进行动作条件推演。例如,系统不仅要知道横向车辆和行人未来在哪里,还需要考虑不同自车行为(减速、直行或转向避让)所对应的不同未来场景。这就体现出World Model的特殊性,它不仅预测一个未来,还可以进一步建立当前状态、动作与未来状态之间的映射关系。

Drive-OccWorld(AAAI 2025)就是一个比较典型的研究案例。它以历史场景的BEV或Occupancy特征为基础,结合速度、转向角、轨迹和驾驶指令等动作条件,共同预测未来Occupancy和运动状态,使模型能够生成不同自车行为对应的未来场景,进一步利用预测结果进行轨迹规划。

这类工作的共同特点,是将动作条件作为预测的输入变量,而不是固定不变的背景。这也是World Model与普通4D Occupancy预测区别的关键。4D Occupancy重点是预测未来空间状态,而World Model进一步关注环境状态的演化规律,以及动作与未来状态之间的关系。当然,两者并不是完全割裂的。

04、Occupancy正在成为World Model的重要世界表示?

到了这里,两条技术路线实际上开始汇合。如果World Model需要一个能够描述驾驶环境的状态空间,那么Occupancy天然是一个很有价值的选择。它能够把车辆、行人、道路和障碍物统一放进三维空间,再通过时间维度描述这些空间状态如何变化。现阶段就已经出现了一个非常明确的研究方向,即直接把Occupancy作为World Model中的世界状态。

OccWorld(ECCV 2024)就是其中的代表,它利用过去的Occupancy状态预测未来世界如何变化,在nuScenes数据集上给定2秒历史预测未来3秒,平均IoU达26.63,验证了占用空间作为世界状态的有效性。Drive-OccWorld(AAAI 2025)则进一步将这种4D Occupancy世界模型与端到端规划结合起来。到了2026年,这条路线还在继续向前发展。OWMDrive(2026)直接以4D Occupancy World Model作为端到端驾驶框架的一部分,通过多步未来Occupancy预测为规划提供条件信息,进一步探索未来状态预测与驾驶决策之间的结合。

与此同时,相关综述也将3D/4D世界建模归纳为视频生成、占用生成与点云生成等不同技术路线,占用生成路线正是上述融合趋势的体现。由此也看出了一个重要变化,Occupancy和World Model已经不能简单理解为两个相互竞争的技术。Occupancy可以作为World Model描述世界的空间基础,而World Model则可以让Occupancy从描述当前空间进一步走向预测未来空,再进一步服务于规划。

05、最后的话

如果一定要给两者划一条边界,最合理的方式不是把它们定义成感知和预测,而是看它们建模的范围。Occupancy解决的是空间状态问题。其关注周围三维空间中哪里被占据、是什么语义,以及这些空间如何组织起来,进一步发展后也可预测未来的4D Occupancy。World Model则解决状态演化问题。其关注当前世界状态如何向未来演化,并进一步考虑不同自车动作对应的未来结果,研究范围可覆盖未来场景生成、状态预测、动作条件推演及规划决策等更大范畴。两者之间不是简单的上下游,也不是新技术淘汰旧技术的关系,而是存在明显的交叉。

正是这种交叉,构成了2026年自动驾驶技术路线的一个重要变化。Occupancy正在从静态三维空间表示走向时空世界建模,而World Model也越来越多地采用Occupancy作为描述驾驶环境的统一状态空间。对于端到端自动驾驶而言,这种融合让系统不再只是根据当前画面直接预测一个驾驶动作。而是有机会先形成对当前世界的状态表示,再推演多个可能的未来,最后根据未来结果选择更合适的驾驶行为。

当然,这并不意味着问题已经解决。长时序预测中的误差累积、遮挡场景、长尾事件、行为不确定性,以及模型过度抽象可能丢弃对决策至关重要的微小视觉细节,仍是实际应用中的重要挑战。

2026年的研究重点正从单纯生成看起来合理的未来场景,转向预测是否准确、是否可控,以及能否真正改善驾驶决策。因此,两者关系可以归结为一句话。Occupancy是在建立世界是什么样的空间表示,World Model是在此基础上研究世界会怎么变化。到了2026年,两者正通过4D Occupancy和Occupancy World Model逐渐融合。未来真正值得关注的,不是World Model是否会取代Occupancy,而是空间状态表示、未来世界预测和端到端规划,能否最终形成一个真正闭环的驾驶系统。

#自动驾驶 #世界网络 #占用网络

相关推荐

深耕智能驾驶、自动驾驶领域技术、资讯等信息,解读行业现状、紧盯行业发展、挖掘行业前沿,致力于助力无人驾驶落地与普及!

微信公众号