原标题:
最近,阿里 Qwen 团队和华中科技大学在 arXiv 上放了一篇编号 2609.00111 的技术报告,名字叫 Qwen-Drive-1.0。同一天,HuggingFace、ModelScope 和 GitHub 三个地方同步上线,协议是 Apache 2.0,也就是说随便商用,没有法律障碍。
这个模型加起来5B(五十亿)参数,一张 24 GB 显存的显卡就能跑起来。Github里还给了推理代码、四个测试集的场景文件,外加一套开箱即用的演示数据。唯独没给训练代码。
这是继我们之前文章《英伟达 Alpamayo:基于推理的自动驾驶大模型设计与量产部署全解析》分享的巨头公司英伟达之后的中国互联网科技公司开源的智驾驶模型而且免费支持商用,英伟达Alpamayo仅支持研究不支持商用。
所以,本文想把四件事讲清楚:Qwen-Drive的软件架构、每个模块在干什么、这套东西是怎么训出来的、以及一家普通公司拿到它之后到底能做什么。最后给自动驾驶和Physical AI 有什么启发。
希望给汽车自动驾驶行业以及Physical AI 一些信息和启发。
它想解决的问题
学术界这两年走 VLA 智能驾驶算法有一条很流行的路子:拿一个通用大脑,然后喂它大量"看图回答驾驶问题"的数据接着训。例如以前论文里面的 DriveLM、DriveGPT4、OmniDrive、NuInstruct 这批公开数据集都是这么做的,把感知、预测、规划统统写成问答对,让模型用一套语言接口把驾驶任务学下来。
但是 Qwen-Drive-1.0 认为这条路有两个硬伤。
第一个是文字管不住三维。你可以把模型训得很会描述场景,讲得头头是道,但文字目标从来不要求它说出"那辆车离我 12.4 米",也就没法检验它到底看准没有。论文里那句话说得很直接:一个只靠问答训出来的模型,可以生成流畅的场景描述,同时在三维空间里并不准。
打个比方,这就像考驾照只考科目一。背题背得再熟,也不代表你倒车入库不会蹭。
第二个是学了新的、忘了旧的。拿海量驾驶数据反复训一个通用大脑,它会慢慢变成"只会看路的偏科生",原来那些跟开车无关但很有用的常识会被冲掉。而偏偏是这些常识,在遇到没见过的怪场景时最值钱——路中间躺了一个沙发、前面卡车上掉下来一卷地毯,训练集里不会有,能不能反应过来靠的就是通用常识。
其实现实的量产侧,应该还没有哪家量产方案是靠"驾驶问答"来灌驾驶能力的。
小鹏:第二代 VLA 干脆把语言转译那一环整个去掉,从画面直接生成动作
理想:公开介绍的是三段式,先用交通语料和视觉语言数据训一个云端基座,再加动作数据变成 VLA,最后放进世界模型里做强化,语言只出现在打底那一段
元戎启行:自研 400 亿参数的原生 VLA 基座,靠仿真里自己采样、自己打分来练
华为、蔚来:压根不在 VLA 这条线上,走的是世界模型
特斯拉:从头到尾没有提语言这一环
但是很多显示面板 CoT 思维链倒是是这么干的,只用来显示车辆控制的原因。
论文还给了一条很产业的理由,叫舱驾一体。他觉得未来座舱和智驾要走向共用一块芯片,而不是各占一个域控制器。这样能省硬件和集成成本,一个大模型跑在一个芯片中可以用来智驾和座舱,这是一个好的思路。但是走到这一步应该变数很多,看现在lifeifei 和 lecun yang 的态势,语言模型和空间模型可能走不到一起。
回到 Qwen-Drive ,这个目前还是只是一个研究范式,用语言解决所有的智驾量产现状还是要解决延迟,以及本文后半段分享到的问题。
Qwen-Drive 针对上文学术界的现状,他们给自己定了三条规矩:通用大脑本身一行不改;额外加一个能直接看的三维输出,这样,VLA 模型学会开车的同时保住大部分通用能力。
它长什么样:一个不动的基座,两个外挂
论文原图(Fig.2)中文标注版:中间那个大盒子一行没改
整套东西可以一句话概括:中间是一个 VLM 模型原封不动的作为通用大脑,左右各挂一个外部模块。
中间的主通路
摄像头画面先进" ViT 视觉编码器",被切成一个个小方块变成token (ViT 解释可以看之前文章《小鹏二代VLA拆解:四张图看懂智驾与座舱前沿车端大模型架构》);文字提示(比如导航指令"前方路口右转")一起token化,一起送进语言模型。
这个语言模型一共 32 层,其中只有 8 层用的是"每个token都要跟所有token比对一遍"的标准算法,剩下 24 层用的是一种省算力的简化版。这个混合设计优点是在处理长内容时更省。
多个摄像头、多个时刻的画面怎么让模型分得清?直接通过用普通文字当标签:在每张图前面写上"前视""左前视"和"第几帧"。
两个外挂里面是什么
论文原图(Fig.3)中文标注版:左边把画面变成三维,右边把噪声变成轨迹
左边这个叫 BEV 感知头,负责把画面变成三样能直接看的东西:三维检测框、语义占用格、车道线地图。
它内部的做法是:先由一个小网络猜测画面里每个像素大概有多远,把平面照片"撑"成一个立体的格子空间,再把这个立体空间从上往下压成一张俯视图,最后三个分支各画各的。
这里比较巧妙的是,他们设计了一个灵活的感知头算法,一套参数同时吃六摄和八摄也不管他们的位置。这个确实是量产思维,这意味着换车型不一定要重训。
右边这个叫规划专家,大约1B(十亿)参数,负责输出未来五秒怎么走:五十个航点,每个点包含位置和车头朝向。
它的工作方式就是:先撒一把随机噪声,再分十步把这团乱麻逐渐"推"成一条平滑的行驶轨迹。这套办法叫flow matching流匹配,我们在小鹏那篇文章也提到了,机器人领域用得很多,在自动驾驶或机器人轨迹预测(Trajectory Generation)的最新研究中,Flow Matching 正在迅速替代 Diffusion。正是因为它生成的轨迹没有扩散模型早期的随机抖动,每一步的向量场都像“流水”一样把噪声平滑地推向物理可行的行驶路线。
那么,为什么不直接算出一条轨迹?因为很多路况本来就有多个合理答案,前面有辆车挡路,左绕右绕都行;如果强行只学一个答案,模型会学出一条"中间值",也就是直接撞上去。从噪声出发反复采样,才能保住"有好几种走法"这件事。
还有一处设计对工程意义很大:规划专家不重新看一遍图,它直接借用主模型已经算好的中间结果。图里中间那个 K、V 箭头就是这个意思。好处是主模型可以整个锁死不动,你只训右边这十亿参数就行。
它到底能做到什么
论文原图(Fig.7)中文标注版:左边框车和人,中间判断哪块空间有东西,右边画车道
这张图是论文里最直观的一张,它把模型的三样输出摊开给人看,每一样旁边都并排放着真值,让你直接比对准不准。
中间那个"语义占用"有点类似Occ,它是纯视觉方案里很关键的一块。做法是把车周围的空间切成一格一格的小方块,逐格判断这里有没有东西、是什么。它的好处是不认识的东西也能标出来"这儿过不去"。检测框只能框出模型认识的类别,遇到掉在路上的一卷地毯就没辙,而占用格不管它是什么,只要挡路就标上。
驾驶能力大涨,而通用能力几乎没掉,这是它最扎实的一条论证
感知:跟专用检测器打平,占用网络是短板
在同样的分辨率和训练轮次下和作者自己复现的对照组比,它在检测目标物体和车道线两项上都是最好,检测精度 43.95 分,超过同等条件下的专用检测器。
但占用这一项反而落后:19.82 分,低于对照组的 25.72。作者的解释是数据问题,那批占用标签是机器自动生成的,会留下一些"悬在半空、下面什么都没有"的假格子,联合训练也治不好。具体是不是,不得而知,毕竟是论文。
驾驶理解:因果推理这一栏拉开了数量级
先说明一下什么叫因果推理测试。它问的不是"图里有几辆车",而是"你为什么要减速",然后检查模型说出的理由跟它实际做的动作对不对得上。
这一栏的成绩差距大得离谱:Qwen-Drive 拿 41.26 分,它自己的基座模型只有 2.58 分,第二名的通用模型 4.01 分,比它大得多的一个 320 亿参数模型只有 5.73 分。翻译成人话:绝大多数模型能描述场景,但说不清"是哪个东西导致我该踩刹车"。还有一套内部的中文城区驾驶决策题,Qwen-Drive 拿 71 分,基座 59 分。而它的训练数据里没有同类中文题目,说明这套决策能力不是靠背题背出来的。
其实这里很容易回答,毕竟下文会讲到,驾驶理解是重点训练的地方。
通用能力:这条论证最扎实
十四个公开测试集分两组测下来,知识与推理那组它拿 66.41,基座 67.40,只差不到一分;空间理解那组它 53.96,基座 52.99,反而高了。
对照组的情况很能说明问题。同样做驾驶改造的另一个百亿参数模型,在通用测试上只剩 7.5 分,等于废了;还有几个模型在部分测试上直接输出乱码,根本没法评分。学会开车、同时保住通用能力,这个模型确实做到了。
规划:考卷漂亮,真上路差一截
对于路径规划能力,论文给了三种考法,严格程度递增:
开环:给一段路况,让模型画一条轨迹,跟人类实际怎么开的对比。像做卷子,做错了也不影响下一题。
伪闭环:把画出的轨迹按车辆物理特性推演一小段,打个分,但周围车辆是录像回放,不会对你的动作有反应。
闭环:在仿真里真开,你每动一下环境就跟着变,错误会一路累积。
前两项它的成绩很漂亮,伪闭环拿到 90.7 分,在公开榜单上很靠前。第三项是弱项,而且论文自己讲得很坦白:同样的仿真里,它的综合分 0.37、对手 0.45,行驶进度 48%、对手 59%。强化学习把越界率从 24% 砍到 12%,代价是整体更保守、开得更慢。
作者给的可能原因是"看得不够勤"。也就是摄像头输入的频率慢,这套模型只看 1.5 秒内的四帧画面,间隔 0.5 秒,而对手看的是 0.4 秒的密集画面。历史更宽但更稀疏,遇到需要立刻反应的情况就慢半拍。
论文还顺手给闭环指标做了一次祛魅。有个对手模型的"自身责任分"高达 0.53,看着最好,但它的行驶进度只有 35%,作者发现它经常停着不动。不动就不会有自己造成的事故,而这个分数是拿行驶距离除以事故次数算的,分母小了分数自然高。可它照样会被后车追尾,所以它的全事件事故率高达 56%。另一个模型是反过来的毛病,开得很猛,进度 62% 但自身责任事故率 22%。
这里提示是,看论文还真的仔细,例如这里看闭环成绩必须把进度、事故和综合分三个数一起看,单看任何一个都会被骗。
当然这里就是我们之前文章《下一代卡罗拉:丰田如何在全球汽车业变局中,再造一辆“国民车” - NHK《Inside Toyota》》中丰田讲的“数字论”。当一个东西能够多维度评价的时候,千万不能只给一个数字评价。
这套东西是怎么训出来的
论文原图(Fig.4)中文标注版:火苗是这一轮要练的,雪花是锁住不许动的
训练分四段,最省事的理解方式是把它想成带徒弟。
第一段:先让新徒弟自己上手
把通用大脑整个锁死,只训那个新加的BEV感知头。这一步表面上是热身,实际价值在于它顺便做了一次很干净的诊断。
结果是:在锁死的通用大脑上把感知头训到不能再好,仍然比同等条件的专用检测器差 6.34 分。
这个结论是反着证的,也正因为反着证才值钱。行业里有一种朴素的期待,觉得通用大模型见过那么多图片,内部应该已经"懂"三维了,接个头就能用。这个实验说明不是。看图说话学到的东西,和判断距离远近需要的东西,压根不是一回事;想要后者,必须让三维任务的训练信号反传回去,把大脑本身改造过来。
做端到端的团队如果不想重复这轮试错,直接引用这条结论就行。
第二段:师傅陪着一起练
解冻,感知头、视觉编码器和语言模型三者一起训。效果很明显,相比上一段,检测精度涨了 10.46 分,车道线涨了 9.84 分。而上一段的感知头已经练到头了,所以这些提升只能来自一件事:通用大脑本身被改造了。
第三段:换个新徒弟单独练开车
VLM大脑重新锁死,只训规划专家,纯粹学"怎么把轨迹画出来",这一段完全不管文字生成。
第四段:让他上路试错,按结果改
前三段都是"照着标准答案抄":数据里记录了人类当时实际怎么开的,模型就学着画成那样。但现实中问题的标准答案只有一个,而合理的驾驶开法往往有好几种。
所以第四段换了个练法:让模型对同一个场景画出八条不同的候选轨迹,拿评分器逐条打分,然后往得分高的方向调。这就是强化学习。
难点在哪?前面说过,规划专家是从随机噪声出发、分十步推出轨迹的。一旦初始噪声抽定了,后面十步全是确定的,中间没有任何"可以调整的选择点",强化学习就无从下手。
作者的解法有两处很巧。第一,只在最后三步引入随机性。越靠近终点的扰动对最终结果影响越直接,早期的扰动会被后面的步骤慢慢磨平;把探索集中在出口附近,既拿到了差异,又不至于跑偏。第二,加的不是逐点乱抖,而是整条线的平移和弯折。如果给每个航点各加各的随机数,得到的只是一条抖动的锯齿线,八条候选之间比不出驾驶好坏;作者把扰动限制在六种"低频波形"上,产生的差异是"整体往左让一点""这里弯得早一点"这种有实际意义的机动。
奖励怎么设也有讲究,因为三个数据源的评分标准根本不一样。有的用综合驾驶分,有的用人类评分员的偏好打分,还有一个数据源压根没有评分标准,就只用"跟录像差多远"来算,而且把第一秒的误差权重设得最高,因为近处的误差直接决定方向盘怎么打。
这一段用的数据量其实很小:一万五千个场景加一万五千个场景,再加四百七十九个带人类偏好标注的场景。
数据配方才是真门槛
模型结构可以照着论文重写,不过数据这块才是真正拦人的地方。
本论文的感知数据用了两个公开数据集,一个两万八千帧,一个六十万帧。麻烦在于这两家的标注标准完全不一样:一家把车分成轿车、卡车、挂车、巴士、工程车五类,另一家只有一个"车";一家有的类别另一家压根没有。作者的做法是统一到两边都兼容的最粗粒度,某一家独有的类别就只让那一家的数据来管。
还有一处更细的活儿。两个数据集的占用格都是 200×200×16 这个尺寸,但它们代表的实际范围完全不同:一个覆盖前后左右各 40 米,另一个 50 米;一个每格 0.4 米,另一个 0.5 米;连坐标原点定在车上哪个位置都不一样,差了约 1.84 米的高度。硬凑会全部错位,重新采样又会把标签糊掉。作者的解法是保留各自的原生格网,把对齐这件事挪到模型的输出端做一次可微的重采样,一个模块同时伺候两套格网,不用分叉。
语言数据汇了 24 个公开的驾驶问答数据集。这些数据集格式五花八门,很多答案本身就是模板套出来或者机器生成的,质量参差。作者的流水线是两道:先用一个大模型把所有题目和答案重写成统一格式,再用另一个模型逐条判断"重写后的答案跟原始标注是不是一个意思",只留判定一致的。553 万条砍到 309 万条,只留下 55.9%。
自建的部分补的是公开数据里没有的。最重要的一块叫因果链也就是量产大家喊的CoT:从人类实际开的那条轨迹倒推出"他做了什么动作",再让一个更强的模型结合画面写出"他为什么这么做",然后过一道审计。审计的设计很聪明,不让评判模型打分,而是让它答选择题,再把答案程序化地汇总;审计会检查推断出的动作跟真实轨迹是否一致,还会专门剔除那些"偷看了未来"的解释。另外两块是让模型自己认出环视图的先后顺序,以及三万条国内路况的红绿灯和检测题。
规划数据汇了四个来源共 283 万条。其中一个数据集只提供每秒四帧的位置,作者插值补到每秒十帧,并且发现原始数据里的加速度字段需要乘一个四倍的修正系数。任何想复现的人都会踩到。
论文没讲,但量产最关心的延迟账
论文从头到尾没有一个延迟数字。没有帧率、没有车规芯片实测、没有压缩方案,只有一句"推荐 24 GB 以上显存的显卡"。
但它把所有能推出延迟的参数都公开了。下面这些数字全部来自它自己的配置文件和论文正文。
在开始之前,先建立一个直觉,它是整节的钥匙:
模型干活分两段,一段叫读题,一段叫答题。读题是把所有输入一口气看完,可以并行,就像一屋子人同时读一本书的不同页,拼的是算力。答题是一个字一个字往外蹦,蹦每一个字都要把整个模型完整地翻一遍,前一个字没出来后一个就没法开始,拼的是内存搬运速度。
当前帧那 2,700 个token,占了全部画面输入的六成四
先数格子
配置文件里写死了每张图能占多少像素,换算下来当前这一帧是 900 个token,历史帧是 170 个。规划时要看三个视角、每个视角四个时刻(当前加三个 0.5 秒前的历史):
当前帧:3 × 900 = 2,700
历史帧:9 × 170 = 1,530
画面合计:4,230,加上文字提示约 4,400
再算三种跑法各要多久
把算力折算成时间需要一个前提假设,我按数据中心级显卡的实际达成水平估算,这一步是估算不是实测:
直接规划:约 75 到 125 毫秒,相当于每秒 8 到 13 次
带 60 字理由:约 260 到 310 毫秒,每秒 3 到 4 次
带 128 字理由:约 460 到 510 毫秒,每秒约 2 次
理由写满上限:约 850 到 900 毫秒,每秒约 1 次
再叠上感知。八个摄像头要走另一次完整的前向计算,等于把主模型又跑了一遍。
两条通路加起来,不写理由的完整一轮大约需要 77 万亿次浮点运算;要跑到每秒十次,需要约 774 万亿次每秒的持续算力。
作为参照,一块 H100 数据中心显卡的理论峰值是 989万亿次。也就是说,每辆车需要一块 H100 以八成利用率不停地跑,才够这套东西的最低配置,还不含座舱模型,不含安全冗余。
车上为什么会更糟
算力决定读题那一段,内存搬运速度决定答题那一段,而车规芯片卡在后者
这是整件事最容易被"车端多少 TOPS"这类宣传掩盖的一点。回到前面那个读题/答题的比喻:读题拼算力,答题拼搬运速度,而现在车规芯片恰恰是算力标得高、内存搬运跟不上。
具体到数字:模型每往外蹦一个字,要把大约 7.7 GB 的参数从内存里完整读一遍。数据中心显卡的内存带宽是每秒 3,350 GB,读一遍 2.3 毫秒;换成一块每秒 500 GB 的车规平台,就是 15.5 毫秒;当前主流高性能英伟达thro每秒才273 GB,这样的平台按照每秒200 GB,也需要38.7 毫秒。
一段 128 个字的理由,在这两种车规平台上分别要 2.0 秒和 5.0 秒。
能不能靠压缩救回来?把参数精度砍到四分之一,每秒 500 GB 的平台仍然要 0.5 秒。这还只是那段文字,不含读题,对着 100 毫秒的预算差五倍。带理由这条路不是靠压缩能救的,它是结构性出局。
作为旁证,小鹏在自家一篇论文里给过实测:在同一档显卡上,写 40 到 80 个字的自然语言理由要 279 到 307 毫秒,全线超出他们设定的 83.3 毫秒预算;压缩成 2 到 6 个"动作词"之后是 38.6 到 66.3 毫秒,达标。Qwen-Drive 的带理由模式,恰好落在被判超标的那一格。
还有一个更隐蔽的问题
前面说过,规划时的画面是按"同一个视角的连续几帧挨着放"排列的,这样排的好处是让模型容易看出这个方向上的变化。
代价是:时间窗每往前走一步,每个视角里的四帧整体平移,原来第二帧的内容落到了第一帧的位置。整个序列的编号全变,上一轮算好的中间结果一条也用不了,每一轮都得从头把 4,400 个token重算一遍。
作为对比,小鹏那条链路用的是一种"压缩记忆"机制,把三十秒的历史压成一块固定大小的笔记跨轮保留,新画面持续往里加而不必重算。这才是"边看边想边输出"能成立的前提,而 Qwen-Drive 的排列方式从根上排除了这种可能。这不是忘了优化,是设计选择的必然后果。
账算到这里,还有一个官方没写进论文的杠杆值得指出来。配置文件里藏着一项多字预测头,它能支撑一种"一次猜好几个字再回头验证"的加速技巧,把答题那段砍掉大约一半。论文对此只字未提,仓库文档也没写。东西已经在权重里了,只是没人告诉你。
普通公司能拿它做什么
把"能不能上车"拆成六件事之后,答案就不含糊了
今天就能做的
Qwen这个模型采用Apache 2.0 所以他是纯开源可用商用。权重完整,一张 24 GB 的卡就能跑起来。
你能用他干什么?
第一是数据挖掘和自动标注:因果推理那 41 分对标注流水线是实打实的价值,给它一段行车视频,它能说出"这段为什么急刹",能按语义把相似场景检索出来,而这活儿现在多数公司靠人工,成本极高。
第二是座舱助手,当然这个现在Qwen模型就是开源的,大家都可以用。
第三是仿真里的基线和陪练。
还有一个:那个 0.5 GB 的BEV感知模块可以整个抽出来单独用。接口清晰、坐标约定有文档、不绑摄像头布局,放在github上免费拿。
做不了的
想拿这个概念和模型做自动驾驶,基本不太可能。
训练代码没开源。开的是推理代码加权重。想在自己车队数据上复现那四个阶段,得从论文重写。论文写得算细,各种参数都给了,可复现性在同类论文里算好的,但从论文到能跑的训练代码是几个月的事。数据流水线也一样,重写、过滤、审计、标签统一,全都描述了但没给工具。
实时性没有答案。上一节已经把账算完了,这里不重复,只补一句:那笔账里最贵的一段,恰好是它成绩最好的那个配置。
闭环是弱项,而且短板在数据基建。要做闭环强化学习,得先有一个够真的仿真环境让模型反复试错。Qwen-Drive 没有这个环境,只能借别人的,第四段强化学习只能在离线打分器上做,一共三万多个场景。论文自己也提醒,那个伪闭环分数不该当成真实驾驶质量的替身。
功能安全没有答案。一个五十亿参数的生成式模型在车规安全体系里怎么论证,业内目前没有共识。论文在局限性一节的自述恰好戳在最痛的地方:它生成的轨迹并不总是遵循它自己写的那段理由。作者还承认,带理由能提分,有一部分可能只是因为那段自问自答往上下文里塞了更多信息,而不是真的想明白了。换句话说,它给的解释不保证就是它的决策依据,这对任何想拿"可解释性"去做安全论证的公司,是一盆冷水。
纯相机,没有融合。没有激光雷达和毫米波,感知只看当前这一帧,没有下游控制器、没有安全兜底、没有降级策略。它输出的是一条五秒的轨迹,不是方向盘转多少度,车上还缺一整套把轨迹变成动作、并且在它出错时接管的东西。
数据几乎全是欧美路况。虽然那个中文决策 71 分说明理解能力能跨地域,但驾驶行为不会自动迁移。加塞、鬼探头、逆行的电动车,这些在每个地域的数据集里不一样。
这件事对行业意味着什么
开源的门槛,正在从模型移到训练场
模型已经不构成壁垒了。5B(五十亿)参数、四个模块全给、可商用协议,这在两年前不可想象,现在只是一次常规发布。
没给的那部分才是真门槛:四段训练代码、数据统一流水线、因果链审计流程。而比训练代码更难复制的是那个能让模型反复试错的仿真环境。小鹏把自家仿真场景从三万涨到五十万以上,等效每天跑三千万公里;Qwen-Drive 只能借别人的,而且成绩恰好是弱项。
这两件事之间有因果。没有够真的仿真场,强化学习就只能在离线打分器上做;只在离线打分器上做的强化学习,练出来的是"更会应付这个评分公式",解决不了真实驾驶中错误一路累积的问题。下一轮的壁垒不在模型,在能不能自己造出一个够真的训练场。
通用和实时是一道必答题,而且没有中间路线
把 Qwen-Drive 的每个设计摊开看,会发现它们指向同一个方向:保留完整的语言输出能力,换来座舱能力和可解释性,代价是一个字一个字往外蹦;当前帧上高清,换来看得更细、测距更准,代价是 2,700 个格子的读题成本;不绑摄像头布局,换来跨车型通用,代价是没法把单一车型的先验烘进模型来换取瘦身;挂显式的三维输出,换来能看能验,代价是八个摄像头的第二次完整计算;用自然语言写理由,换来可审计的解释,代价是超预算三到十倍。
如果我们看小鹏那条链路:把理由压成几个动作词、跨轮保留压缩记忆、把轨迹生成揉进主干、剪掉冗余的画面格子、输出加速度再积分成轨迹。
可用看到从论文到量产,更多的是数据以及巧妙的平衡,当然小鹏平衡了,但平衡的好与不好是最难的,我们也不得而知,这需要现实的考验。
跨数据集统一那套工程,国内公司马上能用
数据标签体系对齐可能是大模型训练要重视的事情,要不然模型能端到端,训练的数据不端到端,也不行。
舱驾一体有两种解法,选哪种可能不是技术问题
Qwen-Drive 花了整段论证:座舱和智驾要共用一块芯片,所以驾驶模型必须保住通用能力,一个模型服务两边。
但从公开信息看,小鹏走的是另一条:座舱是一条独立的助手链路,智驾是另一条,两者共用一块芯片但不共用同一个模型实例。
这里的分歧未必是技术判断。座舱和智驾同频共振还需要打问号。一个模型两用省的是显存和调度,两个模型共用平台省的是耦合风险和迭代摩擦,后者更像量产会做的选择。
写在最后
Qwen-Drive-1.0 的作者把它称为"迈向驾驶基础模型的第一步",这个自我定位是诚实的。它证明了显式的三维感知和轨迹生成可以加到一个通用大模型上而不损失通用能力,也把完整的权重和一份写得相当细的方法论交了出来。
它没有证明的,是这套东西能不能装进 100 毫秒。而这两件事在它的设计里是同一枚硬币的两面。
想要它的实时性,估计还得等工程实例的探索,Qwen-Drive-1.0 是不是自动驾驶算法的Deepseek时刻?Maybe, 但他绝不是 deepseek 这类数字AI 直接上手的。
最后来个小广告:
Vehicle联合机工社权威出版的《自动驾驶产品经理》,端到端了解自动驾驶产品技术以及如何做自动驾驶产品经理。
参考资料以及图片
*未经准许严禁转载和摘录-获取本文参考资料方式:加入我们的知识星球可以下载公众号海量参考资料包含以上参考资料。
432
