• 正文
  • 相关推荐
申请入驻 产业图谱

从英伟达Cosmos 3 ,看懂物理AI的下一场算法核心「世界模型」

1小时前
180
加入交流群
扫码加入
获取工程师必备礼包
参与热点资讯讨论

过去一年,世界模型在整个制造业出现得越来越频繁。

智能驾驶的在谈,做具身智能的在谈,芯片公司大模型公司也在谈。这股热度背后,其实是行业看到了端到端模型在数字世界里的能力,于是自然会问:类似的方法进入物理世界后,能不能解决驾驶、操作和生产中的现实问题?

但物理世界的模型很快遇到了一个现实问题:端到端模型越来越强,训练数据却越来越难找。以自动驾驶为例,行业并不缺常规道路数据,真正稀缺的是施工改道、极端天气、异形车辆和突发横穿等长尾场景。

单靠路测采集,成本高、周期长,有些危险场景甚至不适合反复采集。具身智能面对的问题更直接,不同机器人、不同工厂和不同任务,都需要大量专用数据,而这些数据目前非常稀缺。世界模型因此被推到了台前。

最近,在 SIGGRAPH 2026 的 NVIDIA Physical AI Day 上,NVIDIA 研究副总裁、Cosmos Lab 负责人 Ming-Yu Liu 分享了 Cosmos 3 物理世界模型的相关信息。

本文结合这场演讲,聊一聊世界模型为什么重要、Cosmos 3 采用了怎样的技术方案、它可以用在哪里,以及它可能给汽车和制造业带来哪些启发。

世界模型为什么重要?

当前这一轮生成式 AI 的进步,很大程度上来自海量互联网数据。语言模型读过网页、书籍和代码,图像模型看过大量图片和视频。数字世界里已经积累了足够多可以直接用于训练的内容。

但物理世界里的机器人没有这么幸运。

搞过自动驾驶和机器人研发的人都知道,物理世界的数据通常来自真实操作。一名操作员控制一台机器人工作一小时,最多也只能得到一小时数据。采集过程中还可能发生碰撞、设备损坏,甚至带来安全风险。如果想让机器人见识一千种仓库、一千种厨房和一千种天气,完全依靠真实采集,成本很难承受。

传统仿真可以缓解一部分问题,但仿真场景同样需要人来搭建。物体放在哪里,光线如何变化,设备会出现什么故障,通常都要提前设计。如果海量场景和长尾情况仍然依靠人工逐个配置,系统就会再次回到规则驱动的扩展方式,很难覆盖真实世界的复杂性。

世界模型提供了另一种思路:用模型直接生成机器人需要经历的场景,再让模型预演这些场景中可能发生的事情。一间仓库可以变化出不同布局、光照、货物和故障状态;一条道路可以变化出不同天气、交通参与者和危险事件。机器人或自动驾驶系统不需要在现实中把所有错误都犯一遍,也能提前学习如何应对。这样一来,训练机器人就不再完全受真实时间限制。

增加算力,可能同时意味着增加新的训练场景、新的失败案例和新的测试数据。最终部署到车辆或机器人上的模型,也有机会获得更强的泛化能力。演讲中有一句话很关键:数据不再只是采集来的,也可以通过计算生成。

Cosmos 3 是怎么工作的?

双塔结构:一个负责“想”,一个负责“演”

Cosmos 3 内部有两个主要部分,可以把它们理解成“负责想”和“负责演”。

第一个部分是自回归塔。它负责看懂画面、理解指令、解释事件和拆解任务。比如,模型收到“从抽屉里拿出方块,放到台面上”的指令后,会先列出任务步骤:找到方块,移动夹爪,抓住方块,将它抬起,移到台面,再放下。

第二个部分是扩散塔。它负责生成图像、视频、声音和动作,也负责模拟执行这些动作后,世界可能发生什么变化。完成规划后,扩散塔可以生成一段内部演练:机械臂伸进抽屉,夹住方块,再把它移到台面上。

模型还可以生成方块接触桌面时的声音,因为声音本身也是判断接触、碰撞和设备状态的重要线索。扩散塔中的每个 token 都能关注同一塔中的其他 token,也能关注自回归塔中的 token,因此它可以同时理解语言信息和视觉观察。

两个塔各自拥有独立的 MLP,也就是多层感知器参数,但它们共享多模态注意力。正是这部分共享注意力,让语言、视觉、音频和动作能够彼此对齐,并将世界理解和世界仿真融合到同一个内部表示中。

模型既要知道“杯子”这个词指向画面中的哪个物体,也要知道“抓起杯子”对应什么运动轨迹,还要把杯子落到桌面的画面与接触声联系起来。这套结构的重要性就在这里:它把理解、推理、模拟和行动接到了一起。

机器人看到环境后,可以先做规划,再想象动作可能产生的结果,最后执行。

把动作分解成一套几何语言

对物理 AI 来说,只会看和说还不够。汽车需要转向和制动,机械臂需要伸展和抓取,人形机器人还要协调身体和双手。动作必须进入模型内部,与文字和视觉处在相同的建模层级。问题在于,不同机器人的身体差别很大。一辆车没有手,单臂机器人没有腿,人形机器人又比普通机械臂复杂得多。

Cosmos 3 使用一套几何动作原语来描述不同载体,主要包括身体的位置和朝向、手或夹爪在空间中的位置,以及手或夹爪的抓取状态。按照这套方法,一辆车可以用身体位姿表示;单臂机器人可以用一个末端执行器和一个夹爪表示;人形机器人则增加身体位姿、双手位置和双手状态。

身体结构虽然不同,动作却可以转换为一套共同的几何表达。

这套动作语言由世界的视觉结构进行锚定,把像素、运动、空间和控制连接起来。不同机器人可以使用同一种动作表达,模型从一种载体上学到的经验,也就有机会迁移到其他载体上。人类第一视角视频同样可以被纳入这套表示。一个人的移动方向、双手位置和抓取状态,都可能被转换成机器人训练所需要的动作信息。

这样一来,大量原本只有画面的视频,也有机会变成机器人学习数据。

看到这里,是不是很容易想到现在经常被讨论的 VLA,也就是视觉、语言和动作模型?这里需要稍微解释一下。VLA 中的 L 通常指自然语言,Cosmos 的几何动作原语主要属于 A,也就是动作表示。

但从更宽泛的角度看,模型确实需要为不同机器人建立一套能够共同理解的“语言”。这种语言不一定是人类日常使用的自然语言,也可能是一套共享的几何符号、动作 token 或内部表示。关键在于,视觉、语言和动作最终能够在同一个表示空间中对齐。

世界模型如何与现实交互?

Cosmos 3 把三类能力放进了同一个模型:正向动力学、逆向动力学和策略模型。训练 Cosmos 时,NVIDIA 将动作与世界状态放在一起建模,并让动作信息双向流动。

正向动力学:执行动作后会发生什么?

正向动力学回答的问题是:给定当前状态和一个动作,未来状态会是什么?也就是说,在行动真正发生之前,模型先推演动作可能产生的后果。对自动驾驶来说,车辆在执行变道、转向或制动前,可以先预测周围交通关系会怎样变化。对机器人来说,机械臂在真正移动前,可以先判断这个动作会顺利抓住物体,还是可能撞到抽屉边缘。

逆向动力学:什么动作造成了眼前的变化?

逆向动力学回答的问题是:观察连续的视觉状态,什么动作导致了眼前的变化?这项能力非常实用,因为它可以把人类示范视频或机器人日志,转换成带动作标签的训练数据。原本只有画面的视频,经过逆向动力学处理后,有机会得到与画面配对的动作序列。大量行车视频、机器人录像、人类第一视角视频和工厂监控数据,也就有可能被重新利用。

策略模型:下一步应该做什么?

策略模型回答的问题是:给定当前观察和任务目标,下一步应该采取什么动作?执行动作后,又会产生怎样的视觉结果?它关心的是机器人如何完成任务,以及这些动作将带来什么后果。正向动力学寻找动作的结果,逆向动力学寻找结果背后的原因,策略模型决定下一步行动。三种能力被统一到一个模型中后,世界建模就不再只是机器人技术的上游工具,世界模型本身也开始进入机器人系统。

Cosmos 3 可以用在哪里?

第一,生成训练数据

这是目前最直接的用途。企业可以用 Cosmos 3 批量生成工厂、仓库、道路和机器人操作场景,并改变场景中的物体、光照、天气、摄像头位置和故障类型。真实世界中很少发生的危险情况,也可以在模型中反复生成和测试。对自动驾驶来说,它可以补充施工改道、恶劣天气、异形车辆和突发交通事件等长尾数据;对机器人来说,它可以生成不同工位、不同物体和不同操作失败方式。

第二,理解视频并自动标注

Cosmos 3 还可以分析已有视频,用于数据自动标注。一段机器人录像交给模型后,它可以找出任务的不同阶段,解释每个阶段发生了什么,并尝试恢复相应的动作。这意味着企业过去积累的大量视频和机器人日志,不一定只能依靠人工逐段标注。模型可以先完成事件分段、内容解释和动作恢复,再由人工进行复核。

第三,预测动作可能产生的结果

车辆在真正变道、制动之前,或者机械臂在真正抓取之前,世界模型可以先模拟动作可能产生的结果。这类能力可以用于闭环仿真、策略评估和安全测试,也可以帮助自动驾驶和机器人系统减少一部分现实中的危险试错。

第四,训练驾驶和机器人策略

Cosmos 3 将视觉、语言和动作放进同一个模型,可以根据当前观察和任务目标生成下一步动作,为端到端驾驶和 VLA 模型提供基础能力。基础模型完成后,企业还可以使用自己的场景数据进行后训练,再通过蒸馏和压缩,把能力部署到车辆或机器人端侧。换句话说,它最终有可能被蒸馏成车端或机器人端能够运行的算法。

Edge、Nano 和 Super:从基础模型到端侧部署

在演讲中,Ming-Yu Liu 分享了 Cosmos 3 目前提供的三个模型规格。Edge 有40亿参数,也就是4B,重点是设备端实时运行。Nano 有160亿参数,也就是16B,适合作为企业开发和后训练的起点。Super 有640亿参数,也就是64B,追求更高的理解和生成质量。

Edge 面向机器人和车辆端侧,Nano 面向开发与构建,Super 面向更高的模型能力。三个模型共享同一套基础,而这个基础就是我们常说的基础模型。很多希望掌握软硬件和数据闭环的公司都应该在研发自己的基础模型。以特斯拉为代表的一些企业,常被外界形容为想成为“机器人行业里的苹果”,国内各种新势力也想这么做。要做到这一点,只掌握硬件还不够,还需要拥有自己的数据、模型、训练体系和端侧部署能力。

物理 AI 的竞争不能只看参数规模。模型能否放进汽车或机器人,功耗有多大,响应速度够不够快,同样重要。演讲中,Ming-Yu Liu 还介绍了一种蒸馏方案。Cosmos 3 生成高质量视觉结果,原本需要约35至50个去噪步骤。经过蒸馏后,去噪步骤可以减少到4步。NVIDIA 在演讲中称,整体可获得约25倍加速,同时保持接近教师模型的质量。

这里需要区分两个概念。去噪步骤从约50步减少到4步,与整体推理速度提升有关,但不能直接用50除以4来推导25倍。最终速度还会受到模型结构、硬件和执行效率影响。更准确的理解是:蒸馏后去噪步骤减少到4步,而NVIDIA报告的整体加速约为25倍。对机器人和汽车来说,这类加速比单纯提高画面质量更有现实价值。物理设备对响应速度、功耗和稳定性都有明确要求,这也是当前世界模型部署到边缘端的重要研究方向。

结语

NVIDIA 的 Cosmos 3 展示了一条很清楚的路线:机器人先理解世界,在内部模拟几种可能,再决定如何行动。它的价值不只在于生成视频。更重要的是,它尝试把文字、视觉、声音和动作放进同一个模型、同一种 token 空间,让训练数据、环境模拟、任务规划和机器人控制使用同一种世界表示。如果这套方法有效,未来训练机器人可能不再需要把每一种情况都在现实中重新经历一遍。

大量练习会先发生在模型内部,真实机器人负责验证和纠错,再把新经验送回模型。对自动驾驶来说也是如此。车辆在真实道路上遇到的长尾场景,可以进入世界模型,被理解、扩展和重新生成;模型在内部完成更多训练后,再回到实车上验证。

这大概就是世界模型最值得关注的地方:它开始让机器拥有一种很初步的能力,在真正动手之前,先想一下可能会发生什么。最后来个小广告:买书么?自动驾驶的,Vehicle联合机工社权威出版的,汽车行业高薪岗位,未来具身智能必备书籍

参考资料以及图片

    World Models: The Frontier of Physical AI | Physical AI Day at SIGGRAPH 2026 pdf,NVIDIA 研究副总裁、Cosmos Lab 负责人 Ming-Yu Liu

*未经准许严禁转载和摘录-获取本文参考资料方式:加入我们的知识星球可以下载公众号海量参考资料包含以上参考资料。

英伟达

英伟达

NVIDIA(中国大陆译名:英伟达,港台译名:辉达),成立于1993年,是一家美国跨国科技公司,总部位于加利福尼亚州圣克拉拉市,由黄仁勋、克里斯·马拉科夫斯基(Chris Malachowsky)和柯蒂斯·普里姆(Curtis Priem)共同创立。公司早期专注于图形芯片设计业务,随着公司技术与业务发展,已成长为一家提供全栈计算的人工智能公司,致力于开发CPU、DPU、GPU和AI软件,为建筑工程、金融服务、科学研究、制造业、汽车等领域的计算解决方案提供支持。美国GPU及AI计算巨头,传感器技术应用于自动驾驶及机器人领域。

NVIDIA(中国大陆译名:英伟达,港台译名:辉达),成立于1993年,是一家美国跨国科技公司,总部位于加利福尼亚州圣克拉拉市,由黄仁勋、克里斯·马拉科夫斯基(Chris Malachowsky)和柯蒂斯·普里姆(Curtis Priem)共同创立。公司早期专注于图形芯片设计业务,随着公司技术与业务发展,已成长为一家提供全栈计算的人工智能公司,致力于开发CPU、DPU、GPU和AI软件,为建筑工程、金融服务、科学研究、制造业、汽车等领域的计算解决方案提供支持。美国GPU及AI计算巨头,传感器技术应用于自动驾驶及机器人领域。收起

查看更多

相关推荐