• 正文
  • 相关推荐
申请入驻 产业图谱

一文看懂物理AI真正的门槛:不是算法模型,而是系统工程

07/23 09:37
147
加入交流群
扫码加入
获取工程师必备礼包
参与热点资讯讨论

过去几年,生成式AI的突破让人们看到了一条清晰的技术路径:更多数据、更大模型和更多算力,可以不断拓展数字智能的能力边界。但当AI从语言、图像和代码走进真实世界,这套逻辑是不是能被原样复制?其实,物理AI面对的不是一个封闭、可随时重置的数字环境。

机器人必须感知空间、理解任务、规划动作、控制身体,还要应对摩擦、遮挡、形变、扰动和意外失败。一次错误,在数字世界里可能只是重新生成一次答案;在物理世界里,却可能意味着零部件损坏、生产中断,甚至安全事故。因此,物理AI真正要解决的问题,不只是“模型能不能做出一个演示”,而是机器人能否在不同任务、不同场景和不同本体上稳定工作,并且从每一次真实交互中继续学习。这也是物理AI从演示走向规模化应用的分水岭。

本文通过WAIC 2026 智启具身论坛上智元合伙人、高级副总裁、具身业务部总裁,觅蜂科技董事长兼CEO 姚卯青的《模型与数据飞轮:冲破物理墙,驱动物理AI的智能涌现》演讲内容整理相关信息,帮助大家理解当前热门的物理AI真正的门槛:不是算法模型,而是系统工程。

1. 理解物理AI,要先理解智能的两条主线

智能可以沿着两条主线来理解:表征与闭环。

表征,是对世界进行抽象和压缩。语言、数学、代码,本质上都是人类对世界形成的高密度表征。大语言模型的成功,很大程度上来自对海量知识表征的学习。闭环,则是智能体与环境持续交互的过程:

感知环境 → 理解任务 → 作出决策 → 执行动作 → 获得反馈 → 修正策略

数字AI已经在“知识表征”和数字环境内的反馈闭环中取得了巨大进展。但物理AI不仅要理解知识,还要形成对真实交互经验的表征,并在现实环境中完成闭环。这意味着,物理AI不是数字AI能力的简单延伸,而是一种范式变化:从知识的规模化,走向真实世界交互经验的规模化。互联网可以直接为语言模型提供文本、图像和视频,但互联网上没有现成的机器人操作轨迹、力反馈、失败恢复过程和精密控制经验。物理AI必须在真实世界中“摸爬滚打”,通过行动积累经验,再用经验修正策略。

2. 物理AI规模化之前,必须翻过三道墙

1. 数据墙:真实交互数据既稀缺又昂贵

网页数据可以被大规模抓取,机器人数据却很难被“爬”出来。一次高质量真机数据采集,需要机器人本体、传感器、操作人员、任务环境和安全保障共同参与。而且,物理数据不是一段普通视频。真正可用于训练的数据,往往还需要包含:

    多视角视觉信息;机械臂、末端执行器和关节状态;动作轨迹和时间戳;力、触觉或接触信息;任务指令与动作语义;成功、失败和人工干预记录。

数据采集成本高、标准不统一、质量参差不齐,供给和模型需求之间还存在明显错配。这构成了物理AI的第一道墙。

2. 表征墙:不同任务、场景和本体之间难以共享经验

今天的不少机器人系统仍然围绕单一任务训练:一个模型负责叠衣服,另一个模型负责分拣;换一台机械臂、换一个房间或换一种物体,模型往往就要重新适配。物理AI需要学习的不是某一个动作的表面轨迹,而是动作背后的通用物理经验。例如:什么是抓取稳定性、怎样处理遮挡、物体发生形变后应该如何调整、任务失败后怎样恢复。只有形成跨任务、跨场景、跨本体的统一表征,数据才可能被复用,模型能力才可能真正泛化。

3. 闭环墙:真实世界试错代价太高

强化学习在仿真或游戏环境中可以进行海量试错,因为环境可以快速重置,失败几乎没有成本。但机器人在真实世界中的反馈速度慢、并行难度高,一次失败还可能造成硬件损坏。因此,物理AI不能只依靠“让机器人自己多试几次”。它需要同时借助真机环境、物理仿真和神经网络世界模型,构建可验证、可并行、可扩展的闭环训练环境。

3. 一个通用物理AI系统,需要具备三种能力

跨越三道墙之后,目标不是训练一个会做更多动作的机器人,而是构建一个可泛化、可优化、可进化的系统。

可泛化,指机器人能够从大规模、多来源的数据中学习通用物理经验,并将能力迁移到新任务、新场景和新本体。

可优化,指机器人可以在真实任务中接受反馈,通过后训练不断校正策略,提升成功率、稳定性和可靠性。

可进化,则意味着机器人部署后产生的数据能够回流到训练系统,使模型持续吸收新的任务和环境经验,不断拓展能力边界。

对应到工程体系,一套完整的物理AI系统至少包含四层:1. 多种机器人组成的规模化部署层;2. 同时容纳数字知识和物理经验的知识层;3. 预训练、后训练和持续学习组成的算法层;4. 真机、物理仿真和世界模型组成的验证闭环。这四层不是各自独立的模块,而是一套不断转动的系统。

4. 模型路线正在从“直接出动作”转向“先想后做”

目前物理AI的模型演进,大致可以看到两条互补路线。

第一条是VLA,即视觉—语言—动作模型。它擅长理解环境和语言指令,完成任务语义对齐,并形成较高层级的动作规划。简单来说,VLA回答的是:

我在哪里?要完成什么任务?大致应该怎么做?

第二条是WAM,即世界动作模型。它更关注动力学和未来状态的推演,回答的是:

如果执行这个动作,接下来会发生什么?

传统策略模型经常从目标直接输出动作,类似一种“肌肉记忆”。这种方式在固定任务中可以有效,但面对长程任务、环境扰动和意外状态时,容易缺少可解释的中间规划。

新的方向是让机器人“先想后做”:先生成较低频、较粗粒度的任务规划,再由高频控制系统完成精细动作。高层系统负责理解、拆解和规划,低层系统负责实时跟随和稳定控制。从长期看,VLA与WAM不是非此即彼。更可能出现的终局,是把VLA的语义理解和规划能力,与世界模型的物理推演能力融合起来,形成世界推理动作模型:

理解任务 → 推演未来 → 评估选择 → 执行动作

这时,机器人就不再只是把感知信号映射为电机动作,而是具备了对行动后果进行预测和选择的能力。

5. 世界模型的价值,不只是生成视频

世界模型常被理解为“预测下一帧画面”,但对物理AI来说,仅能生成未来视频远远不够。

一个真正有用的世界模拟器,还需要补齐三项能力:

    同时预测环境变化和机器人本体状态;根据任务指令自动判断任务进度并提供奖励反馈;以足够低的计算成本支持大规模评测和后训练。

如果世界模型能够接收初始画面、任务指令和机器人动作,并快速推演环境如何变化,就可以在不反复消耗真机的情况下评估策略、生成训练反馈、筛选失败案例。它的意义并不是替代真实世界,而是承担那些成本高、风险大、需要大量并行试验的训练环节。真机提供最高保真的经验,仿真提供可控的物理环境,神经网络世界模型提供高速的状态推演,三者共同组成物理AI的训练闭环。

6. 预训练决定起点,后训练决定能否干活

预训练让模型获得通用认知、基础动作能力和跨任务迁移能力,但一个模型在基准测试中表现优秀,并不代表它能直接进入工厂或家庭。真实部署要求的往往不是“偶尔成功”,而是长时间、无人干预、高一致性地运行。在这种标准下,后训练的重要性会迅速上升。一种可扩展的做法,是让机器人集群在真实环境中运行,并实时回传:

    成功轨迹;失败轨迹;人工接管和纠正记录;环境变化与任务结果;模型置信度和异常状态。

云端系统据此更新策略,再把新模型下发到机器人集群。随着机器人数量增加,原本串行、低频的真机学习过程,可以转变为并行的群体学习过程。这里真正值得关注的,不只是“有多少台机器人一起训练”,而是能否建立一套秒级接入、统一调度、快速更新、可追踪评估的云—边—端协同系统。只有这样,真机强化学习才可能从单机实验走向规模化工程。

7. 物理AI需要的是数据金字塔,而不是一种“万能数据”

真机数据质量最高,却最昂贵。互联网数据规模最大,却缺少直接的机器人动作和接触信息。因此,物理AI的数据体系不会只依赖一种数据,而更像一座金字塔。

最底层是海量互联网数据,用于学习常识、物体语义、场景关系和人类行为知识。中间层是第一视角和UMI(universal manipulate interface)类无本体数据。它们可以记录人类操作过程、空间轨迹、时序关系,部分设备还可以采集力反馈。

相比真机遥操作,这类数据更容易进入家庭、工厂和服务场景,适合扩大任务与环境的多样性。最上层是真机数据,包括高精度动作轨迹、机器人状态、接触信息、失败恢复数据和部署回流数据。它规模较小,却最接近最终执行分布,是模型完成物理对齐和高可靠后训练的关键。真正有效的“数据配方”,不是在不同数据类型中三选一,而是根据任务阶段组合它们:

    用互联网数据获得广泛认知;用第一视角和无本体数据扩展任务多样性;用真机数据完成动作对齐;用部署回流数据持续修正模型。

8. 采集只是第一步,数据治理决定数据能否转化为能力

原始操作视频并不能直接成为高质量训练数据。物理AI的数据治理至少需要完成以下流程:其中最容易被忽略的是最后一步:数据不能只被打上“好”或“不好”的标签,还要能够回答“哪批数据让哪个任务提升了多少”“问题来自数据覆盖不足,还是动作质量不够”“下一轮应该补采什么”。

当数据质量、模型效果和具体任务之间建立可追踪关系后,采集才不再是盲目堆量,而会变成一套可以计算投入产出比的工程过程。

9. 真正的飞轮,发生在机器人部署之后

一个完整的物理AI数据飞轮可以概括为:

模型执行 → 数据回流 → 失败与高价值样本挖掘 → 模型更新 → OTA下发 → 再次执行

预训练解决的是模型“从哪里出发”,部署回流决定的是模型“最终能走多远”。

因为真实场景会不断产生训练阶段没有覆盖的长尾问题:物体摆放发生变化、光线改变、夹取位置偏移、材料出现形变、设备逐渐磨损,或者任务流程临时调整。这些边界数据恰恰最有价值,因为它们直接暴露了模型当前的能力边界。当系统能够自动发现失败、定位原因、回收数据并更新模型时,机器人部署就不再只是能力的终点,也会成为下一轮训练的起点。

结语:模型决定起点,系统工程托底下限,数据定义终局

不过,物理AI落地,最终要看稳定性而不是演示效果,演示视频证明的是“机器人曾经成功过”的是由单点能力决定的演示上限,产业部署要求的却是“机器人能否持续成功”,而他需要的是系统能力决定部署下限,需要预训练、后训练、真机强化学习、仿真、数据闭环、多模态感知、精密力控和云边端协同的共同作用。

所以,物理AI的“智能涌现”不会只由更大的模型带来。它取决于模型、数据、世界模型、仿真、真机训练、部署场景和硬件系统能否形成一套持续进化的闭环。模型决定机器人一开始具备怎样的通用能力;数据决定它能够理解多少真实世界的变化;后训练决定它能不能把任务做好;部署回流决定它是否可以越来越好。

总结起来,物理AI真正的竞争,不只是比谁的机器人更像人、演示更惊艳,而是比谁能更早建立一套可泛化、可优化、可进化的系统。当数据墙、表征墙和闭环墙被逐步打通,机器人才能真正从“会表演”走向“能干活”,并最终形成属于物理世界的智能飞轮。

*未经准许严禁转载和摘录-获取本文参考资料方式:加入我们的知识星球可以下载公众号海量参考资料包含以上参考资料。

相关推荐