• 正文
  • 相关推荐
申请入驻 产业图谱

具身智能落地的最后20%,为什么离不开「云」?

09/08 09:09
289
加入交流群
扫码加入
获取工程师必备礼包
参与热点资讯讨论

作者丨张嘉敏,编辑丨胡敏

今年的WAIC和WRC,具身智能展台的风向变了:不再执着于炫技,转向务实。

去年的画风还是十八般武艺,同台竞技——机器人跳街舞、格斗秀、走猫步等;而今年则是走进真实场景:机器人开始被放进物流、工业、家庭等具体任务里。

这种变化,指向一个更大的行业问题:具身智能究竟走到哪一步了?距离真正的大规模商业化,还有多远?

从技术扩散的视角看,一项新技术从少数人尝鲜走向大众普及,通常要经历从创新者、早期采用者到早期大众等不同阶段。

决定一项技术能否从少数人的尝鲜,进入持续增长阶段的,是它能否跨过早期采用者与早期大众之间的鸿沟

显然,今天的具身智能,仍处在少数人尝鲜的阶段。只有当早期大众真正开始采用,行业才可能进入持续数年的高速增长期。

这道鸿沟何时能跨越?一位业内人士给出的相对乐观判断是,还需两三年。但在此之前,要先克服诸多棘手难题:

比如真实数据从百万小时迈向千万小时,基础模型从“能完成任务”变成稳定、高效地完成任务,硬件成本和可靠性达到用工替代标准,To B场景真正跑通ROI,并从试验走向持续采购。

过去两个月,雷峰网一线走访了灵初智能、艾欧智能等具身智能公司,也观察了各厂商在展台上的演示,一个感受越来越强烈:机器人一旦开始真正“干活”,需要的就不只是一副好“躯体”,真实场景里的任务远比Demo脚本复杂得多。

从厂商正在经历的挑战来看,展示能力到真正完成任务,中间隔着一整套复杂的系统工程,而云正在成为其中重要的一环

真正进入真实场景后,机器人要面对的也不再是预先设定好的Demo脚本,而是各种不可预知的“意外”:网络不稳定,机器人可能遇到没见过的情况;每天产生的数据需要回传、处理和训练;当机器人无法自主完成任务时,需要人工远程接管。

在此次走访中,雷峰网也与腾讯云多位专家进行了交流。谈及机器人落地和商业化难题时,一位云专家表示,和自动驾驶大模型类似,具身智能的落地同样存在明显的“长尾效应”:前60%、70%、80%的进展可能很快,但最后20%却需要花非常多的时间填补

要填补最后的20%,一整套系统工程不可或缺。跨越鸿沟之前,行业首先要解决的,恰恰是这些看似琐碎、却决定机器人能否真正落地的“最后20%”。

而云厂商的新机会,正在这里。

01、让机器人“上云”

今天的机器人,离完全自主还很遥远。当机器人超出自主能力边界时,就需要人工接管。问题在于,如果人和机器人不在同一个地方,怎么实现远程控制

艾欧智能的遥操作业务,就是从这里切入的。

联合创始人丁哲章回忆,艾欧最初做的是本地操作,操作员就在机器人身边。这种模式并不需要通过网络进行远程传输,甚至不需要太多算力,用端侧方案就能解决。但当业务扩展到远程场景后,新的技术需求随之出现:

控制流、图像流需要稳定、安全地传输,同时还要在弱网条件下提供基础保障;数据的处理和传递,也需要云端算力来辅助加速。

因此,遥操作看起来只是人在远端控制机器人,背后却需要一套完整的中间传输技术栈。

“我们当时确实需要一个稳定、好用、并且能够深入配合的中间技术栈,来确保远程遥操作这件事能够稳定地跑下去。”丁哲章说。

腾讯云的TRRO(Tencent Cloud Remote Real-Time Operation,腾讯云远程实时操控)方案接住了这部分需求。此后,双方又在入口、平台功能和遥操作方案上做了多轮打磨,进一步降低传输延迟、优化控制效果。

具身智能落地时,艾欧需要面对不同场景和机器人本体的适配问题,而处理这些差异,需要云厂商相关团队参与。

腾讯云异构计算产品副总监黄阳、存储高级产品经理李沐霖告诉雷峰网,具身智能系统本身就体现出明显的“异构”特征:不是所有能力都需要放在机器人本体上,而是可以根据任务特点,在云、边、端之间进行合理分工。

任务理解、场景理解等“慢反应”任务交给云端处理,使用高性能GPU进行训练和复杂推理;而运动控制、实时响应等“快反应”任务则放在本体边端,用NPU或CPU部署相应的小模型,成本更低、延迟更短,满足小模型推理需求。

这种云、边、端的合理分工,本身也是降低机器人部署成本、提升场景适配能力的一种方式。云在这里解决的,不只是算力问题,还有如何让不同能力在合适的位置运行,并实现高效协同。

02、数据是块“硬骨头”

机器人连上云之后,需要面对另一个问题:数据怎么处理?

灵初智能是较早遇到这一问题的公司之一。联合创始人陈源培提到,灵初刚成立时,数据量并不大,直接在本地存储,采集后自己使用即可。但随着数采规模扩大,一个数采厂每天可能产生百GB级数据,数据存储、传输和处理等基础设施需求迅速增加。

“对于创业公司来说,自己handle(处理)性价比很低,上云、跟云厂商合作是更合适的选择。”

腾讯云存储解决方案专家架构师杨冠军把双方的合作概括为数据平台、训练平台和音视频流三个层面:数据从数采厂和客户现场回流后,需要经过治理、存储、加工,再导出训练,同时还涉及远程运维和跨网络的音视频传输。

具身数据本身,也比传统图片、视频更为复杂。以灵初为例,每个Episode(一次完整的任务尝试,从开始到结束的完整轨迹)都包含Task、Action等结构,同时记录视频、关节数据、控制命令和标注等信息。

当灵初想针对某个场景做模型加强或特色训练时,问题就变成了:数据在哪?如何从海量数据中快速找到对应的数据?又如何将其导出并用于训练?

这些问题并非灵初独有,灵生科技也面临类似挑战。

合伙人、世界模型训练负责人蒋玉骅提到,灵生正在做VLA和WAM两种范式的转换和迁移,面临的一大难题便是数据存储问题。从图片到视频,数据规模越来越大,甚至还会出现存储碎片化、数据难以检索等问题。

另外,为了最大限度发挥数据的价值,灵生还希望实现“数据训练模型、模型又反过来帮助处理数据”的双向驱动,这也对云提出了新的要求。

灵生训练数据的来源非常多元,既包括EGO( Egocentric Data,第一人称视角数据 )、WOMI( World-Oriented Manipulation Interface )等数据,也包括跨本体数据,涵盖机械臂、灵巧手等不同本体形态。更复杂的是,数据采集、下载和模型训练常常同步进行,这也就意味着一边不断有新数据汇入,另一边训练任务又在持续读取。

蒋玉骅提到,这就要求数据能流式加载,既要保证数据完整性,也要过滤掉低质量或未经预处理的数据。这些能力的实现,高度依赖高效的检索机制,以及存储层与Memory层之间的协同。

“腾讯云对灵生最大的帮助就是在世界模型的预训练阶段。”蒋玉骅补充,预训练阶段对数据规模和质量的要求极高,这正是云能够发挥价值的地方。

03、当Agent开始“调度”机器人

当Agent运行在机器人身上,云又需要解决什么问题?

元点机器人和腾讯云的合作,是一个观察切口。

联席CTO李元庆介绍,元点机器人对未来家庭场景中的机器人产品形态,有一个颇有意思的划分:Pet、Partner和Assistant,即提供情绪价值的“宠物”、兼具情绪和功能的“伙伴”,以及功能属性更强的“助手”。

这些功能和场景,都可以通过Agent进行调度。当Agent进入机器人系统后,机器人便具备了理解用户需求、生成Skill并自主调度任务的能力——这正是元点机器人上半年接入腾讯云ClawPro后探索的重点方向之一。

李元庆和腾讯云计算专家产品架构师萧一修举了一个例子:

如果用户说一句“以后看到哪只股票上涨,就让机器人来到我的位置,然后跳一段舞。”在传统机器人体系里,这可能需要开发一个新的功能;但在Agent体系里,它可以被转化成一个Skill,由Agent完成调度,再交给机器人执行。

这也就意味着,机器人不再只是执行预设动作,而是开始执行由用户定义的任务。

但要让Agent真正长期运行起来,仅有任务调度能力仍不够,还需要一套更底层的运行时基础设施。ClawPro支撑的是多种智能体的统一部署、管理与运维,而腾讯云Agent Infra则向下延伸,解决Agent Runtime的问题。

腾讯云存储总经理陈峥介绍,Agent Runtime背后主要由四层能力支撑:Agent沙箱提供运行环境,Agent Bucket提供独立数据空间供Agent存取个人数据,Agent Memory负责沉淀长期记忆,Agent安全体系则承担权限管控与鉴权。

简言之,Agent Runtime可以为机器人提供可长期运行、具备记忆,并能够安全调用数据和资源的底层能力。未来实现家庭场景中Pet、Partner、Assistant等机器人产品形态,正有赖于这套能力。

04、结语

随着机器人进入的场景越来越多,对数据、算力、连接以及Agent等能力的需求也随之增加,云所承载的能力也从传统的算力和存储,逐渐延伸至更多环节。

在此次走访中,谈到具身智能时,李元庆曾借用一个形象的比喻:机器人落地像一个拳头,数据、算力、模型、场景和机器人本体,是五根手指。五根手指握在一起,才是一个完整的拳头;任何一根缺失,拳头都握不实。

可见,具身智能的落地及产业化本质上是一个系统工程。随着这套系统走向成熟,云正在成为其中愈发重要的基础设施层。

相关推荐

雷峰网,读懂智能&未来。