• 正文
  • 相关推荐
申请入驻 产业图谱

2026具身智能数据产业深度报告:机器人缺的不是本体,是高质量物理交互数据

8小时前
300
加入交流群
扫码加入
获取工程师必备礼包
参与热点资讯讨论

原标题:机器人不缺身体,缺的是数据

2026 年,具身智能行业的共识悄悄换了一次挡。

过去几年,大家比的是本体——多少个自由度、能不能后空翻、今年量产多少台。而今年,几乎所有头部玩家的注意力都转向了同一个词:数据。

易观分析 9 月发布的《中国具身智能数据产业分析报告 2026》给出了一个判断:硬件门槛正在被快速跨越——本体量产、成本下降、运动控制逐步成熟,产业已经初步解决了「机器人能不能动」的问题。真正决定产业天花板的,不再是硬件能力,而是「数据能不能喂饱模型」。

说得更直白一点:机器人不缺身体,缺的是饭。而这顿饭目前还很贵、很不标准、也远远不够。这份报告把「贵」「不标准」「不够」拆成了可量化的三层,也给出了解法与机会。下面按十个板块讲透。

一、先看清坐标:2026 年,进入「市场验证期」

报告把中国具身智能产业划成五个阶段:科研探索期(~2010)、产业起步期(2010-2021)、技术融合与场景示范期(2022-2025)、市场验证期(2026-2030)、产业成熟期(2030-2035)。

2026 年正是分水岭。它是「十五五」规划第一年,具身智能被列为未来产业重点培育方向;年初,民政部、工信部等 8 部委部署机器人在家庭、社区、养老机构等场景的规模化应用;同样是年初,多家机器人企业宣布万台以上量产计划。工信部的目标是到 2027 年,产业加速实现规模化发展、产品深度融入实体经济。

往远看,多个国家政策规划把 2030 年视为未来产业进入成熟期的分水岭,规划至 2035 年实现具身智能全面普及。多位院士、专家在世界机器人大会及核心期刊上反复指出:2030 年是解决「泛化能力」和「低成本制造」两大瓶颈的关键年份,2030-2035 年将是技术红利释放期。

那么中国手里有什么牌?报告总结出三张:制造能力(模块化生产体系,能「边设计、边制造、边优化」,单机成本持续下降)、产业链协同(执行器、减速器、丝杠、电机、传感器、控制系统形成国产化闭环,且与新能源汽车产业链高度重合,可技术复用)、市场驱动(场景反哺技术,订单直接拉动迭代)。

报告里点了两个例子:宁德时代投入运行全球首条人形具身智能机器人规模化的新能源动力电池 PACK 生产线;智元机器人 2025 年全年出货量突破 5000 台,轮式人形、四足、人形三大产品线均超过 1000 台。

二、具身数据到底是什么?三个特征区别于所有「旧数据」

报告给的定义很干脆:具身数据的本质是「物理世界交互的多模态记录」。它有且必须有三条属性:

① 物理交互性
必须包含力、触觉、形变、摩擦等真实物理属性——互联网上已有的数据不通用。

② 多模态强耦合
视觉、本体姿态、触觉力觉、音频、语言指令,必须在同一条时间轴上精确对齐。

③ 时序连续性
以「状态-动作」序列构成轨迹,是行为克隆与模仿学习的核心载体。

正因为必须绑定真实物理属性,具身数据从过去训练里的「副产品」,变成了整个产业的核心燃料。报告判断:产业正经历从「硬件能力驱动」向「数据规模与闭环驱动」的转型。

三、诊断:量、质、异构——三重结构性制约

报告的判断是:数据瓶颈已经从「总量不足」,演化成量、质、异构三个维度的结构性制约,而且三者互为因果、彼此强化。

量:总量断档,完成度不到 5%

国际先进技术应用推进中心指出:要实现具身智能能力的「涌现」,至少需要百万小时级来自真实世界的物理互动数据——而目前行业积累的数量还不到需求的 5%。

根因是「高质量、大规模、低成本」的不可能三角还没破:真机数据质量高,但单小时成本 500-1000 元;无本体数据便宜,但需重定向、缺力觉;仿真数据无限,但有 Sim2Real 偏差;互联网视频规模大,但无动作标签。报告的原话很扎心——不是不想采,而是采不起、采不动、采了也不对。

质:77 个百分点的 Sim2Real 鸿沟

斯坦福 HAI《AI Index Report 2026》给了一个刺眼的对比:机器人操控在仿真中成功率达 89.4%,在真实家庭场景中骤降至 12%——相差 77 个百分点。

更麻烦的是「过度干净」:行业数据集系统性丢弃失败样本与长尾场景,模型泛化靠运气;数据质量缺乏评估标准、标注粒度不统一,不可审计、不可回归,最终「脏数据进、脏模型出」。

异构:跨本体不通,换一台机器人等于重来一遍

这是最容易被忽视、也最要命的一条,报告拆成三层:

本体异构——各家关节数、坐标系、控制频率不同,一家本体采集的数据无法直接用于训练另一家本体的模型,换本体等于重采、重标、重训。

格式孤岛——JSON、Parquet、ROS bag 等格式并存,跨平台不可拼接、不可审计。

数据孤岛——全国各训练场数据尚未连接,核心高价值数据因护城河与合规顾虑难以流通。

后果就是:数据无法跨本体、跨平台流动,无法形成公共数据底座。

四、破局方法论:造、治、用、通

报告给出的解法是个四字系统工程,正好一一对应上面的三重制约:

造数据 · 解决「量」的供给
本体厂商依托量产机器人,在真实场景中持续采集,以真机数据锚定质量基线;仿真厂商构建高保真物理引擎与场景资产库,以合成数据覆盖长尾与极端场景。两条路线互补——真机数据保真、仿真数据扩边界。

做对数据 · 解决「质」的保障
建立统一的标注规范(任务级/片段级/关键帧级/接触级)与质量认证标准,明确「什么是合格数据」;通过自动化评测工具量化评估数据可训练性。

转飞轮 · 解决「数据—模型—本体—场景」的循环
训练场是数据与模型的「中转站」:采集 → 训练 → 部署 → 回流,形成闭环飞轮。它提供的不只是规模化采集能力,更是数据资产持续增值的核心枢纽。

通数据 · 解决「异构」的壁垒
建立跨本体、跨平台的数据格式标准与接口规范;通过数据交易平台与合规机制促进流通;推动公共数据底座建设,让数据从「企业资产」变成「行业基础设施」。

报告的原话总结得很好:唯有四管齐下,才能终结「采得少、训不好、用不了」的低水平循环,推动具身数据从碎片化的「企业私产」跃升为标准化的「行业基础设施」。

五、产业地图:谁在给机器人「做饭」

报告画了 2026 年具身智能数据价值链的完整图谱。从上到下:行业客户(需求侧)→ 开发平台/整机制造/系统集成 → 具身模型/全链路数据平台/训练场/数据治理标注 → 真机遥操作/便携无本体采集/仿真与数据合成/数据交易流通平台 → 多模态传感补维(采集硬件、传感器)/算力与云服务商。

一句话概括这张图:这不是一条链,而是一张网——中间任何一个环节断掉,数据都流不到模型里。

六、六类生意,成熟度差了一整个身位

报告归纳出六类商业模式并存,并按成熟度排了序。这张表信息量很大,值得逐行看:

① 仿真 SaaS 订阅——最成熟。按「平台授权年费 + 按调用量/Token/测试里程」计费,边际成本极低(合成数据,规模效应强)。报告称其为「物理 AI 操作系统之争」,典型企业:群核、光轮、无问。

② 定制化数采项目——成熟,当前主流。按小时/条/场景定向计费,高客单,交付周期 1-8 周;边际成本高(依赖人力与本体,收入难复制)。典型企业:智元/觅蜂、宇树。

③ 数采硬件销售/租赁——成长。设备售价/租金 + 数据回购/授权费;壁垒在硬件专利与动捕精度。典型企业:鹿明、帕西尼。

④ 定制化服务项目(治理/标注)——成熟,是传统标注的延伸。按标注工时/条数/复杂度计费,人力密集型。典型企业:海天瑞声、景联文。

⑤ 数据集产品销售/数据要素交易——成长到极早期。数据集按套/时长(可复售),交易收佣金 + 授权费/入股。典型企业:百度、库帕思、北数所。

⑥ 全链路服务与训练场运营——起步。场地租用 + 设备共享 + 一体化服务采购;重资产折旧,回报周期长。典型企业:国资创新中心、云厂商。

一个规律:越靠近「数据源头」越重,越靠近「工具与平台」越轻;而当下赚钱能力最强的,恰好是最轻的那个——仿真 SaaS。

七、数据从哪来:三条线,成本差两个数量级

数据采集是具身数据价值链的「物理入口」——机器人从真实物理世界获取可学习信号的第一环。2026 年,产业正从「单点真机遥操作」,走向「真机基准 + 无本体规模 + 仿真增广」三维融合。(报告说明:互联网视频蒸馏仅用于预训练阶段,不构成物理采集,故不列入对比。)

真机遥操作——模型后训练(SFT)与最终落地的「金标准」。数据质量最高,具备真实的物理交互、摩擦力、碰撞动态,无需复杂的跨本体映射;但成本最高(500-1000 元/小时级),受限于本体数量、场地与人力,边际成本难降,规模扩展性弱。

便携/无本体采集——人穿戴设备(手套、外骨骼、动捕)直接记录动作,成本降至真机的 1/3 左右;结合众包模式,走向「伴随化采集」(普通员工边工作边采)。成本约 200-400 元/小时,设备国产化叠加众包网络,产能易进入百万小时级。

仿真与数据合成——物理引擎(刚/柔/流体)+ 域随机化 + 合成数据生成,遵循「99% 合成 + 1% 真机校准」的 Sim2Real 逻辑。前期物理引擎研发与场景资产构建投入高,但一旦引擎搭建完成,边际成本趋零,数据产量近乎无限。

三条线不是竞争关系,而是围绕「数据质量—规模—成本」三角形成协同:无本体铺量、真机抽检;仿真预训练、真机后训练;无本体供真实场景、仿真供映射增强。

报告特别引用了一个值得记住的判断——觅蜂科技创始人/CEO 姚卯青说:

「仿真需要购买数字资产、建模、调用 GPU 渲染,而随着无本体设备规模化运营,单小时真实数据的成本已经低于仿真。」

翻译一下:在部分场景下,「真实数据比仿真便宜」已经成立。当无本体设备国产化 + 众包网络成熟,真实数据成本会继续下探——这直接意味着,未来三线的配比是变量,但协同是常态。

八、训练场:70+ 座已启用,长三角吃掉三分之一

训练场是「转飞轮」的物理载体,目前处于起步阶段。这组数字是全文最好记的:

70+ 座训练场已建成启用,另有 40+ 座在建或规划中;覆盖 23+ 个省份;已部署机器人 2,500+ 台;总面积 28 万㎡;13+ 个部署 100+ 机器人的中心。

区域分布:长三角 36 座、其他地区 24 座、珠三角 12 座、中部 12 座、京津冀 10 座、成渝 6 座。

省级分布:浙江 12、江苏 11、广东 10、北京 8、上海 8、四川 5、安徽 5。长三角一区域就占了 36 座,接近总量的三分之一。

训练场的价值在哪?报告列了四条:降低行业试错门槛(中小企业不必自购设备场地)、闭环数据飞轮(数据资产持续增值,形成复利)、政策新基建(作为具身智能「算力 + 数据」基础设施)、规模效应(集中化采集与训练显著提效,京东等通过社区化采集快速放量)。趋势上,头部正从单点服务走向生态平台,并叠加「训练场 + 服务商」双重属性。

九、五家样本公司,四种打法

报告用五家企业做了切片。看下来,它们刚好代表了四种截然不同的路径。

觅蜂科技:智元的「数据分身」,三层通吃

2026 年 2 月由智元机器人内部孵化拆分成立,是智元「一分为四」战略中的数据业务主体(灵巧手→临界点、数据→觅蜂、租赁→擎天租、四足→智元酷拓)。创始人姚卯青的判断是「模型无强壁垒,数据才是壁垒」。成立半年内完成三轮数亿元融资,红杉中国、国方创投、中国电信先后领投。

硬指标:MEgo 设备累计下线 2 万台,累计产出超 100 万小时数据,覆盖 22 大类场景、1 万余个真实环境。三层数据金字塔——L1 互联网数据(提供语义底座)、L2 无本体采集(成本约真机 1/3)、L3 真机数据(支撑部署态飞轮)。目标是 2026 年千万小时级产能,2030 年百亿小时。报告的提醒也很直接:千万小时产能需要 9 倍放量,执行风险高。

光轮智能:全球首个具身数据独角兽,卖的是「标准」

2023 年 1 月成立,创始人谢晨博士(前英伟达/Cruise/蔚来仿真负责人),聚焦「仿真合成 + 人类第一视角(Ego)」双主阵地。2026 年 3 月完成 10 亿元A++/A+++ 轮,成为全球首个具身数据独角兽;5 月蚂蚁集团领投,估值突破 20 亿美元(约 150 亿元),两个月翻倍;6 月再获 10 亿元战略融资。

硬指标:EgoSuite-Open100k 开源 10 万小时;全球 7 国 500+ 环境、1 万+ 任务、周产 2 万+ 小时、累计交付 30 万+ 小时;部分数据集已向十余家客户复售,复售倍数超 10 倍;2026 Q1 新增订单 5.5 亿元,单季收入超 2025 全年;仿真路线边际成本约为真机的 1%。它还是 Newton 仿真技术指导委员会唯一中国企业,主导或参编 20 项国家及行业标准。

报告点出的挑战也很犀利:真机数据非主阵地,L3 高精度后训练环节可能被卡位;既卖数据又办评测,「运动员兼裁判」的中立性存疑。

无问智科:把效果跑成数字

2022 年成立,刘盛翔(前百度 Apollo 测试负责人)携百度/清华团队创立,带着智驾「测试验证」基因。打法是「世界模型 × 数据工厂 × 世界模拟器」,推「无垠」基座与「无穹」模拟器。2024 年营收数千万元;2026 年 4 月/7 月/9 月连融三轮。

最打动人的是量化验证:在线强化学习使仿真成功率从 9.7% 提升到 79.8%;迁移到真实机器人后任务成功率 +50%,篮子收纳 +20%。客户复购率超 80%,订单同比增长超 3000%。德清训练场室内 3000㎡、室外 505 亩、开放场景 937 km²,日产数据上千小时;SimReady 资产构建从 3 天压缩到 5 分钟(300 倍)。它的短板同样明确:没有自有本体/硬件生态,数据规模相对较弱。

群核科技:资产最大,收入最小

2011 年成立,酷家乐起家,2026 年 4 月成为「杭州六小龙第一股」。手握 5 亿+ 结构化 3D 场景、4.8 亿带物理参数 3D 模型、1800 万套设计方案——这些存量资产的获取成本已在过去十余年摊销完毕,边际成本极低。

但反差极大:SpatialVerse 2024 年客户 8 家、收入 340 万元;2025 年客户 16-18 家、收入 520 万元,占全年总营收不足 1%;2026 上半年订单金额 680 万元。公司约 97% 收入仍来自酷家乐订阅。报告的评价一针见血:故事与收入落差大;家居场景强但工业/物流弱,恰是付费主战场错位。

鹿明机器人:把「人采」做到极致

2024 年成立,创始人喻超(前追觅/CyberDog),研发占 70%+,绝对重注 UMI 无本体采集。硬指标很漂亮:单条采集从 50 秒压到 10 秒(5 倍效率);成本降至传统遥操作的 1/5,计入本体成本则为 1/100-1/200;8 道工业级质量评估把数据有效率从行业普遍的 70% 提到 95%+;与本体解耦,适配市面 90%+ 机械臂。Lumos 数据商城已上架 92 个任务 SKU、10 万+ 条轨迹,37+ 家机构采购。2026 年 5 月 A1+A2 共 4.93 亿元由三菱电机连续领投。

压力同样直白:1 万小时积累 vs 2026 年 100 万小时目标,差 100 倍;成立不足两年铺开四条业务线,战线过宽。

十、趋势:三重结构性变迁,六条主线

技术侧,报告画了三条主线:数据采集从单一走向融合(三线融合)、数据闭环从线性走向虚实共生(Real2Sim2Real)、基础设施从软件工具走向软硬一体(仿真 × 算力)。模型训练范式也在变——从「海量外购数据依赖」转向「少样本学习 + 强化学习自进化」,模型可通过自身部署反馈持续进化。

产业侧,报告归纳了六条趋势,分「能力层」与「产业层」两组:

① 硬件入口化——采集硬件成为数据主权前哨,「卖设备即买数据」模式初步成型。但硬件本身可被追平,真正的入口壁垒在于软件粘性:数据格式绑定、云端平台依赖、评测基准锁定。

② 标准化标品化——数据从「原材料」变为「即用型能力」,竞争单位从「小时数」转向「有效信息密度」,高复售标品成为可持续商业模式。

③ 任务难度定价——从成本定价走向价值定价。高难任务(长时序、强泛化、复杂操作)溢价凸显,低难任务价格趋零。

④ 买方自建与中立性分化——头部本体厂商与基座模型公司正把数据生产内化,自建采集体系、数据管线与评测标准,以掌控接口权力;中立第三方的生存空间,取决于头部玩家的自建边界。

⑤ 产能军备与结构性过剩——原始数据贬值与高难数据稀缺并存。生产权向有本体/场景的下游迁移,外购需求收缩;少样本/自进化范式进一步压缩外购空间,加速存量数据资产折旧。

⑥ 数据要素化 + 平台整合——实景数据从「商品」走向「要素」,确权、定价、入表、流通制度逐步完善,超百亿平台型企业涌现,行业从分散供给走向平台集中。

报告把这一切概括为「三重结构性变迁」:能力层竞争维度从「数据规模」转向「数据价值」;产业层权力格局从「分散供给」走向「分化重构」;终局资产形态从「数据商品」迈向「数据要素」。最后落在这一句上——数据竞争的本质,从卖数据转向定义数据价值的标准。

十一、八个机会:谁能在这一轮吃到红利

报告最后给出八块机会,并按「进攻性(抢标准)/平台性(建基础设施)/整合性(绑场景)/要素性(吃制度红利)」四类归位:

① 第三方评测认证(进攻性)——当前「有能力 ≠ 有产品」的空白真实存在:既有评测机构既卖数据又办考场,中立性代价明显;部分厂商的评测体系停在内控,未产品化。谁能做出「不卖数据、只办评测」的独立第三方,谁就能直接吃掉既有玩家的中立性溢价。

② 垂类场景联合工厂(整合性)——报告有句话值得抄下来:「资产绝对量没有意义,场景匹配度才是兑现开关。」场景方有数据但不懂 AI,数据商懂 AI 但进不去场景;设计出「数据归属清晰、收益分配明确」的合作框架,是关键。

③ 多源数据采集服务(平台性)——真机遥操、无本体穿戴、场景众包、工业一线操作。数据缺口高、真实物理交互数据最稀缺,先有采集网络就有议价权。

④ 仿真与合成数据基础设施(平台性)——「引擎保真 × 生成式扩量」是规模供给唯一可放大路径,核心是物理正确性 + 任务分布覆盖 + 与真机闭环对齐。

⑤ 数据工程与「炼油厂」能力(平台性)——行业从「有数据」转向「有效信息密度」。跨本体动作映射、多模态对齐、失败样本库、自动质检是最大痛点。

⑥ 闭环训练场/公共实训底座(平台性)——中小企业不愿重资产自建,公共训练场把固定成本变可变成本,是区域新基建。政府 + 本体厂商 + 数据商共建,提供「采集—训练—验证—回流」全链路。

⑦ 中立平台与工具链(平台性)——头部买方自建挤压纯外包,但中小模型厂商和长尾本体仍需中立层:数据超市、跨本体训练平台、评测社区、开源物理引擎。

⑧ 数据要素流通与资产化(要素性)——数据从「商品」走向「要素」,数据产权登记、质量评价、资产入表、场内交易。抓手是:高价值垂直场景数据集、一登双证、合规流通。

结语:真正的壁垒,正在从硬件搬到数据

把这份报告读下来,最有价值的其实不是那些数字,而是它把行业的注意力,从「硬件叙事」拽回了「数据叙事」。

机器人能不能动,已经不是问题了。问题是:它能不能在千差万别的真实场景里,稳定地做对事。

而这个问题的答案,藏在百万小时的物理交互数据里,藏在「造、治、用、通」四个字里,也藏在那 70 多座已经开门营业的训练场里。

至于谁能笑到最后——报告已经给出了暗示:不是采得最多的人,而是定义「什么叫好数据」的那个人。

 

本文数据与观点均引自:易观分析《中国具身智能数据产业分析报告 2026》(2026 年 9 月,共 29 页),并参考斯坦福 HAI《AI Index Report 2026》、国际先进技术应用推进中心相关表述。

相关推荐