• 正文
  • 相关推荐
申请入驻 产业图谱

中国人形机器人训练场:哪里有场?谁在运营?数据怎么流动?

09/11 13:16
697
加入交流群
扫码加入
获取工程师必备礼包
参与热点资讯讨论

一个采集员戴着VR头盔,以半速慢动作重复同一个抓取动作,第1000次、第10000次……

他的时薪是30元。

他采集的数据,在市场上却能卖到500—1000元/小时。

这中间的价差主要来源于数据成本与市场数据需求。据行业共识估算,实现通用自主能力的具身大模型,至少需要千万小时级的高质量真实交互样本;而截至2026年初,全球合规可用的真机及无本体有效数据仅约50万小时,缺口约95%。供不应求,机器人便难以适应千变万化的真实场景,真机数据价格随之水涨船高。

高价只是表象,这门生意暗藏一整条产业链:采集场设在哪里、分布如何、谁在运营、数据怎么流动?本文带你逐一拆解

人形机器人数据采集训练中心名单

信息来源:MIR DATABANK整理,截至2026年8月,含企业数据工厂、测试中试平台等五类实体载体

01、广东、江苏、浙江、北京数量最多,前十省市占比全国90%

2025-2026年,全国各省抢先建场,截至2026年8月底全国已建超100家人形机器人数据采集训练场,覆盖18个省区市。但是训练场建得多,不代表数据够用,就如首钢园数采中心一期停运换轨事件也说明:这场数据市场的竞争,正从抢地皮转向抢高质量有市场需求的数据产能。

*首钢园数采中心一期停运换轨事件:2026年8月底披露,因原运营方睿尔曼智能判定集中式"实验室场景"数据采集1.0模式无法满足具身智能"真干活"的真实场景需求,遂撤出并转战常州真实场景数采平台,石景山一期因此停工并顺势升级改造为4D高斯光场与世界模型技术路线(新一代三维场景重建与数据生成技术),以与二、三期形成全链条协同闭环。

中国重点省份训练场数量

数据来源:MIR DATABANK整理,数量统计截至2026年8月,本数据含已建成、在建及规划中,规划中为签约确定但是没有开始建设的。

排在前面的 10 个省市依次是广东、江苏、浙江、北京、四川、上海、天津、重庆、山东和安徽,合计约占全国训练场和数据采集节点的九成。这 10 个省的做法并不一样,有的靠产业带动,有的靠规则与市场机制,有的靠政策培育。

重点省份已建成训练场数量及总结

数据来源:MIR DATABANK整理,数量统计截至2026年8月

为什么训练场集中在这些地方?能否形成集群,取决于四个因素——真实场景密度、链主企业、政策组织力、成本与载体。四个条件凑不齐的省份,大多只能形成零星的单点项目:

真实场景密度:可授权的制造/物流/商服场景是训练场的生产资料。

政策组织力:名单制、资金、标准把分散场景组织成体系。

链主与数据工程能力:本体厂商+数据服务商落地,才能把场景变成数据产能。

成本与载体:场地人力成本+算力+交易确权入口决定可持续性。

我们还发现一个趋势,训练场正在从"城市级基地"向"场景级基础设施"下沉,不少县域也有了自己的训练场。县域能接到这活,原因在于:工厂、农田、商超这些真实场景就在县里,采集和标注的人力成本更低,地方政府愿意给场地、给政策,龙头企业也愿意把数采工厂开过去换订单。

重点县域训练场可复制性分析表

数据来源:MIR DATABANK整理

但县域下沉有严格门槛,需要同时满足六个条件:一是当地有真实、可授权、可落地的细分场景,如工厂、物流、特种作业;二是有链主企业或专业机构落地运营,如乐聚、智元、国地中心;三是能进入省级以上政策名单或获得资金支持,如奖补、专项资金;四是场地与人力成本明显低于核心城市;五是数据可接入算力、数据交易与确权体系;六是有明确的数据需求方。这六项环环相扣,缺一不可。

02、发展最快的是两类企业自建类数据采集场

数据采集的六类玩家

数据来源:MIR DATABANK整理

六类采集商中发展最快的是具身数据服务商和本体厂商。服务商跑得最快,根本在于其商业模式,一是布点门槛低,鹿明UMI采取无本体采集,不依赖机器人整机,手持夹爪+位姿算法即可标准化量产数据,单点投入小,故能五基地并行复制;二是盈利模式闭环,自研采集设备+自建数采工厂+数据平台对外售卖一体推进,把数据做成标准品反复变现(鹿明上线全球首个具身智能数据交易平台"数据超市",帕西尼开放百亿级全模态"数据云商城",一次投入、多次产出,现金流支撑持续扩产;三是布局市场稀缺部分,帕西尼以自研触觉传感器独占采集成本最高、最稀缺的触觉数据,先发数据资产本身即构成壁垒;四是地方政策加持,浙江、江苏、广东等训练场建设领先省份将具身数据列为重点产业,以场地与政策摊薄建厂成本、加速落地。

本体厂商自建工厂加速扩张的根本动因,在于top企业对数据的掌控需求。具身智能已进入拼数据、拼落地的阶段,规模化应用对高质量数据的需求随之激增,数据因此成为决定商业化的关键生产资料。自建工厂的本质,是把外部采购成本转化为内部战略资产——作为先发者,头部企业积累的数据本身即构成后来者的进入壁垒,这也是本体企业纷纷布局数据场的原因。

03、数据交易链,从授权到采集经过加工测评,最后成为可交付的商品

一条数据从诞生到卖出,要经过以下六个环节。

从立项到数据交付的六个环节

数据来源:MIR DATABANK整理

在这些环节中,最难的是最前头的"场景授权"。数据决定模型能力,而采数据必须先有真实场景。对本体厂商和模型公司而言,自建工厂是重资产投入,租赁场景要一家家与场景方谈授权;工厂、医院、园区等真实生产场景开放度普遍很低,申请、审批流程漫长。拿不到场景,后面五个环节便无从谈起。

那么,谁在花钱买这些数据?买家主要是两类。

一类是本体厂商和模型公司。数据决定模型能力的上限,但自家数采工厂能覆盖的场景有限,模型要学的技能成千上万种,自己采不过来,便向市场外购补充。这类企业间的市场化交易目前刚起步,成交金额尚未公开披露。

另一类是政府,也是眼下的大头。各地政府把训练场当作产业基础设施来建:出资建场、开放场景、采购数据采集服务;采得的数据留在训练场,再开放给本地机器人企业训练使用。中小企业建不起数采工厂,政府建场正是帮它们降低用数门槛,顺带完成招商与产业培育。目前公开可查的大额采购几乎全部来自这一侧。

写在最后

全国训练场的数量已经不少了,但数量从来不是问题的答案。

具身大模型需要千万小时级的高质量真实数据,而目前全国多数训练场还停留在授牌和建设阶段,真正能稳定产出有效数据的场,数量很少。之所以产出跟不上,一个重要原因是数据还没有统一的标准。不同工厂按条数披露产能,一条数据几秒到几分钟不等,格式、质量分级、评估框架都尚在推动之中,数据难以标准化地定价和流通,合格产出也就难以稳定形成。

政策已经看到了这一点,国家数据局提出,到2028年底建成一批经过应用验证的行业高质量数据集,同时培育数据标注龙头企业、推动高质量数据集标准体系建设;工信部与国资委的实景实训专项行动,则要求建立风险预警机制、预留退出通道、实行清单化管理和常态化跟踪评估,并于2026年11月30日前完成成效总结。一边立标准,一边定考核,政策方向已经十分明确。

在这样的背景下,训练场竞争进入第二阶段,主题从抢基地转向抢场景、抢数据产能。评价一个训练场的标准,不再是面积和机器人数量,而是能否稳定产出有效数据、能否通过应用验证。达不到要求的节点,将被市场和政策同时清出牌桌。谁能把场景变成数据、把数据变成商品,谁才能通过市场的验证、赢得利润。

 

本文数据信息与观点参考MIR DATABANK发布的《2026年全国人形机器人数据采集训练场集群分布总分析》报告,以下为报告目录。

8月—9月初人形机器人数据库更新说明

头部厂商供应链关系图谱:核心零部件供应商关系一图尽览。

新增人形机器人相关原创报告。

 

相关推荐