• 正文
  • 相关推荐
申请入驻 产业图谱

具身智能数据困局解读:虚时科技IntimeVerse,仿真打通人形机器人落地最后一公里

21小时前
371
加入交流群
扫码加入
获取工程师必备礼包
参与热点资讯讨论

原标题:虚时科技何泳澔:仿真天生拥有"特权信息"

2026年上半年,具身智能赛道吸金超过460亿元,人形机器人厂商也使出浑身解数,每隔几周,就有一段新的机器人Demo在全网刷屏。

但热闹背后,整个行业撞上了一堵隐形的墙:真机采集的真实数据太贵、太慢,根本喂不饱胃口越来越大的具身模型。

在刚刚结束的"硬核启航——硬科技投融资发展论坛"上,虚时科技CTO何泳澔用一场题为《仿真赋能,打通具身智能落地的最后一公里》的演讲,给出了虚时科技的答案。

本文要点(30秒速览)

    仿真不是真机数据的廉价替代品,而是一种真机永远拿不到的数据形态——它天生拥有"特权信息"。六维度对比:本体保真、传感器配置、用途、生产成本、存储成本、范式风险,仿真对Ego数据全线占优。Sim2Real Gap的本质是参数偏差,不是规律错位:人在月球上不需要重新学走路。IntimeVerse打造了一条真闭环:Code2Space→Asset2Physics→ Space2Data→训练→评测→端侧部署→真机对齐→反馈上游。已经在干真活:快递供包、动力电池装配、工厂巡检、生活商超……项目进入订单交付阶段。

先看清牌桌:本体、模型、任务

何泳澔开场就给这场分享定了调:"这是一个关于具身数据的故事。"

在行业最关注的具身模型方面,他点了两个最热的词:VLA(视觉-语言-动作模型)和VLN(视觉-语言-导航模型),一个面向操作,一个面向导航,都源自学术界"用一个端到端模型策略解决复杂操作问题"的野心。

"但发展到今天,大家越来越发现:如果只依赖视觉观测数据,很多任务是做不了的。"

语言更多是意图的来源,不是操作的依据。而世界模型的思路,是让模型具备预测未来世界状态的能力,再把预测到的特征回灌到当前决策里。

何泳澔的判断是——这两条线目前基本正在合流。

至于任务,从技术视角看只有三大类:移动操作(Mobile Manipulation)、导航(Navigation)、纯操作(Manipulation)。

有一句话其实挺扎心的:你在WAIC、WRC上看到的大部分丝滑演示,只覆盖了其中三分之一。

数据金字塔:学界的那座,该推倒了

何泳澔放出一张来自综述的图——目前具身数据的来源,行业公认的是一座五层的金字塔,但虚时科技将这座金字塔压缩到了三层。

最底层、量最大的是互联网数据,成本极低但质量不够高,主要用来训练多模态基座模型。往上是仿真数据,量已仅次于通用数据。再往上是这两年特别火的Ego数据(第一人称视角数据):脱离机器人本体,让人戴上有多个相机的头环,把整个工作流程录下来。

再往上是UMI数据:头环照戴,但末端执行器换成跟真实机械臂同构的装置,采出来的数据跟真机之间没有构型gap。而Ego记录的是人手的灵巧操作,跟机械臂末端之间存在巨大的构型差异。

塔尖、价值最高的是遥操数据:通过同构遥操或VR遥操,直接控制机器人在真实场景里完成任务,把机器人自己的数据记下来。

各家对这座金字塔的理解不同,就演化出不同的数据方案。而何泳澔给出了一句很bold的判断:

"仿真发展到今天,它已经具备替代掉刚才那座金字塔里底下所有层的潜力了。"

虚时科技的数据金字塔只有三层:

第一层:海量仿真数据。不做限制,跨场景、跨本体、跨任务地自由采集。量最大,可以用来做预训练。

第二层:场景特化的仿真数据。为服务某个具体场景把数据"收窄",但仍可跨本体采集,用来做后训练。

第三层:少量真实数据。真要部署时,采一点真实数据做少量遥操数据,用于后训练,跟真实世界对齐。

拿Ego数据当对手,仿真赢在哪?

本体保真度。Ego数据必须做后处理:从视频里把手部姿态估计出来。这个算法再准也有偏差——从二维图像恢复三维信息,误差是物理上躲不掉的。然后还要把估出来的pose跟目标本体末端对齐,又叠一层误差。

仿真里这几乎不是问题:硬件厂商每出一款硬件都会配套提供本体描述文件,跟真实本体1:1,自由度、每个自由度的动力学参数都真实对齐。

传感器保真度。Ego基本只有视觉,缺力觉也缺触觉,而且相机内外参与真机对不齐。仿真则完全灵活:视觉、力觉、触觉,想加什么加什么。

数据用途。因为前两条拖累,Ego数据目前主要还是做预训练;仿真数据既能预训练,也能直接进后训练。

生产成本。业界生产1小时真机数据的成本大约200到400元人民币,仿真目前低于200元,而且随场景和资产积累,成本会快速下降。单场景生成成本从数百美元打到10美元以内,周期从周级压到分钟级。

存储成本。这一项"很可能被绝大多数人忽视"的成本,Ego采的是视频,一个简单任务轻轻松松几百个G;按行情,1PB存储一年的成本在60万到80万元,用的还不是最高速的存储。按未来100到1000PB的量级算,账单会高到离谱。

仿真的解法是用计算换存储:不提前存数据,而是在服务器上起很多仿真场景,直接在场景里采——花的是算力的钱,比存储便宜非常多。

范式风险。这是何泳澔搞模型很多年的"一个非常深刻的教训":模型方案在没收敛的时候,随时会变,一旦变了,很大概率对数据的要求产生根本性变化——观测频率从10Hz提到60Hz、分辨率拉高、动作表示换掉。

真实世界里提前采好的数据,碰上这种变化,价值很可能快速归零。

但仿真不会。条件变了,随时在仿真里调:视角、分辨率、帧率……全都可以调。

一个业界的实测参照是:在复杂操作任务中,用规模为真机数据5倍的仿真数据训练,能把机器人真实操作成功率提升40%,而获取成本只有真机数据的三分之一。

Sim2Real Gap:人上了月球,要重新学走路吗?

说了这么多仿真的好,有个问题绕不过去。

仿真出来的东西,永远跟真实世界有差异。这是百分之百会存在的问题,哪怕仿真做得再好也避免不了。

但何泳澔认为这个问题要换视角看,答案有两层。

第一层:我们在仿真里学的到底是什么?

答案是——框架。

他借用了CEO王德駪最爱的类比:地球和月球的重力不一样,但遵循同一套物理规律。

可以把地球类比真实环境、把月球类比仿真环境,"人在月球怎么走路"这件事上,走路的姿势是一样的。即便到了月球这样一个全新的环境,只需轻微调整对物理参数的适应,问题也就解决了。

模型要学的是物理世界运行的框架,而不是每个参数的精确值。

第二层:Gap本身可以用算法补。

模型在仿真里训完,拿到真实世界,可以用少量真机数据微调对齐,或者用RSI(递归自我进化)快速校准。

何泳澔的判断是:在数据量够大的前提下,未来1到2年内,行业会迎来仿真数据驱动的智能涌现拐点。

IntimeVerse:具身落地的闭环

方法论要落地,得靠系统。虚时科技的答案叫IntimeVerse,一条完整的链:

场景生成→资产生成→数据采集→模型训练→仿真评测→真机部署与对齐→问题反馈回上游修改。

拆开看四个模块。

Code2Space:让模型写"施工代码",而不是画效果图

输入端两种都行:有真实场景的图像视频,就尽可能还原进仿真;什么都没有,只给一段文字描述,也能生成一个逼真的仿真环境。

关键在于工作方式——不是直接重建环境,而是用基座模型写一段能生成这个环境的代码,再由仿真器执行代码把环境"盖"出来。

虚时科技在基座模型之上训了一个垂类模型专门干这事,多样性维度拉得很开:光照、物体布局、物体类型,全都能变。

特别是在桌面场景,单独做了一个方向,因为大量精细操作发生在桌面上。

我们这种做法,比传统美术手工做场景,在时间和成本上有巨大的优势。

今年5月,虚时科技已与地瓜机器人联合推出AnySceneGen,推进仿真场景与资产的规模化生成。

Asset2Physics:把"看起来像"变成"摸起来也对"

具身操作和自动驾驶最大的区别是:自动驾驶尽量别碰东西,具身操作恰恰相反——就是要去碰、去交互。一旦接触,物体的物理属性就必须准:体积、碰撞几何体、质量、质心、表面摩擦系数,每一项都会影响物理引擎里它的反应。

虚时的解法是一套可微的参数辨识:物体生成后,先用机械臂在它上面做推、压、翻等操作,观察状态变化是否符合预期;不符合就自动分析哪些参数要调,再返回去改,如此迭代直到与真实的差异足够小。

不是给3D贴标签,而是用交互把实物编译为可仿真物质。

目前单资产物理校准能做到分钟级,外观和物理准确性超过95%。

Space2Data:仿真最大的便宜,是它"知道一切"

环境有了、物理对了,最难的卡点来了:谁来在这个场景里干活、把数据采出来?

虚时科技有两条路径:自主任务发现(让AI自己在场景里发现可能有哪些关键任务,再组织执行、记录轨迹)和按SOP执行(制造业里任务往往是预定义好的,照着SOP走一遍同样能采)。

有人会问:既然能在仿真里自主采,那直接把机器人丢到现实环境里自己采不就行了?

差别在于——仿真拥有特权信息(Privileged Information)。

智能体永远知道场景里什么东西在什么地方,而且是坐标级的知道,真实场景里你做不到。

虚时正是利用这个信息gap获取高质量数据,再反过来训练能在真实世界自主作业的机器人。

这套系统目前在仿真中的任务执行成功率超过90%,单张RTX 4090显卡日产数据量超过5小时。成功和失败的轨迹都保留,失败样本还能定位覆盖不足的环境条件和动作环节,指导下一轮采集——数据越用越好。

Data2Edge:把大脑做大,不如把小脑做快

模型训完,先在仿真里评——真实世界做评测代价太高,如果仿真里就"非常拉垮",继续迭代;不错了再进真实环境。这也是目前业界在仿真里做得最多的一件事。

到了部署,何泳澔给了一个清醒的判断:

大脑这一侧,未来很有可能被基座模型吃掉。所以我们更关注端侧可部署的、实时的、偏小脑的模型。

快递分拣这类任务根本不需要语言,只是高频重复地执行,本质就是"具身小脑"的逻辑。

虚时科技自研的IntimeBrain通过模型结构创新,在100TOPS算力的端侧芯片上做到20Hz运行——主流方案在端侧要么跑不起来,要么只有1Hz,也就是每秒一个决策。后续他们要把频率提到100Hz,基本和机械臂本身的控制频率持平。

真活儿:已经跑起来的场景

面向客户,整个闭环被包装成两个大环节:Real2Sim(把客户的具体场景和机器人本体资产搬进仿真、还原出来)和Sim2Data(让机器人在场景里按预期动起来、把数据采出来)。采下来的数据包括多视角视觉(头部+双腕部)、本体自由度(各关节角度),以及力、触觉传感器数据——只要装了,全都记下来。

快递供包。今年具身赛道最火的场景,一堆头部巨头在里面做POC。对仿真的难点在于:各家供包的环境状态差异极大,包裹也很复杂——纸盒偏刚体、包裹偏柔体、还有异形件,质量与摩擦特性差异显著,包裹还在传送带上持续运动、互相碰撞扰动。围绕这个场景,虚时科技已做出业界首个100%基于仿真的快递分拣全流程训练方案。

动力电池装配。客户沟通过后被认为"未来很有潜力"的高价值垂类。这里操作的东西偏刚体,物理属性相对简单,唯独难在一点:螺丝在孔里的拧入和拆出,这个接触过程能不能仿得准。目前虚时科技正按某新能源电池装配企业的产线需求提供仿真训练数据及相关服务。

工厂巡检导航。给机械狗一条带语义的指令,它在工厂里自主导航,到点位后拍照或做传感器检测。这类任务把移动操作、导航、操作三类任务都覆盖了。

同时,虚时科技也针对北京某头部具身智能厂商的特定机器人构型与操作任务推进仿真训练数据服务,并且进入到大型商业超市场景。相关项目已进入订单交付阶段。

写在最后:最后一公里,到底有多长

这场演讲真正想卖的,其实不是"更便宜的数据",而是时间。

何泳澔反复强调模型范式尚未收敛、数据要求随时可能被推翻。这句话翻译过来是:真机采集买的是"过去的需求",仿真买的是"未来的可能性"。

在一个范式每月都在变的赛道里,能重来一次的能力,比一次做对更值钱。

更值得注意的是他对"特权信息"的点破。很多人的注意力都在画面逼不逼真上,但真值(Ground Truth)才是分水岭——真实世界采数据要付出标注、姿态估计、对齐三重代价,仿真天生免费拥有。这不是"更便宜的真机数据",这是一种真机永远拿不到的数据形态。

一个开放的问题是:具身智能会不会走上自动驾驶的老路——先狂欢,再发现长尾,最后靠仿真和闭环慢慢磨?如果是,那么今天谁掌握"低成本、可复现、可闭环"的仿真训练系统,谁就握住了下一轮竞赛的门票。

虚时科技押的,就是这张票。

关于虚时科技

虚时科技是专注于具身智能仿真数据及训练系统的创业公司,两个月内连续完成天使轮及天使+轮融资,累计融资数千万元。

核心团队是一支学术、工程与落地紧密互补的阵容:

创始人兼CEO王德駪:曾任亚马逊Alexa大模型技术负责人,带领团队推进Code-to-Space技术路线,构建可编辑、可交互、具备物理属性的三维资产与仿真空间。

CTO何泳澔:中国科学院自动化研究所博士,曾任地瓜机器人具身智能算法负责人,负责从仿真数据生成、VLA/VA模型设计到真机数据基础设施建设与端侧部署的全链路研发,在ECCV、CVPR、ICRA、IROS等国际顶级会议与期刊发表论文30余篇,拥有授权专利10余项。

首席科学家苏虎:中国科学院自动化研究所副教授,长期从事控制科学、计算机视觉、具身智能与机器学习理论研究,其相关工作是最早通过文本或单张图像生成可交互仿真场景并合成机器人操作数据的代表性成果之一。

商业落地上,虚时科技选择了一条极其务实的路线:工业制造场景优先。原因正如王德駪所说——"物理AI和物理世界直接关联,出问题的后果比语言模型大得多,也直观得多。"工业场景相对固定、自动化基础高,更适合新技术的试验和验证。

具身能力的价值,不在于形态像不像人,而在于能不能应对复杂情况、稳定完成任务。

从AnySceneGen到IntimeVerse,从空间生成到客户交付,虚时科技正在把"仿真是唯一解"这个判断,落实成产品与订单。

步日欣,创道硬科技创始人,北京邮电大学集成电路专委会副会长,浙商证券研究院专家,兼任多家投资机构投委。电子工程本科、计算机硕士学位,具有证券从业资格、基金从业资格,拥有IT研发、咨询、投融资十五年以上经验,关注投资领域为半导体、智能制造、新能源等。“硬科技新势力”平台覆盖5w+投资人和几千家科技型创业企业,并辅导几十家科技企业完成股权融资。

相关推荐

公众号科创之道主笔,标准的EE、CS专业理工男。从事研发、咨询、投资工作15年,主要关注领域为半导体、人工智能、物联网、云计算等,目前专注于风险投资和企业服务领域,平时喜欢把一些工作上的感悟随手记下来,希望通过自己的文字,融合IT产业和投融资行业知识,为跨行业沟通搭建一座桥梁。