• 正文
  • 相关推荐
申请入驻 产业图谱

人形机器人技术全览:感知系统

18小时前
675
加入交流群
扫码加入
获取工程师必备礼包
参与热点资讯讨论

人形机器人是具身智能的重要形态,也是当前全球科技竞争的前沿赛道。

根据2026年3月赛迪发布的《2025年人形机器人市场研究报告》,2025年,全球人形机器人出货量约1.7万台,出货量大多集中在仓储物流、工业装配、教育消费等垂直场景。

中国凭借完善的供应链体系、核心技术自主化突破及多场景落地优势,稳居全球人形机器人产业第一大国。2025年,中国人形机器人整机企业数量超过140家,出货量约1.44万台,占全球总出货量的84.7%。

进入2026年,人形机器人产业进一步驶入"快车道"。

TrendForce在2026年4月预测,2026年中国人形机器人产量将激增94%。中国市场成为核心增长引擎,摩根士丹利年内两次上调中国出货量预测,从年初1.4万台,1月份第一次上调至2.8万台,6月份第二次又上调至5万台。

在资本市场,这段时间几乎每周都能看到具身智能领域新的融资消息。根据IT桔子事件库数据显示,2026年上半年国内具身智能赛道融资总金额达到935亿元,较2025上半年提升了5倍;融资事件数量达到322笔,同比增长137%。

根据第一财经统计,今年上半年具身智能估值百亿独角兽企业至少已达到22家,而2025年仅有3家。

图片来源:第一财经,https://www.stcn.com/article/detail/4016927.html

具身智能已明确写入中国"十五五"规划纲要,被定位为未来产业和新增长点。

在政策和资本双重强力推动下,具身智能的产品和技术正在快速迭代。在不远的将来,具身智能将不可逆地、快速地渗透到我们工作和生活的方方面面。

笔者以人形机器人为例,整理其技术栈全景,探讨实现方案和演进趋势。内容包括人形机器人的感知、决策、执行和支持四大系统,以及人形机器人开发体系。涵盖从底层零部件、核心模组到顶层模型的完整技术链路,介绍每个组件的主要功能、实现原理、核心玩家和发展趋势。

本文是第一篇:感知系统。

01、系统架构

从硬件层面,一个完整的人形机器人通常由感知系统、决策系统、执行系统和支持系统四大子系统构成。

其中:

1)感知系统:是"五官",负责环境感知和自身状态感知。主要包括摄像头激光雷达、IMU、力觉/触觉传感器等,成本约占整机BOM的10%-20%。

2)决策系统:是"大脑和小脑",负责认知、规划和运动控制。主要包括处理器控制器,成本约占整机BOM的10%-15%。

3)执行系统:是"骨骼和肌肉",负责关节驱动和末端操作。主要包括电机、减速器、关节模块、灵巧手等,成本约占整机的40%-60%,是最大成本项。

4)支持系统:是"循环和神经",负责供电、通信、热管理和结构承载。成本约占整机的10%-20%。

各部分构成比例示意如下:

感知系统用于人形机器人获取内外部信息,分为环境感知(外部感知)和自身感知(内部感知)两大类。

环境感知主要包括视觉、雷达、触觉和听觉等。自身感知主要包括力/力矩、位置/转速、姿态和定位等。

这些传感器协同工作,为机器人提供完整的"五感"能力。

02、环境感知

1. 视觉

人类约70%的信息通过视觉获取,人形机器人同样高度依赖视觉感知。

视觉传感器最常见的就是RGB相机,能够获取二维彩色图像,实现目标识别和语义理解。在具体应用中,视觉传感器大部分安装于头部,负责全局环境理解与导航。

例如,Figure 03机器人在下巴、额头、头顶和后脑勺各一个RGB相机:

特斯拉2024年公开专利(WO2024072984A1)中,头部摄像头布局示意图如下,专利中的方案采用 6 个摄像头,全部布置在头部:前向 3 个、侧向 2 个、正后 1 个。(最新真机方案有所微调)

也有一些机器人将视觉传感器安装在腕部,负责近距离精细操作(如抓取精度校准)。

人形机器人很多时候需要进行精细操作,需要精确获取距离信息,因此深度相机被广泛应用。深度相机可以同时输出RGB图像和深度信息,能够实现更精准的三维感知。

深度相机的主要技术路线有:

1)结构光:通过投射已知图案并分析变形获取深度信息,可细分为单目结构光和双目结构光。该方案精度高(毫米级),但受环境光干扰大,适用于室内近距离场景。

2)ToF(飞行时间):通过测量光脉冲往返时间计算距离,可细分为iToF和dToF。iToF方案近距离精度高,dToF方案抗干扰能力更强、测距更远。

3)双目立体视觉:通过两个相机视差计算深度。不依赖主动光源,但算力需求高,且对纹理匮乏表面效果差。

深度相机介绍详见:雪岭 · 具身智能中的深度相机技术(RGBD)

目前深度相机的主要玩家有:RealSense(深度相机领域标杆)、奥比中光(国内3D视觉传感器龙头)、速腾聚创(Active Camera系列)、万集科技等等。

2026年6月,RealSense在Automate 2026上发布D585 Pro AI原生深度相机,搭载第五代自研SoC,专为人形机器人设计,支持120x100度视场角和60FPS帧率。

视觉系统目前在朝着RGBD融合的方向发展,尤其是通过单芯片方案,实现RGB和深度信息的物理像素级融合,实现极致的时间和空间同步。视觉信息还可能进一步融合材质识别、反射率、红外等信息,成为一颗超级视觉感知传感器。

详见:雪岭 · RGBD单芯片:方案汇总、性能局限和应用思考

2. 雷达

雷达是一种主动探测传感器,通过发射探测波(激光、电磁波或者声波),并接收回波来感知环境,可以弥补传统视觉在弱光、强光和雨雾粉尘场景下的不足。

雷达主要有激光雷达、毫米波雷达超声波雷达和UWB雷达等几种类型:

1)激光雷达:通过发射激光脉冲或者调频连续波,测量回波时间或相位差来获取三维点云,精度高,成本高。

2)毫米波雷达:利用毫米波频段电磁波进行探测,受光照和雨雾影响最小,但角分辨率较低,噪声明显。

3)超声波雷达:利用超声波进行近距离测距和避障,成本低,但探测距离有限。

4)UWB雷达:通过发射纳秒级极窄脉冲信号(频谱覆盖3.1-10.6GHz),测量脉冲飞行时间(ToF)计算距离。抗多径干扰能力强、功耗低,适合近距离避障和室内精确定位。万字全景:超声波雷达和毫米波雷达的强劲对手——UWB近场感知技术

人形机器人对雷达检测精度要求高(尤其是0.1-10m的近距离),对于体积、功耗的约束也更为严苛,目前使用的主要是激光雷达。人形机器人运动模式包含行走、弯腰、转头等多自由度姿态变化,因此,激光雷达处理点云运动畸变的难度,高于车辆场景。

机器人上激光雷达的主要玩家有速腾聚创(Airy、Fairy、E1R、E2等),禾赛科技(JT16、JT128、FTX等),览沃(Mid360),煜炜光学等。

360°激光雷达和纯固态激光雷达各有优势应用场景。

360°激光雷达从16线向144线、196线演进,持续提升点云密度和感知精度,减小体积和重量。

在纯固态激光雷达方向,头部厂家借助自研SPAD-SoC芯片和2D可寻址VCSEL芯片,通过极致的芯片化,提升分辨率,降低串扰,并大幅降低功耗。

3. 触觉

触觉传感器能够直接检测机器人与物体之间的相互作用,包括接触力、温度、物体材质硬度和柔软度等特性,是实现柔顺抓取(抓取草莓、丝绸等易碎品)、精细操作(电子元件装配)和人机安全交互的关键。

图片来源:Jie Jin 等《Progress on Flexible Tactile Sensors in Robotic Applications on Objects Properties Recognition, Manipulation and Human-Machine Interactions》

触觉传感器通常布置在指尖、手掌等区域。从实现原理的角度,一般分为下面几种:

1)电阻式:使用压敏材料制作,在外力作用下,监测材料的电阻变化实现力信号感知。该方案工艺简单、成本低、可大面积阵列化制备、适配柔性场景,是当前主流方案。动态响应性能较弱,不适合高频动态力检测场景。

2)电容式:通过外力作用下电容极板间距/正对面积变化,实现力信号的精准检测。灵敏度高、响应速度快、功耗低,常用于手指关节等高精度感知场景。易受寄生电容与环境湿度干扰,阵列化产品需配套复杂的信号校准电路

3)压电式:利用压电材料的正压电效应,将动态力信号转化为电信号实现感知。能够实现高频响应、宽频带动态感知,可精准捕捉冲击信号,适用于关节、足底等冲击防护场景。该方案无法检测静态恒力,仅适合动态力感知场景,需搭配其他原理传感器实现全量程检测。

4)光学式:也常被称为视触觉传感器,通过内部相机观察柔性皮肤表面的形变,再通过算法计算接触力分布和接触物体形状。空间分辨率高、抗电磁干扰能力强,可实现高分辨率表面形貌、纹理和滑移检测,在精密操作场景具备不可替代的优势。

5)磁感应式:该方案的弹性体产生形变时,埋在弹性体内部的磁体随弹性体一起发生位移,磁体位移导致磁场变化,霍尔传感器将磁场变化转化为电信号。该方案容易受到电磁环境影响。

触觉传感器的评价维度主要是:空间分辨率、响应时间、检测量程、非线性误差、迟滞率、循环稳定性、环境抗干扰性、柔性适配性。

 

市场格局方面,海外头部企业仍占据高端市场主导地位,美国Tactile Labs、SynTouch,日本ALPS ALPINE、村田、TDK,德国Bosch、Sensitec等企业,占据全球大部分的高端量产市场份额,主要优势在于核心材料、专用芯片以及规模化制备工艺等领域。

中国企业正在快速崛起,在中低端量产市场实现初步国产替代,高端市场正在进行技术突破。

据行业估计,未来3-5年,集力觉、滑觉、温度觉、湿度觉、纹理识别于一体的柔性电子皮肤技术,将实现规模化突破,传感器空间分辨率预计突破10μm,响应时间降至0.1ms以内,同步推进传感-计算-控制一体化芯片集成,全面复刻人类皮肤的全维度感知能力,成为人形机器人的标配感知方案。

4. 听觉

听觉传感器使人形机器人能够感知声源方向、识别人类语音指令、进行语音交互和环境声学监测(如异常声音检测)。在人机协作场景中,语音交互是最自然的交互方式之一。

听觉感知的核心是麦克风阵列和声源定位算法。

麦克风阵列由多个麦克风按特定几何排列组成,通过各麦克风接收声音信号的时间差(TDOA)和相位差(PDOA)或到达能量比等特征,估计声源方位。常见阵列构型包括线性阵、环形阵和球形阵。

人类通过声音实现空间定位的示意图:

主要玩家方面,国外的有ReSpeaker、Anker、Knowles、TDK InvenSense,以及国内的歌尔股份、科大讯飞、思必驰等。

从发展趋势上,波束成形(Beamforming)技术可在噪声环境中增强目标方向语音信号,抑制其他方向干扰,提升远距离(3-5米)的语音识别率。

另外,将听觉与视觉、触觉信号融合,在嘈杂环境中实现更鲁棒的人机交互

03、自身感知

1. 力/力矩

力/力矩传感器测量机器人关节受力情况,是实现力控闭环控制的必要环节。

力/力矩传感器基于应变片(Strain Gauge)或压电效应工作。当外力作用使弹性体产生微小变形时,贴附其上的应变片电阻发生变化,通过惠斯通电桥将电阻变化转化为电压信号输出。力/力矩传感器的评价指标通常包括:灵敏度、串扰、抗过载能力及维间耦合误差。

其中,六维力矩传感器是维度最高的力矩传感器,可同时测量三个正交方向的力(Fx、Fy、Fz)和三个方向的力矩(Mx、My、Mz),提供完整的力学反馈。

六维力矩传感器需要在一个弹性体上同时感知六个方向的力和力矩,相对于单维力矩传感器,开发难度会高很多。例如,六维力矩传感器需实现三个正交力和三个力矩方向的精确联合加载标定,六个通道的输入信号会对其他通道的输出信号造成影响(维间耦合),解耦需在构建解耦矩阵时充分考虑重力、重心、零偏误差等因素,解算过程较为复杂。

美国ATI是六维力传感器领域的行业龙头,长期占据主导地位。国内有宇立仪器、安培龙、华培动力、东华测试、坤维科技、鑫精诚、蓝点触控、昊志机电、柯力传感、海伯森、瑞尔特等。

目前,六维力传感器的传感器体积和重量持续降低,以更好适配机器人关节内部受限空间。

随着国产厂商技术突破和量产规模提升,国产替代加速,六维力传感器价格有望从万元级降至千元级。

2. 位置/速度

编码器用于检测电机位置和速度,为人形机器人关节提供位移和速度反馈,其测量性能会影响关节控制的定位精度、运动平稳性和响应速度。

根据检测原理,编码器分为如下几种类型:

1)电容编码器:利用电容变化检测角度。精度高、功耗低,但成本较高。

2)光电编码器:利用光电转换原理,通过光栅盘和光电检测元件,将角位移转换为数字脉冲。精度高、分辨率高,但对灰尘和振动敏感。

3)磁编码器利用霍尔效应或磁阻效应检测磁场变化。抗污染能力强、体积小,但精度略低于光电编码器。

4)电感式编码器:利用电涡流感应原理,通过激励线圈向金属转子发射高频电磁场,由接收线圈捕捉受转子位置调制的空间磁场变化来实现角度测量。该方案不依赖磁体,抗杂散磁场干扰能力远优于磁编码器,耐受油污、粉尘、冷凝水等污染。精度可达23位绝对角度输出,重复定位精度±5角秒,接近光电编码器水平。

按输出信号类型,编码器分为增量式(输出脉冲序列,需零位参考)和绝对式(直接输出角度值,无需回零)。

单台人形机器人通常搭载20-60个编码器,其中以绝对式磁编码器(TMR/GMR方案)为主,高端关节也会采用光电编码器获取更高精度(22位以上)。

编码器的主要玩家有海德汉(Heidenhain,德国,光电编码器全球领导者)、多摩川(Tamagawa,日本)、禹衡光学(国内编码器龙头)、鲍默(Baumer,瑞士)、长春光机所、韦尔股份、金钢科技、弓望电子等。

3. 姿态

IMU(惯性测量单元)采集角速度与加速度等惯性信息,获取机器人的运动姿态,是人形机器人保持平衡及运动控制的关键传感器。

一个IMU通常包含三轴陀螺仪和三轴加速度计,分别测量物体在三维空间的角速度和加速度。通过卡尔曼滤波等姿态融合算法,将陀螺仪和加速度计数据融合,输出横滚/俯仰/航向等姿态角。

IMU通常布置于机器人胯下或胸腔部位,测量整个机器人行动过程中上半身的姿态。对上半身姿态的感知非常重要,会直接影响到站立稳定性、行走直线度、原地转弯以及停止等动作的流畅程度。

单台人形机器人需部署6-10个IMU(躯干1颗主IMU,双腿各2颗,双臂各1-2颗),人形机器人专用高精度IMU单颗单价800-2000元,单台IMU硬件价值量约9600元(按均价1200元×8颗计),是感知系统中价值很高的单一元器件品类。

IMU的主要玩家包括Honeywell、ADI、Bosch、ST、TDK、muRata、Sensonor、Xsens、芯动联科、华依科技、敏芯股份、原极科技、导远科技、戴世智能、矽睿科技等。

IMU正在从模组级向芯片级发展,体积越来越小。

4. 定位

定位技术解决"机器人在哪里"的问题,人形机器人需要在室内外复杂环境中实现厘米级的定位精度,实现作业过程中的自主导航和运动规划。

人形机器人定位主要依赖以下技术路线:

1)GNSS/RTK:通过接收多颗卫星发射的导航信号,解算接收器三维位置和速度。人形机器人室外导航场景通常采用RTK技术提升精度至厘米级(水平1-3cm,垂直3-5cm)。GNSS在遮挡环境下,信号质量会下降。

2)SLAM:SLAM技术同步构建地图和确定自身位置,分为视觉SLAM(V-SLAM,基于相机图像)和激光SLAM(L-SLAM,基于LiDAR点云)。V-SLAM成本低但受光照影响大;L-SLAM精度高、鲁棒性好但成本较高。

3)里程计:通过IMU积分或编码器读数推算位移。短期精度高但存在累积漂移,需与其他传感器融合使用。

实际产品中,通常会将GNSS、SLAM、里程计等信号通过扩展卡尔曼滤波(EKF)或因子图优化(Factor Graph Optimization)融合,实现室内外无缝高精度定位。

04、结语

总结一下,对于人形机器人的感知系统:

在环境感知方面:

1)视觉传感器以RGB相机和深度相机为核心,RGBD融合是重要趋势;

2)激光雷达是人形机器人主力传感器,360度激光雷达和纯固态激光雷达各有所长;

3)触觉传感器多种方案并存,柔性电子皮肤是未来方向;

4)听觉传感器基于麦克风阵列和声源定位算法,多模态融合是趋势。

在自身感知方面:

1)六维力传感器为核心器件,国产替代加速;

2)编码器以绝对式磁编码器为主流;

3)IMU向芯片化、车规级、多传感器融合方向发展;

4)定位技术融合GNSS、SLAM和里程计。

感知系统中,除了文中提到这些部件之外,其他还有温度传感器、气味传感器等等,由于不是关键部件,本文不再展开。

整体来看,感知系统正朝着多模态融合、芯片化集成、国产化替代的方向快速演进。后续,针对每种传感器的应用,我们再深入研究。

 

个人观点,未必准确,欢迎讨论。


我是雪岭,研究感知、控制和人工智能的技术、产品和应用,欢迎交流。

联系雪岭和全集索引请参考:https://dcn7get8fskg.feishu.cn/wiki/CCMpwjC0EiBIw2kFr7uc84qHneb

相关推荐