• 正文
  • 相关推荐
申请入驻 产业图谱

Loco-Manipulation:机器人移动与操作协同的技术演进

08/14 13:18
483
加入交流群
扫码加入
获取工程师必备礼包
参与热点资讯讨论

转载自公众号:敢敢AUTOHUB

0. 引言

在机器人技术发展的早期阶段,移动能力与操作能力长期处于割裂状态。工业机械臂固定在生产线上,精度极高却无法移动半步;移动机器人能够自主导航,却只能充当"搬运工"角色。

这种设计在结构化的工业环境中尚可应对,但当机器人需要走进家庭、医院、仓库等开放场景时,局限性立刻显现。没有哪个真实任务能够被简单分解为"先移动到位,再执行操作"两个独立步骤。

Loco-Manipulation(Locomotion + Manipulation)正是为了打破这一僵局而诞生的技术范式。它不是简单地将移动平台与机械臂拼接在一起,而是要实现两者在时间、空间、动力学层面的深度协同。

移动过程中调整姿态为操作创造条件,操作产生的力反馈实时影响移动策略,全身关节协调配合以维持动态平衡。这种协同能力,是机器人从"专用工具"进化为"通用助手"的关键一步。

从技术演进的角度看,Loco-Manipulation 的发展轨迹清晰地反映了机器人学从"分而治之"到"整体优化"的范式转变。早期研究者尝试用分层控制架构来规避协同难题,但很快发现这种方案在动态场景中力不从心。

当机器人需要边走边推动重物时,操作产生的反作用力会破坏移动平衡,而移动姿态的变化又会影响操作精度。两个子系统之间的耦合无法被简单忽略,必须从根本上重新设计控制架构。

真正的突破来自于两条并行发展的技术路径。第一条是模型驱动路径(Model-based),研究者基于物理动力学理论,将机器人全身建模为统一系统,通过优化算法同步规划移动与操作动作。

这条路径的代表是苏黎世联邦理工学院(ETH Zurich)的工作,他们在 ANYmal 四足机器人上实现了开门、推重物、跨越障碍等复杂任务,成功率超过 90%,展现了模型驱动方法在结构化环境中的卓越性能。

第二条是学习驱动路径(Learning-based),研究者放弃手动设计协同规则,转而让机器人通过强化学习或模仿学习,从数据中自主发现移动与操作的最优协同策略。

这条路径的优势在于无需精确建模,能够适应复杂接触、非结构化环境,且可以通过迁移学习复用人类演示数据。近年来,随着大规模仿真平台和视觉-语言-动作模型的成熟,学习驱动方法在人形机器人领域取得了显著进展。

本文将系统梳理 Loco-Manipulation 的核心技术脉络,深入解析模型驱动与学习驱动两大范式的代表性成果,并探讨技术走向工业落地过程中的关键挑战与未来趋势。

1. 技术背景与核心挑战

1.1 为什么需要 Loco-Manipulation

传统机器人系统将移动与操作视为两个独立模块,这种设计在特定场景下是合理的。例如,工业机械臂的工作空间固定,只需优化操作精度;AGV 小车只负责物料运输,无需考虑操作任务。

但当我们希望机器人能够应对开放世界的多样化需求时,这种分离设计的弊端开始显现。考虑一个看似简单的家居场景:机器人需要从地面拾取一个物体并放到桌上。

如果采用传统的"先移动后操作"策略,机器人需要经历移动到物体附近、停止调整姿态、伸出机械臂抓取、移动到桌子旁、再次停止调整、最后放置物体等六个步骤。

这个流程存在多个问题。首先,每次切换模块都需要重新定位和调整,效率低下。其次,如果物体位置在移动过程中发生偏移,或者桌面高度与预期不符,机器人需要反复调整。

最关键的是,当机器人抓取重物时,负载会改变重心分布。如果移动控制器没有感知到这一变化,可能导致失衡甚至跌倒,这在真实应用中是不可接受的安全隐患。

Loco-Manipulation 的核心思想是将移动与操作视为一个整体进行规划和控制。在上述场景中,机器人可以在接近物体的过程中,同步调整身体姿态和机械臂位置,使得到达时无需额外调整即可抓取。

抓取重物后,机器人能够实时调整步态和重心,补偿负载变化对平衡的影响。在移动到桌子的过程中,根据视觉反馈动态调整轨迹和末端位置,确保放置精度。

这种协同不仅提升了效率,更重要的是增强了鲁棒性。机器人能够应对动态变化,而不是依赖精确的预先规划,这是适应真实世界复杂性的关键能力。

1.2 核心技术挑战

实现 Loco-Manipulation 面临三大核心挑战,每一个都需要在理论和工程层面取得突破。

挑战一:动态耦合的复杂性

移动与操作之间存在强耦合关系。机械臂的运动会改变机器人的整体重心,进而影响移动稳定性;移动过程中的加速度和地面反力会传递到机械臂,影响操作精度。

这种耦合在数学上表现为高维、非线性的动力学方程,难以精确求解。以四足机器人为例,当它用前肢抓取物体时,后肢需要承担更多重量以维持平衡,同时调整步态以补偿重心偏移。

如果采用传统的分层控制,底层控制步态,上层控制机械臂,两个控制器之间缺乏信息交互,容易导致冲突。底层控制器试图维持标准步态,而上层控制器的动作却在不断破坏这个步态。

挑战二:实时性与计算复杂度的矛盾

要实现流畅的移动操作协同,控制频率通常需要达到 50Hz 以上,即每 20 毫秒更新一次控制指令。但全身动力学模型的维度很高,人形机器人通常有 30+ 个自由度,四足机器人加上机械臂也有 20+ 个自由度。

在如此高的维度下进行实时优化求解,对算法效率和硬件性能都提出了极高要求。模型驱动方法需要在每个控制周期内求解一个包含数百个约束的优化问题。

学习驱动方法则需要神经网络能够在毫秒级时间内完成前向推理。如何在保证控制精度的前提下降低计算复杂度,是工程实现的关键,也是制约技术落地的主要瓶颈之一。

挑战三:泛化能力与数据效率的权衡

真实世界的场景千变万化:地面可能不平整,物体形状各异,环境光照变化,甚至可能有人类或其他机器人的干扰。模型驱动方法依赖精确的环境建模,一旦实际情况偏离模型假设,性能会显著下降。

学习驱动方法虽然理论上能够从数据中学习泛化能力,但需要大量多样化的训练数据。而在真实机器人上采集数据成本高昂且存在安全风险,每小时数据采集成本可达数千美元。

如何在有限的数据条件下训练出既稳定又泛化的策略,是当前研究的核心难题之一。仿真到现实(Sim-to-Real)迁移技术提供了一种解决思路,但仿真与现实之间的差距仍然是制约性能的瓶颈。

2. 模型驱动方法——物理建模的精确协同

模型驱动(Model-based)方法是 Loco-Manipulation 领域的经典技术路径,其核心思想是基于机器人动力学模型,通过优化算法求解满足物理约束的最优控制序列。

这类方法的优势在于可解释性强、稳定性高、能够提供理论保证,因此在工业级应用中占据主导地位。从数学角度看,模型驱动方法将机器人控制问题转化为约束优化问题。

2.1 核心技术框架

模型驱动方法的典型流程包括三个关键步骤:全身动力学建模、接触建模与约束处理、优化问题构建。

步骤1:全身动力学建模

将机器人视为一个刚体系统,建立包含所有关节的动力学方程。对于腿式机器人,这通常采用浮动基座(Floating Base)模型,其动力学方程的一般形式为 。

这个模型捕捉了机器人的惯性特性、重力影响、以及接触力的作用。关键在于,它将移动(基座运动)和操作(机械臂运动)统一在同一个方程中,自然地包含了两者之间的动力学耦合。

步骤2:接触建模与约束处理

腿式机器人与环境的交互主要通过足端接触实现。接触建模需要考虑摩擦锥约束、单侧约束和接触状态切换三个关键要素。

摩擦锥约束确保接触力必须在摩擦锥内,否则会发生滑动,其数学表达为 。单侧约束表明机器人只能推地面,不能拉地面,即法向力必须非负。

接触状态切换描述足端在支撑相和摆动相之间的转换。这些约束的准确建模是保证机器人稳定运动的基础,也是模型驱动方法相比学习方法的核心优势之一。

步骤3:优化问题构建

将移动操作协同问题表述为一个优化问题,目标是找到一条轨迹,使得机器人能够完成任务的同时满足所有物理约束。

目标函数通常包含跟踪误差、控制代价和接触力代价三项,表示为 。约束条件包括动力学约束、接触约束、关节限位、扭矩限制和任务约束。

这是一个非线性优化问题,通常采用序列二次规划(SQP)或内点法求解。优化算法的效率直接决定了系统的实时性能,是工程实现的关键技术难点。

2.2 代表性工作解析

2.2.1 ETH Zurich: 多接触场景的通用规划框架

苏黎世联邦理工学院在 2023 年发表于 Science Robotics 的工作"Versatile Multi-Contact Planning and Control"代表了模型驱动方法的最高水准。该工作的核心创新在于提出了一个能够自动发现接触序列的规划框架。

传统方法需要人工指定接触序列,例如"先用右前足接触墙面,再用左前足接触地面",这在复杂场景中几乎不可行。ETH 的方案采用双层优化架构,外层基于图搜索的接触序列规划,内层基于优化的轨迹生成。

外层将环境中的可接触表面离散化为接触候选点,构建一个状态图,每个节点代表一个接触状态。通过启发式搜索找到从初始状态到目标状态的接触序列,大幅降低了人工设计的复杂度。

内层对于给定的接触序列,求解一个轨迹优化问题,生成满足动力学约束的全身运动轨迹。这里采用了采样方法与优化方法的结合,先用快速采样生成粗略轨迹,再用优化方法精细化。

在真实的 ANYmal 四足机器人上,该方法成功完成了多个高难度任务。开启重型洗碗机门时,机器人需要用前肢抓住把手,克服门的静摩擦力拉开,同时后肢保持平衡,必须协调四肢的接触力分配。

转动阀门任务需要多次重新抓握,每次抓握时都要调整身体姿态以获得合适的操作角度。跨越弹簧门时,机器人用前肢推开门,在门回弹之前快速通过,这要求移动与操作的时序精确协调。

成功率达到 90% 以上,规划时间在普通笔记本上约 1 分钟,证明了方法的实用性。但该方法仍存在局限:需要预先获得环境的几何模型,在未知环境中难以应用;对于接触候选点较多的场景,图搜索的复杂度会显著增加。

2.2.2 ETH Zurich: 扭矩级全身MPC控制

同样来自 ETH Zurich,2025 年发表于 RAL 的工作"Whole-Body Inverse Dynamics MPC"将模型驱动方法推向了新的高度,直接在扭矩空间进行优化,而不是传统的位置或速度空间。

传统的 MPC(模型预测控制)通常在简化模型上进行优化,然后通过底层控制器将优化结果转换为关节扭矩。这种分层设计的问题在于,简化模型无法准确捕捉全身动力学,导致优化结果在实际执行时可能违反扭矩限制或导致不稳定。

该工作的创新在于直接优化关节扭矩,将全身逆动力学作为优化问题的约束。这样做的好处是优化结果天然满足动力学可行性,无需额外的跟踪控制器,简化了控制架构。

关键技术包括自适应时间步长、接触力优化和实时性优化三个方面。自适应时间步长采用几何级数分布,近期步长小保证精确控制,远期步长大降低计算量,在保证控制精度的同时提升实时性。

接触力优化不仅优化扭矩,还同时优化接触力,确保接触力与扭矩的一致性。通过代码生成和编译优化,将求解时间压缩到 12.5ms,实现 80Hz 的控制频率,满足实时控制需求。

在 Unitree B2-Z1 四足操作机器人上,该方法实现了三类高难度任务。行走中牵引 10kg 负载时,机械臂抓住重物,在行走过程中保持稳定,负载超过了机械臂的额定负载,必须通过全身协调来分担重量。

推箱子靠墙任务中,机器人边走边推动箱子,直到箱子贴墙,要求实时感知推力反馈,调整步态以维持推力方向和大小。白板擦拭任务是典型的力控任务,机械臂末端装有海绵,在白板上施加恒定压力进行擦拭,同时机器人横向移动以覆盖整个白板。

实验数据显示,位置跟踪误差小于 0.1m,力控误差小于 10N,在受到 0.8m/s 的基座扰动后能够快速恢复稳定,证明了方法的鲁棒性。

2.2.3 MIT: 双足机器人的动态平衡与操作协同

麻省理工学院在 IEEE-RAS Humanoids 2014 发表的工作"Whole-body Motion Planning with Centroidal Dynamics and Full Kinematics"以及 IROS 2018 的"Dynamic Locomotion in the MIT Cheetah 3 Through Convex Model-Predictive Control",聚焦于如何在保持动态平衡的同时执行操作任务。他们提出的基于轨迹优化的方法,将全身动力学、零力矩点(ZMP)约束和操作任务目标统一在一个优化框架中。

该方法的核心创新在于引入了时变的稳定性裕度概念。在操作任务的不同阶段,系统动态调整稳定性约束的严格程度,在需要精确操作时放宽移动稳定性要求,在快速移动时加强平衡约束。

实验结果显示,Atlas 人形机器人能够在行走过程中拾取 5kg 重物,并在不停止的情况下完成放置动作。这种动态平衡与操作的协同,为人形机器人在动态环境中的应用提供了新思路。

2.3 模型驱动方法的优势与局限

模型驱动方法的核心优势体现在四个方面。首先是物理一致性保证,基于第一性原理建模,确保生成的动作在物理上可行,不会违反动力学约束或导致失稳,这在安全关键型应用中至关重要。

其次是可解释性强,优化过程透明,可以清晰地看到每个约束的作用,便于调试和故障诊断。当系统出现问题时,工程师能够快速定位原因,而不是面对黑箱模型束手无策。

第三是样本效率高,不需要大量数据训练,只需要准确的模型参数,这些参数可以通过 CAD 模型或系统辨识获得。相比学习方法动辄需要数百万次交互,模型方法的数据需求几乎可以忽略不计。

第四是实时性能优异,经过优化的求解器可以在毫秒级时间内完成计算,满足高频控制需求。ETH 的工作已经证明,在普通计算平台上实现 80Hz 以上的控制频率是完全可行的。

但模型驱动方法也存在明显的局限性。建模成本高是首要问题,需要精确的动力学模型和环境几何模型,跨场景部署时需要重新建模,这在快速变化的应用场景中是难以接受的。

泛化能力受限是第二个问题,对模型误差敏感,当实际系统与模型存在偏差时,性能会显著下降。例如,机器人长期使用后关节磨损导致摩擦系数变化,模型方法需要重新辨识参数才能恢复性能。

复杂接触场景处理困难是第三个挑战,当接触点数量多、接触状态频繁切换时,优化问题的规模和复杂度急剧增加,可能导致求解失败或实时性下降。

最后,难以处理高维感知输入,传统优化方法难以直接处理图像等高维传感器数据,通常需要预先提取几何特征,这限制了方法在视觉驱动任务中的应用。

3. 学习驱动方法——数据赋能的自主协同

学习驱动(Learning-based)方法代表了 Loco-Manipulation 的另一条技术路径。与模型驱动方法不同,学习方法不依赖精确的数学模型,而是让机器人通过与环境交互,从数据中自主学习移动与操作的协同策略。

这类方法的核心优势在于泛化能力强、能够处理复杂感知输入、可以迁移人类技能,因此在开放场景和人形机器人领域展现出巨大潜力。从技术角度看,学习方法将控制问题转化为函数逼近问题。

3.1 强化学习的核心思想

强化学习(Reinforcement Learning, RL)是学习驱动方法的主流技术。其基本思想是让机器人在仿真环境中反复尝试,通过奖励信号引导其发现最优策略。

机器人通过策略网络  输出动作,与环境交互获得奖励,然后通过价值网络  评估状态的好坏。优势函数  衡量某个动作相对于平均水平的优劣,指导策略改进。

奖励函数是强化学习的核心,它定义了"什么是好的行为"。在 Loco-Manipulation 任务中,奖励函数通常包含多个组成部分:任务进度奖励鼓励接近目标,移动效率奖励鼓励快速移动,稳定性惩罚避免剧烈晃动。

能耗惩罚鼓励平滑动作,接触力惩罚避免过大冲击,任务完成奖励在到达目标时给予大额奖励。这些奖励项的权重需要精心调整,是影响学习效果的关键因素。

3.2 代表性工作解析

3.2.1 UC Berkeley: 四足机器人的技能组合框架

加州大学伯克利分校在 IROS 2024 发表的工作"HiLMa-Res"提出了一个通用的分层强化学习框架,实现了四足机器人移动与腿部操作的深度协同。

该工作的关键洞察是:移动能力是任务无关的通用技能,而操作能力是任务特定的。因此,可以将控制器分为两层,底层负责跟踪任意给定的末端执行器轨迹,同时保持机器人平衡。

底层控制器通过强化学习训练,输入是期望的足端轨迹,输出是关节扭矩。关键技术是使用中枢模式发生器(CPG)生成标称步态,再通过贝塞尔曲线参数化残差轨迹,实现对标称步态的灵活调整。

上层是任务特定的操作规划器,根据具体任务规划足端应该如何运动。这个规划器也通过强化学习训练,但输入是任务相关的观测,输出是贝塞尔曲线参数和 CPG 参数。

在真实四足机器人上,该框架实现了三类任务。足球运球时,机器人用前肢推动足球,同时保持行走,这个任务在仿真中训练,零样本迁移到真实机器人,成功率达到 75%。

障碍跨越任务中,机器人需要抬高前肢跨越障碍物,同时保持平衡,使用视觉输入检测障碍物高度,成功率 87.5%。负载导航时,机器人用前肢抓住重物,在行走过程中保持稳定,使用真实数据训练,成功率 100%。

该框架的技术优势体现在三个方面:通用性强,底层控制器只需训练一次,可以复用到多个任务;样本效率高,上层规划器的训练数据量远小于端到端方法;零样本迁移,仿真训练的策略可以直接部署到真实机器人。

3.2.1.1 SaPaVe: 主动感知与操作的端到端框架

2026 年 3 月被 CVPR 2026 接收的 SaPaVe 工作针对机器人与复杂场景交互中的主动感知和操作问题。现有方法难以统一语义驱动的主动感知与鲁棒的、视角不变的执行。

SaPaVe 提出了一个端到端框架,以数据高效的方式联合学习这些能力。该方法的关键创新是解耦相机和操作动作,而不是将它们放在共享动作空间中,并遵循自底向上的训练策略:首先在大规模数据集上训练语义相机控制,然后使用混合数据联合优化两种动作类型。

为支持该框架,引入了 ActiveViewPose-200K 数据集,包含 20 万个图像-语言-相机运动对,用于语义相机运动学习,以及一个 3D 几何感知模块,提高动态视角下的执行鲁棒性。还提出了 ActiveManip-Bench,这是首个用于评估超越固定视角设置的主动操作基准。

在仿真和真实世界环境中的大量实验表明,SaPaVe 的性能优于最近的视觉-语言-动作模型(如 GR00T N1 和 π₀),在真实世界任务中的成功率提高了 31.25%。这些结果表明,当通过解耦但协调的策略训练时,紧密耦合的感知和执行能够实现高效且可泛化的主动操作。

3.2.2 BIGAI + Unitree: 无传感器的力-位统一控制

北京通用人工智能研究院与宇树科技在 CoRL 2025 发表的工作提出了首个无需外力传感器的力-位统一控制策略,这是学习驱动方法在接触密集型任务中的重要突破。

传统的操作任务通常分为两类:位置控制(如抓取)和力控制(如擦拭、开门)。但在真实场景中,很多任务需要同时控制位置和力。擦黑板需要保持恒定的接触力,同时沿着黑板表面移动;开柜门需要施加足够的拉力,同时跟踪门把手的运动轨迹。

传统方法通常依赖外力传感器来测量接触力,但这类传感器成本高、易损坏,且增加了系统复杂度。该工作的核心创新是通过强化学习,让机器人从自身的历史状态中估计外力,无需额外传感器。

训练分为两个阶段。第一阶段在仿真中预训练移动和到达能力,此时不考虑力控制,奖励函数只包含位置跟踪误差和稳定性项。第二阶段引入随机的力指令和外部扰动,训练策略学习力估计和力控制。

关键是使用模型预测控制(MPC)损失来监督力估计器。通过使用估计的力预测未来状态,与实际观测到的下一状态对比,最小化预测误差,从而提升力估计的准确性。

在 Unitree B2-Z1 四足操作机器人和 Unitree G1 人形机器人上,该方法在四类接触密集任务中的表现显著优于纯位置控制。擦黑板任务成功率从 45% 提升到 92%,开关柜门从 60% 提升到 95%,抽屉开启从 30% 提升到 78%。

力控制误差稳定在 10N 以内,位置跟踪误差小于 0.1m,证明了方法的有效性。更重要的是,该方法实现了跨机器人形态的泛化,同一套策略可以在四足和人形机器人上部署,展现了学习方法的强大适应能力。

3.2.3 NVIDIA + CMU: 大规模视觉仿真到真实迁移

NVIDIA 与卡内基梅隆大学在 2025 年提出的 VIRAL 框架,代表了视觉驱动 Loco-Manipulation 的最高水准。该工作的核心贡献是实现了基于 RGB 视觉的长周期移动操作任务的零样本部署。

视觉驱动的移动操作面临三大挑战。首先是 Sim-to-Real 鸿沟,仿真中的视觉与真实世界差异巨大,包括光照、材质、相机噪声等多个方面。其次是长周期任务的误差累积,一个完整的循环需要 20+ 秒,视觉误差会逐步累积。

第三是数据效率问题,真实机器人上采集视觉-动作数据成本极高。VIRAL 采用师生蒸馏框架来解决这些挑战,教师策略使用特权信息(全状态)在仿真中训练,学生策略仅使用视觉输入。

教师策略通过特权强化学习训练,可以访问物体的精确位置、速度等信息。学生策略通过蒸馏学习教师的知识,结合 DAgger 和行为克隆技术,使用学生策略收集轨迹,查询教师的动作作为专家标签,最小化学生与教师的动作差异。

为了缩小 Sim-to-Real 差距,VIRAL 采用了大规模的视觉域随机化。光照随机化包括环境光强度、方向光强度和光照方向;材质随机化包括物体的颜色、粗糙度和金属度;相机参数随机化包括焦距、曝光和白平衡

还包括图像质量退化,添加噪声、运动模糊和 JPEG 压缩。通过这些随机化,学生策略在仿真中见过各种视觉条件,从而能够泛化到真实世界。

在 Unitree G1 人形机器人上,VIRAL 实现了连续 54 个"行走-放置-抓取-转向"循环,成功率 91.5%,平均每个循环耗时 20.2 秒,接近人类遥操作水平的 21.4 秒。

关键性能指标包括零样本迁移,仿真训练的策略直接部署,无需真实数据微调;场景泛化,支持托盘位置变化、机器人姿态变化、桌面高度变化;光照鲁棒性,在不同光照条件下均能稳定工作。

3.3 视觉-语言-动作模型:迈向通用智能

近年来,大语言模型的成功启发了机器人领域的研究者:能否构建一个统一的模型,将视觉感知、语言理解、动作生成融合在一起,实现真正的通用机器人智能?

3.3.1 OpenDriveLab + AgiBot: 大空间移动操作的 VLA 框架

OpenDriveLab 与 AgiBot 在 2025 年提出的 WholeBodyVLA 是首个面向大空间移动操作的视觉-语言-动作模型。

传统 VLA 模型主要针对桌面操作任务,输入是固定视角的图像,输出是机械臂的关节角度。但在大空间移动操作中,机器人需要理解自然语言指令、感知大范围环境、协调全身动作。

WholeBodyVLA 的解决方案是引入双 LAM(Latent Action Model),分别处理操作和移动。视觉编码器和语言编码器提取多模态特征,VLA 主干网络解码为 latent 动作,然后分离为操作和移动的 latent,最后解码为具体动作。

与传统的连续速度控制不同,WholeBodyVLA 采用离散的移动指令接口:前进/后退、左移/右移、左转/右转、蹲下/站立。这种设计降低了学习难度,提升了精度,增强了稳定性。

在 Agibot X2 人形机器人上,WholeBodyVLA 在三大任务中的平均成功率达到 78.0%,较基线提升 21.3%。背包打包需要从桌上拾取多个物品,依次放入背包,需要双臂协同和精准放置。

箱子装载需要将散落在地面的物品收集到箱子中,需要蹲下和大范围移动。推车推动需要推动 50kg 重型推车到指定位置,需要全身力量协调。这些任务展现了 VLA 模型在大空间移动操作中的强大能力。

3.3.1.1 Stanford + USC: Ψ₀ 人形机器人 Loco-Manipulation 基础模型

斯坦福大学与南加州大学在 2026 年 3 月提出的 Ψ₀ (Psi-Zero) 是首个专门针对人形机器人 Loco-Manipulation 任务的开放基础模型。该工作指出,现有方法试图通过在大规模人类和人形机器人数据上联合训练来解决这一问题,但由于人类与人形机器人之间的运动学和运动差异,这种策略并不理想。

Ψ₀ 的核心创新是解耦学习过程以最大化异构数据源的效用。具体而言,提出了分阶段训练范式:第一阶段,在大规模第一人称人类视频上自回归预训练 VLM 主干网络,获取可泛化的视觉-动作表示;第二阶段,在高质量人形机器人数据上后训练基于流的动作专家,学习精确的机器人关节控制。

关键发现是数据配方的重要性:与使用嘈杂的互联网片段或异构跨具身机器人数据集的方法相比,在高质量的第一人称人类操作数据上预训练,然后在特定领域的真实世界人形机器人轨迹上后训练,能够产生更优的性能。

实验显示,Ψ₀ 仅使用约 800 小时的人类视频数据和 30 小时的真实世界机器人数据,就在多个任务中实现了最佳性能,在总体成功率上比使用 10 倍以上数据预训练的基线高出 40% 以上。团队承诺将整个生态系统开源,包括数据处理和训练管道、人形机器人基础模型和实时动作推理引擎。

3.3.2 基于大模型的任务规划

斯坦福大学在 ICRA 2023 发表的工作"Code as Policies: Language Model Programs for Embodied Control"以及 Google DeepMind 在 ICML 2023 的"PaLM-E: An Embodied Multimodal Language Model",展示了如何使用大语言模型将自然语言指令分解为可执行的移动操作子任务序列。

例如,当用户说"帮我准备咖啡"时,LLM 将其分解为:移动到咖啡机、打开柜门、取出咖啡杯、放置到咖啡机下、按下按钮等步骤。每个步骤再由底层控制器执行,形成完整的任务链。

关键创新在于引入了环境反馈机制。当某个子任务失败时,LLM 能够根据错误信息重新规划,而不是简单地重试。实验显示,这种自适应规划使长周期任务的成功率提升了 40%。

3.3.3 HumDex: 人形全身灵巧操作的遥操作系统

2026 年 3 月提出的 HumDex 系统专门针对人形全身灵巧操作中高质量演示数据收集的瓶颈问题。现有遥操作系统通常存在便携性有限、遮挡问题或精度不足等缺陷,限制了其在复杂全身任务中的应用。

HumDex 采用基于 IMU 的运动跟踪来解决便携性-精度权衡问题,在保持易于部署的同时实现精确的全身跟踪。对于灵巧手控制,引入了基于学习的重定向方法,无需手动参数调整即可生成平滑自然的手部动作。

与传统的连续速度控制不同,HumDex 采用离散的移动指令接口:前进/后退、左移/右移、左转/右转、蹲下/站立。这种设计降低了学习难度,提升了精度,增强了稳定性。

在数据收集之外,HumDex 提出了两阶段模仿学习框架:首先在多样化的人类运动数据上预训练以学习可泛化的先验知识,然后在机器人数据上微调以弥合具身差距实现精确执行。实验表明,这种方法以最小的数据采集成本显著提升了对新配置、物体和背景的泛化能力。整个系统已完全开源。

3.3.4 RoboMatrix: 技能中心的分层框架

2024 年 12 月提出的 RoboMatrix 是一个技能中心的分层框架,专为开放世界环境中的可扩展机器人任务规划和执行而设计。现有机器人策略主要采用任务中心方法,需要端到端的任务数据收集,导致对新任务的泛化能力有限,且难以在长周期、多阶段任务中定位错误。

RoboMatrix 从多样化的复杂任务中提取通用元技能,通过技能组合完成未见过的任务。其架构包含三层:高层调度层使用大语言模型进行任务分解,中间技能层容纳元技能模型,底层硬件层进行机器人控制。

该工作的关键创新是引入了首个能够在一个模型中无缝集成移动和操作的统一视觉-语言-动作(VLA)模型。这通过结合视觉和语言提示生成离散动作来实现。实验结果表明,当应用于未见过的物体、场景和任务时,RoboMatrix 的成功率比任务中心基线高 50%。

4. 工业落地与商业化探索

4.1 Figure AI Helix 02:面向工业场景的人形机器人

Figure AI 在 2026 年推出的 Helix 02 人形机器人,标志着 Loco-Manipulation 技术从实验室走向工业现场的重要里程碑。与学术研究侧重技术创新不同,Helix 02 的设计理念是"工程化优先",聚焦于可量产、可维护、可部署的实用性。

Helix 02 采用模块化硬件架构,关键部件可快速更换,大幅降低维护成本。这种设计使得单个机器人的平均故障修复时间从传统人形机器人的 4-6 小时降低到 30 分钟以内,这对于工业应用至关重要。

控制架构结合了模型驱动与学习驱动方法的优势。底层使用基于模型的全身控制器,保证动态平衡和安全性,控制频率达到 200Hz。上层使用学习的任务策略,实现灵活的任务适配,控制频率为 20Hz,降低计算负担。

针对仓储、制造等工业场景,Helix 02 进行了专门优化。双臂总负载能力达到 15kg,单臂可持续搬运 7kg 物体。通过能耗优化算法,连续工作时间达到 4 小时。集成多传感器融合,在复杂光照和遮挡条件下保持稳定感知。

根据 Figure AI 官方信息,Helix 02 已在多个工业场景完成试点部署。在 BMW 斯帕坦堡工厂,升级后的 Helix 02 已能够每天将约 1000 个钣金零件放置到底盘装配夹具中,展现了在重复性操作任务中的可靠性。

在物流仓储场景的包裹分拣和分类任务中,Helix 02 展现出显著进步。平均每个包裹处理时间 4.05 秒,条形码扫描成功率约 95%,能够处理多种包装类型,无需针对每种包装重新编程。

这些性能提升得益于 Helix AI 模型的增强特性:隐式立体视觉实现 3D 理解,多尺度视觉表示,学习型视觉本体感知,支持自校准和跨机器人无缝集成。

Figure AI 在 2025 年 3 月启动了 BotQ 专用人形机器人工厂,年产能可达 12000 台。公司计划在 2026 年完成小批量交付,目标 100+ 台,标志着人形机器人从原型验证迈向规模化生产。

4.2 Boston Dynamics Spot:商业化移动操作平台

Boston Dynamics 的 Spot 机器人配备机械臂后,成为商业化移动操作平台的典范。他们的控制系统采用混合架构,底层使用基于模型的全身控制器,上层使用学习的任务策略。

关键技术包括自适应步态调整、动态负载补偿和实时碰撞检测。当机械臂抓取重物时,系统自动调整步态参数,重新分配四肢的接触力,确保稳定性。碰撞检测模块能够在 10ms 内响应意外接触,保护机器人和环境。

Spot 已在工业巡检、建筑工地、危险环境探测等场景部署超过 1000 台,累计运行时间超过 100 万小时。这些实际应用数据为移动操作技术的工程化提供了宝贵经验。

4.3 Toyota HSR:家居场景的移动操作

丰田研究院聚焦于家居场景的移动操作应用。他们开发的 HSR(Human Support Robot)人形机器人,专门设计用于辅助老年人和残障人士的日常生活。

控制系统采用分层架构,高层任务规划使用符号推理,中层运动规划使用采样方法,底层控制使用模型预测控制。这种分层设计使得系统既能处理复杂的任务逻辑,又能保证实时性能。

在真实家居环境的测试中,HSR 能够完成取物、递送、开门、整理等 20 多种日常任务,平均成功率达到 75%。长期部署研究显示,机器人能够适应不同家庭的布局和物品配置,展现出良好的泛化能力。

4.4 Amazon Robotics:仓储场景的移动操作优化

亚马逊机器人部门在仓储物流场景积累了大量移动操作经验。他们的系统需要处理每天数百万件包裹的分拣、搬运和装载任务,对效率和可靠性要求极高。

技术创新包括多机器人协同调度、动态路径规划和自适应抓取策略。系统使用集中式调度器协调数百台移动操作机器人,避免碰撞和死锁。动态路径规划算法能够实时响应环境变化,如临时障碍物或其他机器人。

自适应抓取策略通过视觉和力反馈,处理各种形状、尺寸和材质的包裹。实际部署数据显示,系统的包裹处理速度达到每小时 600 件,错误率低于 0.1%,显著提升了仓储效率。

5. 总结

Loco-Manipulation 技术的发展历程,本质上是机器人从"专用工具"向"通用助手"演进的缩影。从早期移动与操作的割裂设计,到如今模型驱动与学习驱动两大范式的并行发展,再到面向工业落地的混合架构探索,每一步都在解决"如何让机器人适应真实世界"这一核心命题。

相关推荐