Humanoid Retargeting

1 minute read

Published:

Intro

The large boost of humanoid robots this year largely thanks to the learning-based motion control and learning from human motion datasets. All the dancing, KongFu and athletic movements are based on this kind of retargeting from human datasets -> IL(Imitation Learning) based RL(Reinforcement Learning). After trying different retargeting and learning method and seeing different humanoid doing cool movements on stage, I think it is good for me to summarize it. This blog try to to do such thing.

Background

人形机器人的控制一直是机器人学皇冠上的明珠,其核心挑战在于高自由度(DoF)、欠驱动特性以及在非结构化环境中的平衡保持能力。For the past few decades, we mostly rely on ZMP and LIPM, which rely on good dynamic models and complicate Whole body dynamics. These kinds of method is quite success on robust locomotion control. However, for highly dynamics task (eg. flip), it need tons of work to optimize the trajectory and spending lots of time adjusting controller.

There is also another approach: using human data to teach robot. Basically, mapping human motion on robots, and use reinforcement learning to train a end-to-end controller. It can achieve more nature and human like behavior while no needs to design complicated rewards or trajectory.

However, it faces the embodiment gap. 人类与人形机器人在拓扑结构(如脊柱的灵活性)、运动学参数(如肢体比例)、动力学特性(如关节力矩限制)以及质量分布上存在显著差异。直接将人类关节角度复制到机器人上往往会导致严重的物理冲突,如脚部滑移(Foot Skating)、自碰撞(Self-collision)或倾倒。因此,运动重定向不仅是一个几何映射问题,更是一个涉及物理约束、动力学可行性和语义保持的复杂优化问题. We will try to get deeper to this questions.

Retargeting High quality human data

数据是模仿学习的基石。在人形机器人领域,数据的质量直接决定了控制策略的上限。传统上,研究人员依赖于实验室环境下的动作捕捉(MoCap)数据(如CMU MoCap, AMASS数据集),但这些数据采集成本高、场景单一且缺乏环境交互信息。最新的研究趋势正在向利用互联网海量视频数据(In-the-wild Videos)和合成数据转变,并引入“Sim-to-Data”的关键清洗环节.

Human data source

AMASS, LANFAN, OMOMO.

Sim-to-data.

The MoCap data was used to control the virtual character in the first place. For robots, its full of noise and not feasable. So some works like H2H(Human-to-Humanoid) proposed Privileged Motion Imitator to clean the data.

  1. 初步重定向:首先将原始人类动作(来自AMASS或视频)通过逆运动学(IK)映射到机器人的关节空间。
  2. 特权教师评估:在仿真环境中训练一个拥有“上帝视角”的教师策略(Teacher Policy)。该策略可以访问所有物理参数(摩擦力、质量、精确位置),并尝试跟踪每一个重定向后的动作片段。
  3. 可行性筛选:如果连这个拥有特权信息的教师策略都无法完成某个动作(例如,人类做了一个超出机器人力矩限制的后空翻,或者步幅超过了机器人的腿长),系统就会判定该动作对当前机器人是“物理不可行”的,并将其剔除。
  4. 结果:最终生成的 $D_{filtered}$ 数据集仅包含该特定机器人本体能够物理执行的动作。这种方法极大地提高了后续学生策略(Student Policy)的训练效率和稳定性,避免了因强行模仿不可行动作而导致的策略崩溃。

Retargeting

运动重定向(Motion Retargeting)是将源(人类)骨骼运动映射到目标(机器人)骨骼运动的过程。这一过程的质量直接决定了机器人动作的自然度和物理可行性。目前主流的方法可以分为几何重定向(Geometric Retargeting)、物理约束重定向(Physics-Constrained Retargeting)、Mesh Mapping 以及隐空间/无重定向(Latent/Retargeting-free)四大类.

几何重定向:GMR (General Motion Retargeting)

GMR 是由Ze等人(2025)提出的一种通用、实时且开源的重定向框架,旨在解决传统几何方法在处理异构机器人时的局限性. 非均匀局部缩放与多目标优化传统的重定向往往简单地根据身高比例进行全局缩放,这对于四肢比例与人类差异巨大的人形机器人(如Unitree H1的大腿小腿比例与人不同)会导致严重的末端位置误差。GMR引入了非均匀局部缩放(Non-Uniform Local Scaling) 机制:

  • 局部缩放因子:系统不仅计算全局缩放因子 $S_{global} = H_{robot} / H_{human}$,还为每个肢体段(大腿、小腿、躯干、上臂、前臂)计算独立的局部缩放因子 $S_{local}^i$。
  • 目标点计算:基于局部缩放因子,重新计算机器人关键点(Keypoints)的目标位置: \(P_{target}^i = P_{root} + S_{local}^i \times (P_{human}^i - P_{human}^{root})\) 这一步骤确保了机器人即使肢体比例怪异,其手脚末端相对于躯干的位置也能保持与人类动作语义一致(例如,蹲下时手能摸到膝盖).

实时逆运动学(IK)求解GMR构建了一个多目标优化问题,通过QP(Quadratic Programming)求解器在毫秒级时间内求解关节角度 $\theta$: \(J(\theta) = w_{pos} ||FK_{pos}(\theta) - P_{target}||^2 + w_{rot} ||FK_{rot}(\theta) - R_{target}||^2 + w_{lim} C_{limits}(\theta)\) 其中:$FK_{pos/rot}$ 为正运动学计算的末端位置和姿态。$P_{target}, R_{target}$ 为缩放后的人类参考轨迹。$C_{limits}$ 为关节角度和速度限制的惩罚项。GMR的优势在于其通用性(支持URDF/XML直接导入)和实时性(在标准CPU上可达30-70 FPS),使其成为TWIST等实时遥操作系统的首选方案。

物理约束重定向:PhySINK尽管GMR解决了几何匹配问题,但它不保证生成的动作符合动力学规律(例如,生成的重心轨迹可能导致机器人立即摔倒)。PhySINK(Physically-grounded Shape-adaptive Inverse Kinematics)在PHUMA项目中被提出,旨在解决这一问题.

形状自适应(Shape Adaptation)PhySINK首先优化SMPL人体模型的形状参数 $\beta$,使其在T-pose下尽可能接近目标机器人的几何尺寸。这实际上是在“捏”一个长得像机器人的虚拟人,从而最大限度减少初始的运动学误差。 物理约束注入在IK优化过程中,PhySINK引入了显式的物理约束项:接触约束(Contact Consistency):当检测到人类动作中脚部处于支撑相时,强制机器人的脚部速度和加速度为零,并限制脚底高度接近地面。这消除了“脚滑”和“浮空”伪影。重心(CoM)约束:限制机器人的零力矩点(ZMP)或重心投影位于支撑多边形内,确保静态或动态平衡。对比实验显示,使用PhySINK处理后的数据训练出的策略,其成功率和稳定性显著高于仅使用几何重定向的数据,特别是在复杂地形和高动态动作上.

(The omniretarget)

无重定向与潜空间方法:RoboGhost另一种激进的思路是完全跳过显式的运动重定向步骤,直接在潜空间(Latent Space)进行对齐。RoboGhost(2025)提出了“Retargeting-free”的框架. 核心理念:语义优于几何传统的重定向管线是:$Human Motion \to IK \to Robot Motion \to Tracking Policy$。这一链路中,IK阶段的误差会累积并传导给控制策略。RoboGhost认为,控制策略不需要知道确切的关节角度,只需要理解动作的语义意图(Semantic Intent)。

架构设计运动编码器(Motion Encoder):使用在大规模人类数据集(如AMASS)上预训练的VQ-VAE,将人类动作编码为紧凑的潜变量(Latent Code)。潜空间条件策略(Latent-Conditioned Policy):机器人的控制策略(基于Diffusion Transformer)直接以这些潜变量和自然语言指令作为输入。扩散解码(Diffusion Decoding):策略通过去噪过程,直接从高斯噪声中生成机器人的关节动作,跳过了中间的IK重定向环节.