
一、问题的本质:为什么机器人"学动作"这么难?
人形机器人已经能跑、能跳、能后空翻,但每学会一个新动作,背后往往是数周甚至数月的奖励函数调参。传统强化学习(RL)范式存在一个根本性矛盾:
运动生成层(Kinematic Planner)负责产出漂亮的参考轨迹;
跟踪控制层(Tracking Controller)负责让机器人物理上执行这些轨迹。
这两个模块分离训练、分离优化,导致一个致命问题:即使运动生成层产出了"看起来对"的轨迹,跟踪控制器也可能因为动力学约束(力矩限制、摩擦、惯性)而无法复现,最终机器人摔倒或动作变形。

图 1:MuGen 系统架构。教师策略利用特权信息(全局状态+参考运动)构建 VQ 技能码本;学生策略仅依赖机载感知,通过共享码本蒸馏教师知识,实现可部署的生成式控制。
北京大学图形学与视觉计算团队提出的 MuGen(Multi-Skill Generative Locomotion Controller),用一套端到端的生成式控制框架打破了这一僵局。它的核心思想非常直接:不再把运动生成和机器人控制分开,而是让机器人直接在物理仿真中"内化"人类运动的结构化潜空间,让技能嵌入(Skill Embedding)本身具备动力学可行性。
MuGen 的架构可以概括为三个关键词:VQ-VAE、基于模型的强化学习(MBRL)、教师-学生蒸馏。
传统模仿学习(IL)通常用 MLP 或 VAE 将参考运动映射到动作。但 MLP 缺乏结构化表示,VAE 的连续高斯先验则难以捕捉人类运动的多模态特性(例如走路和跑步的关节角度分布往往是双峰甚至多峰的)。
MuGen 采用 VQ-VAE(Vector-Quantized VAE):
Encoder:将当前状态 + 参考运动编码为连续潜变量 z ;
VQ 瓶颈:通过最近邻搜索,将 z 量化到离散的码本条目 z^∈B ;
Decoder:根据量化后的技能码 z^ 和当前状态,输出目标关节位置。

图 2:不同模型设计的训练奖励曲线(上)与生存时间曲线(下)。MuGen(VQ w/ history,红色)在第三阶段蒸馏后迅速收敛,且生存时间稳定。去掉平滑过渡机制(紫色)导致性能骤降。
这个离散码本 B 就是 MuGen 的技能字典——每个条目代表一个"运动基元"(Locomotion Primitive),如"左脚支撑期"、"跑步推进期"、"蹲伏步态"等。由于码本是跨样本共享的,模型被强制复用这些基元,从而实现了:
结构化:运动不再是黑盒映射,而是可解释的技能组合;
压缩性:数小时的人类运动数据被压缩为紧凑的离散字典;
生成性:采样不同的码本索引即可合成新运动。
如果仅做标准的 VQ-VAE 重建,模型学到的只是运动学相似性,完全不考虑机器人的动力学约束。MuGen 的关键创新在于:将 VQ-VAE 的训练嵌入到基于模型的强化学习(MBRL)循环中。
具体而言,团队训练了一个可微分世界模型(Differentiable World Model) W :
输入:当前状态 st + 动作 at (目标关节位置);
输出:预测的下一状态 st+1W ;
训练目标:最小化与仿真器真实下一状态 st+1sim 的 L1 误差。

图 3:学生策略仅依赖本体感知(proprioception),通过先验编码器 E^ 从 VQ 码本中采样技能,自主生成平滑且多样的行为——走路、跑步、蹲伏、转向,无需任何参考运动。
在训练教师策略时,MuGen 不再使用高方差的无模型 RL(如 PPO),而是利用世界模型的可微性,通过反向传播穿越预测轨迹直接优化策略参数:
θminEs0,at∼πθ,st+1∼W[t=0∑∞γtL(st,at,gt)]
这意味着:每一个技能码本条目在创建时,都必须通过世界模型的"物理考试"——如果某个码本导致预测状态偏离参考运动太远,或者产生不稳定动力学,梯度会直接修正 Encoder 和码本条目。
教师策略在训练时享有特权信息(全局身体位姿、全局速度、参考运动完整序列),这在仿真中可行,但真机部署时无法获取。因此 MuGen 引入学生策略,仅依赖机载感知(投影重力、角速度、关节位置/速度)。
蒸馏过程采用了一种渐进式 DAgger 风格策略:
阶段 1(Pretraining):仅训练教师策略 + 世界模型,构建码本;
阶段 2(Warming Up):教师和学生同时训练,但 rollout 仍由教师执行;
阶段 3(Distillation):教师与码本冻结,学生在每个时间步以概率 P 接管控制,P 从 1 线性退火至 0。
这种同轨迹内混合(Mix-within-Trajectory)机制,避免了传统 DAgger 中分布偏移导致的训练崩溃——当学生犯错时,教师可以立即在同一轨迹中"扶一把"。
MuGen 在 NVIDIA IsaacGym 中训练,使用 LaFAN1 数据集的一个约 1 小时子集(走路、跑步、走跑转换), retargeted 到 Unitree G1(23-DoF,35kg,1.32m)。Sim-to-Real 通过域随机化实现(摩擦、躯干负载、PD增益缩放、观测噪声)。
| 测试场景 | 结果 |
| 长程循环行走(手工拼接) | 稳定跟踪 |
| 舞蹈动作(训练集外) | 成功跟踪,保持平衡 |
| 蹲伏行走 | 仿真与真机均成功 |
图 4:MuGen 在仿真中跟踪多样化运动。(a) 长程循环行走;(b) 舞蹈;(c-d) 跑步与蹲伏行走的俯视图轨迹;(e-f) 真机 G1 部署的走路与蹲伏走。
MuGen 最令人惊喜的能力是生成式控制。在部署后,团队冻结所有组件,新增一个先验编码器(Prior Encoder) E^ :
输入:仅本体感知 st (无参考运动);
输出:码本索引的概率分布;
训练:用教师策略跟踪随机参考运动时产生的码本索引作为标签,进行监督学习。
组合 E^+冻结码本+学生 Decoder 后,机器人可以自主生成走路、跑步、蹲伏、转向等行为的平滑过渡,无需任何外部运动指令。这证明了 VQ 码本已经内化了足够丰富的、动力学可行的运动模式。
在约 200 秒走路数据 + 90 秒测试数据上,团队对比了三种架构:
| 模型 | 训练集生存率 | 测试集生存率 | 测试集关节旋转误差(rad) | 测试集速度误差 |
| MLP 基线 | 90.8% | 60.7% | 0.0996 | 0.4832 |
| VAE(连续潜空间) | 64.9% | 51.5% | 0.1094 | 0.4359 |
| VQ(MuGen,无历史) | 80.7% | 72.8% | 0.1108 | 0.4686 |
| MuGen(完整) | 88.2% | 95.4% | 0.0927 | 0.3652 |
表 1:消融实验结果。VQ 离散嵌入在 unseen 运动上的泛化能力显著优于 MLP 和 VAE。加入 5 帧历史观测后,性能进一步提升。
关键发现:
MLP 严重过拟合:训练集表现好,测试集生存率暴跌至 60.7%;
VAE 连续空间反而更差:高斯先验假设与人类运动的多模态分布不匹配;
VQ 离散化是正则化:强制复用码本条目,防止记忆训练轨迹, unseen 生存率提升至 95.4%;
历史观测的"甜点":5 帧历史最优,过多历史反而引入噪声。
四、真机部署:G1 上的"走路"与"蹲伏走"
MuGen 在 Unitree G1 上进行了真机验证:
策略频率:30 Hz 生成目标关节位置;
底层控制:500 Hz PD 控制器跟踪;
安全处理:由于 G1 默认站立姿态与参考运动首帧差异较大,部署时采用线性插值启动,避免冲击。
真机成功执行了直线行走和蹲伏行走两种运动。虽然当前真机演示的动作相对保守(以安全为首要考虑),但这验证了整个 Sim-to-Real 管路的可行性。
作为具身智能从业者,我认为 MuGen 在以下方面提供了重要启示:
MuGen 最大的贡献是证明了:VQ 离散化不仅是一种压缩手段,更是一种"物理正则化"手段。当每个码本条目都必须通过可微分世界模型的动力学检验时,学到的技能空间天然具备动态可行性。这与当前流行的"先学运动学、再学跟踪"的分离范式形成鲜明对比。
对于数据稀缺的人形机器人领域,这意味着少量人类动捕数据(1小时级别)即可通过 MBRL 蒸馏出可部署的生成式控制器,无需为每个新动作重新设计奖励函数。
论文坦诚地指出了三个关键局限:
站立困难:VQ 码本主要训练于运动丰富的序列,静态/准静态姿态的嵌入表示不足,导致策略在站立时会出现"shuffle"式抖动——这类似于 LLM 中"长文本生成"与"短文本精确控制"的权衡。
世界模型精度天花板:当前世界模型是简单 MLP,未显式建模环境交互(如接触力),限制了教师策略在复杂地形上的性能上限。
Sim-to-Real 仅依赖域随机化:尚未引入在线系统辨识或真实世界微调,部署稳定性仍有提升空间。
MuGen 的生成式框架为后续工作打开了想象空间:
视觉接口:用视觉编码器替代参考运动输入,实现"看人类做、机器人学"的端到端模仿;
语言接口:类似 GPT 的文本到技能序列映射,实现"prompt-driven"的人形运动生成;
世界模型升级:引入结构化动力学(如接触模型、刚体物理)或不确定性建模,提升复杂地形泛化。
结语
MuGen 的发表,标志着生成式运动控制正在从"大规模预训练+无模型RL"的蛮力模式,转向"结构化潜空间+基于模型的物理优化"的精巧模式。它用 VQ-VAE 的离散码本为人类运动建立了"肌肉记忆"的字典,用 MBRL 确保每个记忆片段都经得起物理检验,再用教师-学生蒸馏将这些记忆迁移到机载感知可及的部署策略中。
对于正在探索如何用有限数据让人形机器人掌握丰富运动技能的团队而言,MuGen 提供了一条低数据门槛、高物理一致性、可生成扩展的技术路径。当机器人不再只是"跟踪参考轨迹的机器",而是拥有"自主组合运动基元"的生成式大脑时,它们离真正融入人类生活,又近了一步。
作者团队:北京大学(Yusen Feng, Xiang Wang, Heyuan Yao, Libin Liu, Baoquan Chen 等)
论文:arXiv:2605.24592 (2026.05)
项目类型:数据驱动的多技能生成式运动控制器
Donghu Robot Laboratory, 2nd Floor, Baogu Innovation and Entrepreneurship Center,Wuhan City,Hubei Province,China
Tel:027-87522899,027-87522877