【科研案例】具有场景交互的接触提示通用人形全身跟踪
2026-07-30

一、引言:当“空中跳舞”的机器人需要“脚踏实地”

过去两年,人形机器人运动跟踪(Motion Tracking)领域经历了爆发式增长。从DeepMimic到SONIC、BeyondMimic、TWIST,基于强化学习(RL)的通用运动跟踪策略已经能够让人形机器人在自由空间中完成行走、奔跑、舞蹈甚至踢腿等复杂动作。这些工作的核心逻辑是:给定一条参考运动轨迹,策略尽可能准确地跟踪其运动学姿态。

然而,一个被有意无意回避的"房间里的大象"是:真实世界的物理智能几乎不可能脱离接触(Contact)。家庭机器人需要搬起洗衣篮、爬楼梯保持平衡、将重物放置在台面上;工业场景中的人形机器人需要操作工具、跨越障碍物、在不平整地面上稳定作业。这些任务的共同特征是接触丰富(Contact-Rich)——机器人必须与环境中的物体和地形产生持续、有力的物理交互,而非仅仅在自由空间中摆出漂亮姿势。

当前主流的运动跟踪策略一旦遇到这些场景,性能会断崖式下跌。原因很深刻:纯运动学跟踪无法解决物理歧义(Physical Ambiguity)。当你的手腕运动到箱子两侧时,系统无法判断你是想"轻轻扶一下"、"摸索位置"还是"用力搬起";当你的脚面接近台阶边缘时,运动学也无法告诉你是要"踩上去借力"还是"跨过去避让"。接触力的大小、方向和时序,是运动学信号的天然盲区。

562f3ddc38d98524e136a21d51ade287.png

图1:SceneBot用单一策略实现自由空间运动、地形穿越与全身操作的统一。图源:论文Figure 1


二、核心创新:接触标签(Contact Labels)作为新的控制接口

SceneBot的核心洞察非常简洁,却极具工程智慧:既然力无法直接从运动学推断,那就把"期望的接触行为"显式地作为控制指令输入给策略。

具体而言,SceneBot在传统的运动学参考轨迹之外,引入了一个接触标签(Contact Labels) ct∈{0,1}n 。这是一个二进制向量,明确定义了在每一时刻,机器人的哪些关键连杆(Key Links:左右腕、左右脚、骨盆)应该与哪类场景元素(地形 Terrain / 物体 Object)建立接触。

  • cti,j=1 :表示连杆 i 应当主动与场景类型 j 发生接触

  • cti,j=0 :表示无此接触期望

这种设计的精妙之处在于定位的克制。SceneBot没有试图变成一个视觉-语言-动作(VLA)大模型,也没有去感知场景中"哪个具体物体是箱子";它仍然是一个低层运动跟踪策略,只是多接收了一条关于"身体如何与世界互动"的指令。这保持了策略的通用性和简洁性,同时让高层规划器(可以是视觉系统、人机交互接口或任务规划器)拥有了一个极其强大的控制抓手:通过调度接触标签,高层模块可以精确指挥机器人何时何地与世界互动。

dc12f2683090a91ee6899e034cbcf197.png

图2:场景交互图(Scene Interaction Graph)捕捉机器人与场景的时间性交互关系。橙色为机器人节点,蓝色为场景节点。图源:论文Figure 3

三、破解数据瓶颈:事后场景重建(Hindsight Scene Reconstruction)

如果说接触标签是SceneBot的"控制接口创新",那么事后场景重建就是其"数据引擎创新"——这也是我认为这项工作最具行业价值的部分。

训练一个接触感知的控制器,需要成对数据:机器人运动 + 场景几何 + 接触标注。然而,现有的大规模人体运动数据集(如AMASS、Bones、OMOMO、Lafan)几乎只包含裸人体运动,缺乏场景上下文。标注场景交互是极度昂贵且不可扩展的。

SceneBot的解决方案是从运动反推场景:

  1. 运动重定向:将人体运动重定向到机器人骨架(使用现有方法)

  2. 构建场景交互图:分析重定向后的机器人运动,识别关键连杆在何时何地表现出低相对速度和低加速度(这是接触的物理线索),从而构建机器人-场景交互图

  3. 剪枝不可行边:剔除会导致碰撞或违反力闭合(Force-Closure)约束的虚假接触

  4. 重建场景资产

  5. 地形:基于接触点生成2.5D高程图,合并相近高度的孤立平台,雕刻出可行区域

  6. 物体:基于抓取动作生成与机器人接触面平行的板状几何,计算物体中心轨迹

  7. bcd8df99955daa8a207806b1ae702144.png

图3:SceneBot框架总览。上:从人体运动重建场景资产;左下:RL训练接触感知策略;右下:基于SuperOdometry和IMU的无基础设施部署。图源:论文Figure 2

这一思路与2022年Transformer Inertial Poser的地形生成有相似之处,但SceneBot将其扩展到了完整的物体操作和地形穿越,并形成了闭环的训练数据管线。更重要的是,重建的场景优先保证"支持机器人运动的可行性",而非忠实于原始采集场景。这避免了传统场景感知重定向(Scene-Aware Retargeting)中常见的"物体-手不匹配"和"穿透-避碰"困境——实验表明,基于重建场景训练的策略,其成功率(95% vs 15%)和跟踪误差均显著优于基于OmniRetarget的基线。


四、训练策略:非对称奖励与接触物理

SceneBot使用PPO训练统一的全身控制策略。其奖励设计体现了对接触物理的深刻理解:

1. 非对称接触正确性奖励(Asymmetric Contact Correctness Reward)

rcr=∑i(cdes,ti,j≡cactual,ti,j),if cdes,ti,j=1

关键细节在于只在期望接触为1时才评估。这意味着:如果策略意外碰到了地面(如脚滑),不会受到惩罚;但如果策略应该在抓箱子却没有抓,则会被扣分。这种设计允许策略利用未标注的接触事件(如自然的脚-地接触),同时严格遵循显式指令。

2. 接触持续时间奖励(Contact Duration Reward)

rdr=∑imin(tci,j,0.5)

鼓励稳定接触,但上限0.5秒防止机器人"粘"在物体上拒绝释放。这对于楼梯攀爬等需要持续支撑的场景至关重要。

3. 接触失配终止(Contact-Mismatch Termination)

对于抓取任务,如果在规定时间内未建立期望接触,episode会终止。这强制策略快速响应接触指令,避免优柔寡断。

4. "魔法力"(Magic Force)的实用主义

由于重建的物体初始状态可能不物理稳定(例如箱子悬浮在空中),训练初期对物体施加一个启发式稳定力,使其跟随重建轨迹,直到机器人建立稳定的力闭合抓取。这是一种课程学习的变体,有效避免了早期训练中的频繁失败。


五、无基础设施部署:200Hz状态估计的传感器融合艺术

论文中另一个容易被忽视但极具工程价值的贡献是完全无外部动捕(Mocap-Free)的真实世界部署。

团队使用Unitree G1机器人,仅依赖机载传感器(头部LiDAR + 骨盆IMU)实现200Hz状态估计:

  • SuperOdometry:处理LiDAR和头部IMU,提供全局位置、线速度和偏航角估计

  • 骨盆IMU:直接计算俯仰(Pitch)和横滚(Roll)。这是关键洞察——头部IMU在剧烈运动中无法代表躯干动力学,而骨盆更接近质心

  • 卡尔曼滤波:融合骨盆IMU的偏航角速度与SuperOdometry的偏航角

  • 高度初始化:利用重力对齐LiDAR扫描中最低5%的点估计地面高度

在与OptiTrack动捕的对比中,该系统实现了平均位置误差0.032m、姿态误差0.018rad、线速度误差0.092m/s,在10次真实世界实验中达到80%的任务成功率。对于同时涉及蹲下取物和登台的复杂动作,这一精度足以支撑稳定的全身控制。

55d83c3c54a9b8402f965a2793ca7f10.png

图4:左:状态估计轨迹(黄)与动捕真值(蓝)对比;中:点云可视化;右:真实世界部署。图源:论文Figure 9


六、实验结果:一策统御万物

SceneBot在MuJoCo中的对比实验堪称"降维打击"。在与当前SOTA通用运动跟踪策略SONIC的对比中:

任务类型

SceneBot

SONIC

自由空间

100%

100%

物体交互

95%

5%

地形穿越

100%

15%

坐下任务

100%

0%

自由空间运动:两者持平(成功率100%),证明SceneBot没有牺牲基础能力

物体交互:SONIC成功率仅5%,SceneBot达到95%

地形穿越:SONIC成功率仅15%,SceneBot达到100%

坐下任务:SONIC完全失败(0%),SceneBot成功率100%

消融实验进一步验证了关键设计的必要性:

全局根状态(Global Root State):移除后地形任务成功率从100%暴跌至45%,因为局部跟踪会导致运动-地形错位(Drift)

接触标签:移除脚部接触标签后地形成功率降至60%;移除手部接触标签后物体抓取成功率接近0%

重建 vs 重定向:在OMOMO数据集上,重建场景的成功率(95%)远超OmniRetarget(15%)

2b03caff389aef1e51ffc136c9d1ccbf.png

图5:SceneBot与基线在不同任务上的跟踪误差(指数缩放,面积越大越好)和成功率对比。图源:论文Figure

b3f2e7fd50c65a30cd4e7ad93a2e8100.png

图6:左:OmniRetarget导致的手-物不匹配;右:重建场景在成功率、位置/姿态误差上全面优于重定向。图源:论文Figure 8


七、行业洞察:为什么SceneBot值得高度关注?

作为长期关注具身智能的从业者,我认为SceneBot的价值超越了单篇论文的技术贡献,它指向了几个行业级趋势:

1. 从"避碰"到"用触"的范式转移

传统机器人学将接触视为需要最小化或避免的"扰动",而SceneBot(以及同期的WoCoCo、CHIP等工作)证明,接触是完成复杂任务的必要资源。将接触显式建模为控制接口,而非隐式地希望策略自行领悟,这是从"控制论"走向"物理智能"的关键一步。

2. 数据瓶颈的破局思路

人形机器人RL面临的最大挑战之一是数据稀缺。SceneBot的"事后重建"提供了一种反事实数据生成(Counterfactual Data Generation)的范式:不需要昂贵的场景-运动同步采集,只需要从现有运动数据反推合理的物理场景。这对于利用AMASS等海量无场景人体运动数据具有重大意义。

3. 低层策略的"能力边界"问题

SceneBot刻意保持低层策略定位,不处理高层视觉感知。这引发了一个值得深思的问题:在VLA(Vision-Language-Action)大模型日益主导人形机器人控制的今天,低层运动控制器的通用性边界在哪里? SceneBot的答案很明确:低层控制器应该负责"如何精准地与世界互动",而高层负责"何时何地互动"。这种分层接口可能是未来人形系统架构的常态。

4. 局限性与未来方向

论文坦诚地指出了局限:重建质量高度依赖重定向运动的保真度,对脚部滑动(Foot Sliding)等伪影敏感;对从视频或生成模型提取的物理不一致运动鲁棒性有限。此外,当前工作仍依赖重建的"抽象场景资产"(板状物体、2.5D地形),与真实世界的复杂三维场景还有距离。

未来的关键方向包括:

  • 与实时感知结合,实现真正的"在线"场景交互(而非依赖预重建资产)

  • 将接触标签接口扩展到更细粒度的力/力矩控制

  • 利用生成式模型(如视频扩散模型)直接生成带接触标注的运动-场景对


八、结语

SceneBot不是第一个让人形机器人接触世界的系统,但它是第一个用单一策略统一自由空间运动、地形穿越和全身操作,并给出可扩展数据管线的框架。它证明了:接触条件(Contact Conditioning)是连接运动学参考与物理现实的桥梁。

在具身智能的竞赛中,"让机器人动起来"已经不再是主要瓶颈,"让机器人与世界有力、稳定、协调地互动"才是下一个主战场。SceneBot为这场战役提供了一套兼具理论优雅与工程实用性的武器——而且代码和数据即将开源。


论文:SceneBot: Contact-Prompted General Humanoid Whole Body Tracking with Scene-Interaction (arXiv:2606.27581)
作者:Sirui Chen, Jiaman Li, Shibo Zhao, Guanya Shi, Zhen Wu, C. Karen Liu
项目主页
https://ericcsr.github.io/scenebot/

Donghu Robot Laboratory, 2nd Floor, Baogu Innovation and Entrepreneurship Center,Wuhan City,Hubei Province,China Tel:027-87522899,027-87522877

合作与咨询

商务合作:18062020215

销售咨询:18062020221

服务热线:027-87522899

网站备案号:鄂ICP备17004685号-1 | 技术支持 | 联系我们 | 服务条款与隐私权 | 网站地图