HumanTracker: 面向全面且与人类感知一致的运动跟踪基准
人体运动跟踪是遥操作和全身模仿学习的核心,但现有评估往往与人类在视频中的感知不一致。运动学误差(如每个关节的平均位置误差)虽然能反映逐帧姿态差异,却忽略了更关键的物理伪影,例如支撑不稳定、接触错误(如脚部滑动、触地时机不当)。同时,现有测试集规模小,缺乏对接触密集、长时程行为进行压力测试所需的多样性。 为此,我们提出 HumanTracker,旨在使人形运动跟踪评估兼具感知对齐性与可扩展性。该基准包含约 153 小时 来自多位专业表演者的光学运动轨迹,分为 4 类运动族,并附有文本标签,支持细粒度诊断。进一步,我们提出 HumanScore,一种基于 12K 运动对(含 24K 段运动) 训练出的偏好对齐指标。 在多个代表性 SOTA 跟踪器上的实验表明,HumanScore 能更好地预测人类偏好,并揭示运动学指标常忽略的接触与稳定性失败。
论文精读
TL;DR HumanTracker 构建了约 153 小时运动轨迹基准和基于 1.2 万对偏好数据训练的 HumanScore 指标,使 humanoid 运动跟踪评估更贴近人类感知,有效捕捉脚滑、接触时机不当等物理失效。
问题
人形机器人运动跟踪 在遥操作与全身模仿中至关重要,但现有评估指标常与人类视觉感知相悖。标准做法是计算 kinematic errors,如 MPJPE 或关节角度误差,逐帧平均姿态差异,存在以下局限:
- 忽略物理伪影:脚滑动、触地时机错误、支撑不稳定。
- 测试集规模小、动作类型单一,难以覆盖接触丰富、长时程行为。
因此,高 kinematic score 未必对应高感知质量,甚至可能掩盖真实性能缺陷。该问题难在:接触与稳定性需物理合理性判断,传统几何度量无法表达;构建偏好对齐指标需大规模人工标注。业界对可扩展、感知对齐的基准需求迫切,否则错误指标会误导策略优化方向。
类似文本生成中 BLEU 指标高但语义混乱,需引入奖励模型对齐人类偏好。
核心洞察
- HumanTracker 的关键洞察是将人形机器人运动跟踪评估从纯运动学误差转向物理接触与稳定性。传统 MPJPE 等指标逐帧平均关节位置差,忽略了脚底滑动、接触时机错误等人类感知中最重要的伪影。HumanScore 通过在 12K 人类偏好对上训练偏好模型,直接从视觉轨迹中学习接触和稳定性特征,无需手工设计繁复的物理规则。这一方法不仅与人类偏好更一致,还能揭示运动学指标完全遗漏的失败模式,为运动跟踪和模仿学习提供了更可靠的奖励信号。
- 另一个核心洞察是评估基准的规模与多样性决定了指标的有效性。现有测试集通常规模小、运动类型单一,难以暴露接触丰富、长时程行为中的真实失败。HumanTracker 构建了约 153 小时的多表演者光学运动轨迹,涵盖四个运动家族并配有文本标签,支持细粒度诊断。这种设计使得评估不再是简单的平均分数,而是能够定位特定运动模式下的失败原因。与小型基准相比,大规模多样化的数据也让偏好模型训练成为可能,为后续开发更鲁棒的跟踪策略提供了反馈基础。
方法
输入:HumanTracker 基准提供参考运动轨迹与文本标签,评估对象为 humanoid 跟踪器生成的 rollout 序列。
关键模块:
- 基准构建:采集约 153 小时光学运动数据,来自多位专业表演者,按四个运动家族组织,每个片段附文本标签用于细粒度诊断。
- 偏好数据构建:从跟踪器 rollout 中切分片段,对同一参考运动采样不同跟踪器输出,构造配对比较;采用均匀采样保证接触丰富、长时程行为覆盖,人工标注偏好,划分训练 / 测试集。
- HumanScore 模型:对轨迹提取帧级特征作为输入表示,通过偏好目标训练奖励模型,使模型输出与人类偏好一致。该模型不是逐帧累积姿态差,而是学习整体运动质量。
输出:给定参考运动与跟踪结果,HumanScore 输出偏好对齐分数,用于评估接触稳定性、足部滑动、着地时机等 physical artifacts。
与同类方法差异:HumanScore 不是手工设计的运动学指标,而是从 12K 成对偏好数据中学习感知质量,因此能捕捉纯运动学误差忽略的接触与稳定性失败。
实验
实验设计
- 构建 HumanTracker 基准:约 153 小时光学运动轨迹,来自多位专业表演者,分为四个运动家族,带文本标签用于细粒度诊断。
- 收集 12K 运动对(24K 运动段)作为偏好数据,训练 HumanScore 偏好对齐度量。
- 评估在代表性 SOTA tracker 上进行,对比运动学指标与 HumanScore。
关键发现
- HumanScore 在预测人类偏好方面优于传统运动学指标(如逐帧姿态误差)。
- 成功揭示接触与稳定性失败(脚部滑动、触地时机错误),这些是运动学指标常忽略的物理伪影。
- 基准规模与多样性足以覆盖接触密集、长时程行为,为细粒度诊断提供基础。
与基线对比解读
运动学误差通过平均每帧姿态差异计算,无法捕捉支撑不稳定和错误接触等高阶语义。HumanScore 通过偏好对齐学习人类判断,对物理伪影更敏感。因此,在评估 SOTA tracker 时,HumanScore 的排序结果与人类感知更一致,而运动学指标可能产生误导性结论,忽略关键失败模式。
行业影响
落地场景
HumanTracker 直接服务人形机器人运动跟踪算法研发与产品验收。典型落地场景:
- 遥操作平台:评估从人类动作到机器人执行的映射质量,减少脚底打滑、接触错误。
- 全身模仿与仿真训练:在 Isaac Gym 等环境中快速筛选高质量 rollout,加速策略迭代。
- 动作内容生产:视频、游戏或虚拟人驱动中,自动筛选自然、接触稳定的动作片段。
商业价值
传统评估依赖人工逐帧审查,成本高且主观。HumanScore 作为偏好对齐的自动指标,能更好预测人类感知质量,直接降低 QA 人力成本;同时捕捉 kinematic 指标漏掉的物理伪影,提升产品力。对提供人形机器人解决方案的公司,可将其作为第三方客观分数,增强客户信任,缩短交付周期。
与现有产品/工作流接口
HumanTracker 以 Python 库形式发布(GitHub),可无缝集成到基于 PyTorch 的训练循环中。运动轨迹支持常见格式,可作为评估回调在训练过程中定期计算 HumanScore。与 Isaac Gym、MuJoCo 等仿真器配合,用于 checkpoint 筛选和超参数优化。也可嵌入数据标注平台,辅助动作数据质量管控。
局限
- **HumanTracker** 基准的数据采集自多名专业表演者,动作质量高但风格偏向表演性,对日常操作、非结构化环境中的接触恢复、异常步态等覆盖有限。虽然划分了四个运动家族并提供文本标签,但标签粒度较粗,难以针对足底滑动、接触时序偏差等细粒度缺陷进行精确归因。实际部署时机器人常面临地面摩擦变化、负载扰动等分布外场景,当前基准未注入相应仿真变体或噪声,**HumanTracker** 在真实世界任务中的代表性仍有待验证。
- **HumanScore** 的偏好训练仅使用 12K 运动对,规模相对较小,且偏好标注依赖人类主观判断,存在标注者间不一致与个体偏差。模型可能过拟合特定标注群体的审美或某些动作类别,导致在未见运动分布上预测失准。论文未报告跨数据集、跨仿真器或不同机器人形态的泛化实验,**HumanScore** 能否稳定迁移到其他跟踪器或真机视觉反馈场景尚不明确,这限制了其作为通用评估指标的可靠性。
- 该工作主要在仿真环境中验证,**HumanScore** 的轨迹表示与偏好目标是否与真实机器人感知质量一致未经验证。运动学指标虽然不完美但计算廉价、可微分,**HumanScore** 的计算成本可能较高,难以直接嵌入在线训练循环作为奖励信号。此外,基准发布格式虽开放,但缺少对动作序列长度、接触事件密度等关键因素的消融分析,导致对指标敏感性和适用边界的理解不够全面。