论文

PoseShield: Neural Collision Fields 用于人体自碰撞解决

PoseShield: Neural Collision Fields 用于人体自碰撞解决

人体姿态估计与运动生成中,基于 SMPL 的网格模型常因极端姿态或随机合成出现自穿透,导致结果物理不真实。本文提出 PoseShield,一种直接在 SMPL 姿态空间定义的神经碰撞约束,将碰撞修正建模为约束优化问题,并与 Eikonal 方程 关联。通过施加 Eikonal 正则化,确保碰撞边界附近梯度非零,提升优化过程的数值稳定性与鲁棒性。 不同于以往在网格空间操作或依赖启发式惩罚的方法,PoseShield 在低维人体姿态空间直接作用,具有理论基础。该约束可扩展至运动序列,作为生成器无关的后处理碰撞修正器,无需重新训练底层运动模型。 在新建的 SMPL 姿态基准上,PoseShield 达到 95.8% 的成功率,显著优于现有基线方法。

论文精读

TL;DR PoseShield 在 SMPL 姿态空间直接学习可微碰撞约束,通过 Eikonal 正则化确保梯度非零,以 95.8% 成功率高效解决人体自碰撞问题。

问题

问题背景

基于 SMPL 参数化人体模型进行姿态估计与运动生成时,自碰撞(身体部件相互穿透)是产生物理可信结果的主要障碍。尤其在极端关节角度或随机运动合成场景下,生成网格频繁出现肩-躯干穿透、手-大腿交叉等不合理形变,严重制约下游应用。

现有方法的局限

现有自碰撞解决方案大多在网格空间操作,存在明显短板:

  • 基于几何检测的方法(如 torch-mesh-isectVolumetricSMPL)计算代价高,且不易与基于梯度的优化框架无缝集成;
  • 启发式惩罚项(例如对穿透顶点施加二次损失)梯度结构差,在碰撞边界附近梯度消失或剧烈震荡,导致优化过程数值不稳定,易陷入局部极小;
  • 可学习的碰撞模型(如 COAP )虽尝试在姿态空间近似碰撞,但缺乏理论保证,训练出的约束场在零碰撞曲面附近梯度可能消失,影响修正成功率。

这些方法本质上将碰撞处理与姿态优化分离,无法提供端到端、稳健且可微的约束,使得运动序列后处理、对抗扰动防御等任务难以直接应用。

为什么该问题重要且困难

人体姿态空间维度高(SMPL 姿态参数 θ 通常 72 维以上),自碰撞边界构成一个高度非凸的复杂子流形。定义一个在该流形上具有非零梯度的可微距离度量,并保证约束优化能稳定收敛至无碰撞姿态,是核心难点。业界对于物理合理、可直接用于游戏/影视/AR 应用的人体运动生成需求强烈,缺少可靠的碰撞修正模块会极大限制生成内容的质量和安全性。

行业类比

类似自动驾驶轨迹规划中的碰撞避免:规划器需要在一个低维控制空间中直接维护一个可微的安全边界(如 Signed Distance Field),而不是在高维点云上反复进行昂贵碰撞检测,从而保证优化过程平滑、可靠且实时高效。

核心洞察

  • 在 SMPL 姿态空间内定义神经碰撞约束,直接将自碰撞校正建模为低维约束优化,避免了传统方法在高维网格空间进行迭代检测、投影或启发式惩罚的耗时与不稳定。与 COAP 或 VolumetricSMPL 等依赖网格表征的方法不同,PoseShield 学习一个从姿态参数到碰撞深度的可微映射,并将碰撞边界隐式编码为神经网络的零水平集,从而在保持高成功率的同时大幅降低了优化变量的维度。
  • 引入 Eikonal 正则化来规范神经碰撞场的梯度,解决了一般可微碰撞约束在边界处梯度消失导致的优化停滞问题。理论上,碰撞指示函数的符号距离梯度应具有单位模长,强制该条件使得优化器在接近碰撞区域时始终获得可靠的方向信号,显著提升了数值鲁棒性。这种从 Eikonal 方程出发的正则化设计,比以往仅使用碰撞惩罚或距离场的启发式方法更可解释且稳定。
  • 所学习的神经碰撞约束独立于运动生成模型,可作为后处理模块直接用于校正整个人体运动序列的自碰撞,无需重新训练底层的生成器。这与许多内嵌在生成模型训练中的碰撞避免技术(如引入物理损失)形成对比,PoseShield 的即插即用特性使其能快速集成到现有运动合成或姿态估计管线中,为工业部署提供了便利,同时保持了对极端姿态和随机合成的鲁棒性。

方法

方法概览:直接作用于姿态空间的神经碰撞约束

PoseShield 的核心思想是将自碰撞解析从网格空间转移到低维 SMPL 姿态空间,学习一个可微分碰撞约束,从而支持高效、鲁棒的优化。

输入与表示
  • 姿态参数 θ ∈ ℝ^{d}(d 为姿态维度,通常 24×3 旋转),作为网络输入。
  • 神经碰撞场 d_SMPL(θ, θ′) 测量两个姿态的碰撞程度,通过一个 MLP 回归得到,目标是在碰撞态输出接近零的值,非碰撞态输出较大正值。
关键模块:可微碰撞约束学习
  1. 数据构建:从 Humans with Collisions (HwC) 数据集获取大量 SMPL 姿态对,包含碰撞/非碰撞标注及穿透深度标签。
  2. 网络设计:使用轻量 MLP 处理姿态向量(经预归一化),直接输出标量碰撞度量 g(θ)。为使梯度行为良好,引入 Eikonal 正则化,强制隐式函数满足 ‖∇_{θ} g‖ ≈ 1 在碰撞边界附近,避免优化时梯度消失。
  3. 训练目标
    • 分类损失(二值交叉熵)区分碰撞与非碰撞。
    • Eikonal 损失 ℒ_E 约束梯度范数。
    • 可选 时序差分变体 ℒ_TD:将网络改造为预测相邻帧间的碰撞变化量 g_t(θ_t, θ_{t+1}),通过监督 Δ penetration depth 学习。实验表明 ℒ_TD 本身已足够。
碰撞修正优化

对于给定碰撞姿态,求解约束最优化问题:

min_{θ} ‖θ - θ_0‖²   s.t.   g(θ) = τ

即将姿态拉向一个带有正裕度 τ 的碰撞边界,使用拉格朗日乘子法迭代,依靠 g 的梯度指引方向。因 Eikonal 约束保证了运动方向与碰撞边界正交,且梯度大小稳定,修正过程快速收敛。

扩展到运动序列

利用训练好的单帧碰撞约束,对每一帧独立优化即可实现序列级的后处理修正,无需修改运动生成模型,做到 generator-agnostic。也可以使用 ℒ_TD 变体融合时序平滑性。

与同类工作的差异

传统方法(如 VolumetricSMPL、COAP)在网格或体素空间检测碰撞后施加启发式惩罚,计算量大且梯度不稳定。PoseShield 是首个直接在 SMPL 姿态空间学习符合 Eikonal 方程的神经碰撞场,将碰撞约束隐含地编码为光滑隐函数,兼具理论保证与工程高效性(单次推理即可得到梯度,无需物理模拟)。

实验

实验设计

作者构建了 Humans with Collisions (HwC) 数据集,包含大量带有自碰撞标注的 SMPL 姿态,用于评估静态姿态碰撞修复能力。实验在 HwC 上对比了四个基线:VolumetricSMPLCOAPtorch-mesh-isect 以及一个基于分类器的碰撞惩罚方法。指标包括 成功率 (Success Rate)平均碰撞顶点深度 (MVD) 等。动态运动序列部分额外测试了 PoseShield 作为后处理修正器的性能,无需微调原始运动生成模型。所有实验均在一台配备单张 NVIDIA GPU 的机器上完成,具体算力未公开。

关键发现

  • PoseShield 在 HwC 上取得 95.8% 的成功率,远高于 mesh 空间基线。
  • Eikonal 正则化 有效解决了碰撞边界梯度消失问题,使优化过程更加稳定,消融研究中移除该正则项后性能显著下降。
  • 时间差分变体 ℒ_TD 已经足够,无需复杂的时间平滑即可处理运动序列的逐帧修正,且能保持帧间一致性。
  • 学习的神经碰撞约束与碰撞深度的相关性实验表明,PoseShield 的内部表示与真实的几何穿透程度高度吻合,解释了其修正能力的来源。

与基线对比的深度解读

相比 VolumetricSMPL 等基于体积表示的 mesh 空间方法,PoseShield 直接在 低维姿态空间 定义约束,避免了反复的顶点坐标转换,计算效率更高且更容易与现有的姿态估计/生成模型集成。与 COAP 等基于启发式惩罚的优化不同,PoseShield 通过 约束优化框架 与 Eikonal 方程 的理论联系,保证了修正过程的数值稳定性和收敛性;而惩罚方法常需要繁琐的权重调整,且在极端姿态下容易失败。分类器基线仅能判断碰撞存在,无法提供用于优化的梯度信号,PoseShield 则能给出可导的碰撞场,更适合梯度下降修正。在运动序列后处理场景下,PoseShield 可在不重新训练的条件下适配不同运动生成器,显示出极强的通用性和即插即用潜力。

行业影响

落地场景

PoseShield 直接作用于 SMPL 姿态空间,提供与生成器无关的后处理碰撞修正器,可集成到各类基于参数化人体模型的应用中。典型场景包括:

  • 运动合成与动画生成:在动作扩散模型(如 MDM、MLD)或 VAE 生成过程中,对随机采样动作进行实时碰撞修正,输出物理可信的人体姿态序列。
  • 虚拟试穿与 AR 试穿:电商或虚拟形象平台中,避免模特在极端动作下产生自穿插,提升可视化真实感。
  • 游戏与影视角色动画:动作捕捉数据后处理,自动修复捕捉噪声导致的自碰撞,减少手动清理工时。

商业价值

PoseShield 通过神经碰撞约束替代传统基于网格的碰撞检测与惩罚,带来三方面价值:

  1. 降本增效:传统碰撞解析需在网格级别迭代碰撞检测与投影,计算开销大且难以并行。PoseShield 在低维姿态空间直接优化,单次推理即可给出修正方向,大幅降低算力需求,适合云端实时服务或移动端轻量应用。
  2. 体验提升:在虚拟试穿、虚拟偶像直播等场景,消除自穿插能显著改善用户视觉体验,减少因渲染瑕疵导致的跳出率。
  3. 生产管线优化:作为后处理模块,无需修改上游动作生成模型,可直接插入现有管线,降低集成成本。

与现有工作流的接口

PoseShield 以姿态向量 θ 为输入,输出碰撞梯度 g(θ),可灵活嵌入优化或投影步骤:

  • 以即插即用模块形式集成:在动作生成推理阶段,对生成的 θ 执行少量牛顿步或梯度下降,利用 g(θ) 调整姿态直至满足碰撞约束。
  • 与物理模拟器配合:在物理模拟的角色控制器中,用 PoseShield 作为约束代价项,确保控制策略输出无自碰撞姿态。
  • 离线数据清洗:对大规模动作捕捉数据库进行批量自碰撞检测与修正,提升数据质量。

具体落地用例

  1. 电商虚拟试穿:用户上传照片生成个性化虚拟模特,试穿衣物时需摆出各种姿势(抬手、转身等)。集成 PoseShield 后,即使姿态生成模型输出带有轻微自碰撞的动作,也能在渲染前自动修正,避免手臂穿过身体等不真实画面,提升用户信任度与转化率。
  2. 健身教学与运动分析 App:应用需要将教练的示范动作映射到用户骨骼模型上,当用户做出复杂扭转动作时,模型可能出现自穿插。PoseShield 可作为后处理层,保证教学视频中的虚拟教练无视觉缺陷,同时维持动作准确性。

此类场景中,PoseShield 的轻量级约束和独立于生成模型的设计使其成为低风险、高回报的中间件,适用于任何依赖 SMPL 的实时交互系统。

局限

  • **理论假设与实际存在差距**:方法依赖 Eikonal 方程来保证碰撞边界梯度不消失,但附录 C 明确指出在实际训练中近似 Eikonal 假设可能失效,导致梯度场不精确;同时平滑性、可行性一致性等假设也难以严格满足,这会在极端姿态或数据分布外场景下削弱优化过程的数值稳定性与收敛性。
  • **评估基准的局限性**:实验仅在自建的 Humans with Collisions (HwC) 数据集上进行,该数据集基于 SMPL 参数化生成,缺乏真实扫描或穿着衣物的例子,且碰撞标签依赖固定阈值,可能无法充分反映现实应用中的人体网格多样性(如不同体型、衣物、软组织变形),泛化到复杂数据的能力有待进一步验证。
  • **扩展到非 SMPL 模型困难**:碰撞约束严格定义在 SMPL 的低维姿态空间,依赖骨骼参数和蒙皮函数,因此难以直接迁移到其他参数化人体模型(如 STAR、GHUM)或处理人体与物体的碰撞,限制了方法在更通用场景下的适用性;此外,对运动序列的帧间独立优化可能引入抖动,需要额外后处理。
论文Zhengyuan Li2026-06-29原文

相关内容