PhyGenHOI: 物理感知的动态人-物交互4D生成
我们研究生成物理精确且视觉真实的4D人-物交互(HOI)任务。给定静态3D人体和目标物体(表示为3D高斯泼溅),目标是合成动态场景:人体根据输入文本执行动作(如击打或踢)与物体互动。为此,我们提出PhyGenHOI框架,将生成式人体运动与显式物理物体模拟耦合。 我们将人体建模为语义智能体,由运动扩散模型驱动;物体建模为物理智能体,通过物质点法模拟,使用3D高斯作为统一可微表示。通过三种耦合机制监督交互: 1. 窗口化吸引损失:时间上同步生成运动以拦截物体; 2. 接触驱动重模拟:冲击时触发物理一致的动量传递; 3. 掩码视频SDS:注入视频先验增强接触保真度。 实验表明,PhyGenHOI能生成物理一致的4D HOI,涵盖多种动作、人体和物体,性能优于基线。项目页面和视频:https://omerbenishu.github.io/PhyGenHOI/
论文精读
TL;DR PhyGenHOI 将人体运动扩散模型与物质点法物理仿真耦合,生成物理一致且视觉逼真的 4D 人-物交互动态场景。
问题
问题背景
4D 动态场景生成正从单纯的人体运动合成走向人-物交互 (HOI) 的联合建模。业界关注点已从“人动得是否自然”升级为“人与物接触时是否因果合理”,尤其在高保真视觉与物理一致性之间取得平衡。
现有方法局限
当前主流方案多采用数据驱动的生成模型(如 Motion Diffusion Model、视频扩散先验),缺乏显式物理约束,导致交互中经常出现穿透、漂浮、动量不守恒等失真。仅靠碰撞代理或后处理修复无法保证运动因果链的完整性。部分工作引入物理模拟,但往往将人体视为运动学实体、物体独立仿真,未在接触瞬间耦合动量传递;或者使用非可微模拟器,难以与生成梯度协同优化,限制了端到端调优。
技术挑战与业界关注
核心难点在于同步解决三个耦合问题:
- 生成人体运动需在时间窗口内准确拦截物体,避免时序错位;
- 接触瞬间必须实现可微的动量重分配,确保物理状态(速度、形变)前后一致;
- 优化目标需同时兼顾视觉真实感与物理合理性,二者梯度可能冲突。
在动画制作、游戏物理引擎、VR 训练环境等应用中,物理不一致会严重破坏临场感,因此该问题具有高商业价值与技术壁垒。
行业类比
这好比自动驾驶中轨迹预测与控制的联合优化:不仅要规划出符合语义的路径,还需保证车辆动力学约束被遵守,任何碰撞后的状态演化都必须符合牛顿力学。
核心洞察
- PhyGenHOI 的核心创新在于将人体作为**语义代理**(由 Motion Diffusion Model 驱动)与物体作为**物理代理**(由 Material Point Method 模拟)耦合,并通过统一的 3D Gaussian 表示实现可微交互。与纯生成式方法(如仅用扩散模型合成人体运动)或纯物理仿真方法(需手工设计控制器)相比,这种**生成-物理混合范式**首次让人体运动具备语义自由度,同时保证物体响应严格遵循牛顿力学,避免了以往工作中物体运动违背物理常识的失真。
- 该框架通过三个时序耦合机制解决接触时刻的物理一致性难题:**Windowed Attraction Loss** 让人体运动及时趋向物体,**Contact-Driven Re-simulation** 在碰撞瞬间注入动量,**Masked Video-SDS** 利用视频先验增强接触细节。相较于只使用单一接触损失或事后物理校正的基线,这套**多阶段耦合策略**精确捕捉了碰撞产生的动量传递和瞬时形变,而不是简单地将人体与物体轨迹拼接,显著提升了交互的真实感和物理可信度。
方法
PhyGenHOI 以静态 3D 人体与物体(均用 3D Gaussian Splats (3DGS) 表示)及文本动作描述为输入,输出物理一致且视觉逼真的 4D 人-物交互序列。整体架构遵循“语义人体代理 + 物理物体代理 + 多粒度交互监督”的设计思路。
统一可微场景表示
人体与物体均表示为 3D Gaussians,形成统一的显式可微表示。这避免了不同模态的表示鸿沟,让生成过程可以直接通过梯度优化。
人体运动合成
人体被视为语义代理,由预训练的 Motion Diffusion Model (MDM) 生成粗粒度的骨骼运动序列。MDM 根据文本提示生成多样化的运动轨迹,但此阶段不考虑与物体的相互作用,仅提供意图层面的运动先验。
物体物理模拟
物体被建模为物理代理,由 Material Point Method (MPM) 进行连续介质力学仿真。MPM 适合处理大变形和拓扑变化,能自然响应碰撞、摩擦等物理约束。在每次交互中,物体的运动状态由牛顿力学驱动,保证物理真实性。
交互监督的三个关键机制
- Windowed Attraction Loss:在生成运动的特定时间窗口内,约束人体末端(如手、脚)与物体位置接近,引导人体“拦截”物体。这解决了纯生成式运动与物体位置在时序上的对齐问题。
- Contact-Driven Re-simulation:当检测到人体与物体的接触时,在接触帧重新初始化 MPM 模拟。将人体部位的速度和动量作为边界条件传递给物体,触发物理一致的动量传递,从而让物体产生合理的被击打/推动反应。
- Masked Video-SDS:利用预训练的视频扩散模型提供视觉监督。对接触区域的渲染结果施加 Score Distillation Sampling (SDS),通过掩码聚焦于交互细节,校正人体与物体的穿透、滑步等问题,增强视觉保真度。
三个机制通过统一的可微管线协同优化,输出完整的 4D 高斯动态场,可任意视角渲染。
与同类工作(如纯运动生成或隐式物理先验方法)相比,PhyGenHOI 首次将 显式 MPM 物理模拟 与 可微 3DGS 表示 及 MDM 运动生成 深度耦合,通过重模拟和 Video-SDS 实现语义引导与物理约束的端到端联合优化,从根本上避免了传统方法中物理与视觉脱节的问题。
实验
实验设计
PhyGenHOI 在给定静态 3D 人类与物体的 3D Gaussian Splats 表示之上,依据输入文本描述(如“踢足球”或“推柜子”),生成动态 4D 人 - 物交互序列。实验覆盖多样化的动作类别、不同形态的人体与物体组合,并通过定量指标、定性可视化及用户调研全面评估生成结果的 物理一致性、视觉保真度与接触真实感。消融实验系统移除 Windowed Attraction Loss、Contact-Driven Re-simulation 与 Masked Video-SDS,逐一验证各模块贡献。基线方法包括仅基于视频先验的生成方案,以及采用简单启发式物理规则的替代实现。
关键发现
- 物理 - 语义耦合的有效性:Motion Diffusion Model 让人类动作保持语义合理,而 Material Point Method 模拟的物体动力学确保了动量守恒与碰撞响应,两者结合避免了物理穿模和漂浮等典型问题。
- 各机制的作用:
- Windowed Attraction Loss 在时间窗口内引导生成运动主动趋向物体,实现可靠接触;
- Contact-Driven Re-simulation 在接触瞬间重新触发物理模拟,传递动量,使物体产生符合物理规律的运动;
- Masked Video-SDS 从视频先验中提取接触区域的外观细节,大幅提升接触点的视觉可信度。
- 消融实验证实:移除任一组件均会导致接触缺失、物体无响应或视觉伪影,表明三者缺一不可。
与基线的深度对比
纯数据驱动方法(如直接使用视频生成先验)常产生视觉合理但物理上“不可能”的结果,例如手穿透物体或物体以非物理方式弹跳;引入简单启发式(如固定距离阈值触发动画)则缺乏泛化性。PhyGenHOI 通过可微的 3D 高斯表示,将生成式人体运动与显式物理模拟统一在同一个优化框架中,使生成的动作既满足文本语义,又严格遵循牛顿力学。这种设计范式在处理剧烈交互(如踢、打)时优势尤为明显,因为动量传递的大小与方向由物理定律决定,而非统计偏置。实验表明,该方法在接触真实性、物体运动自然度及整体连贯性上,均显著超越同类基线。
行业影响
落地场景
PhyGenHOI 可生成物理真实且视觉逼真的 4D 人-物交互序列,直接应用于影视动画、游戏开发、虚拟现实 (VR) 和增强现实 (AR) 内容制作。例如,动画工作室可输入静态角色与道具的 3DGS 资产,根据文本描述自动生成角色踢球、推箱子等动态镜头,大幅减少手动关键帧调整。在 电商与虚拟展示 领域,可动态呈现商品与人体的自然交互(如背包甩动、家具移动),增强商品表现力。此外,数字人驱动 和 机器人仿真 也可利用该方法生成符合物理规律的交互数据,用于训练或虚拟测试。
商业价值
该框架通过自动化合成物理准确的 4D 交互,显著降低高品质交互内容的生产成本。传统方法需要昂贵的动作捕捉和物理模拟人工调参,而 PhyGenHOI 仅需文本驱动,可将内容制作周期从数周缩短至小时级,赋能中小型团队。在 电商 3D 商品展示 或 游戏过场动画 中,物理一致性的提升直接增强用户沉浸感,进而提高转化率与留存率。对于 XR 应用,它提供了一种可扩展的交互丰富性生成手段,避免繁琐的手工设计,有助于快速填充虚拟世界。
与现有产品/工作流的接口
PhyGenHOI 以静态 3D Gaussian Splats (3DGS) 作为输入表示,与当前主流 NeRF/3DGS 重建管线 无缝衔接。从手机或扫描仪重建的资产可直接用于生成交互。输出为 4D 高斯序列,能通过现有 3DGS 渲染器实时查看或导出为网格/点云序列,接入 Blender、Unreal Engine 等生产软件。其基于文本的控制方式可集成到 AIGC 内容流水线 中,作为“交互生成”模块,下游连接视频生成或物理仿真验证。工程上,框架采用 Motion Diffusion Model 和 Material Point Method 的耦合,可与现有的骨骼动画系统和物理引擎协同工作。
具体用例:
- 电商虚拟试穿/试用:用户上传人体和商品(如背包)的 3DGS,选择“背上背包行走”等文本,瞬间生成带物理抖动和接触反应的动态展示视频,帮助消费者直观感受材质与贴合度。
- 游戏与虚拟制片:内容创作者使用 3DGS 资产库,输入“角色用脚踢翻垃圾桶”,PhyGenHOI 自动合成时长为数秒、符合动量传递的物理动画,替代手动动画制作,加速关卡过场设计。
局限
- 局限1: 方法依赖文本提示生成动作,扩散模型对动作语义的细粒度控制有限,对于未见过或模糊的动作描述可能生成不合理的人体运动。此外,生成的运动是开环的,未考虑物理模拟过程中人体与物体间连续的力反馈,导致人体动作本身缺乏物理响应(如踢球后脚的减速),限制了物理真实感的完整性。
- 局限2: 接触驱动的重模拟步骤需要预先定义接触事件,窗口吸引力损失的时间窗口也需要先验,可能对这些超参数敏感。当交互动作复杂或多步时,同步和动量传递的准确性可能下降。另外,视频-SDS 损失依赖于合适的视频生成先验,若视频模型对特定交互的生成质量不稳定,会影响最终结果。
- 局限3: 方法假定输入的静态人类和对象为高质量的 3D Gaussian Splats,实际中获取精细的 3DGS 资产仍需专业扫描或重建流程,限制了应用的便捷性。同时,4D 场景的生成质量和渲染效率受 3DGS 表示本身的分辨率和计算开销制约,尤其在动态对象变形较大的情况下可能出现伪影。