PhysiFormer: 在世界空间中学习模拟力学
我们提出 PhysiFormer,一种用于生成物理合理 3D 物体运动的扩散 transformer。与在视图依赖像素空间操作的视频世界模型不同,PhysiFormer 将物体表示为世界坐标下的 3D 网格。给定初始顶点位置、速度及物体材料类型(刚性或弹性),模型采样未来顶点轨迹。 相关神经物理方法通常依赖特设潜在空间或显式强加刚性与因果性,而 PhysiFormer 通过将顶点轨迹预测视为世界坐标下的单一去噪扩散过程,无需任何此类归纳偏置即可获得优秀结果。概率公式捕获学习动力学中的不确定性,能从初始条件生成多种可能的未来,适用于存在未观测不确定性的应用。模型通过分解时间、空间和物体的注意力实现高效的多物体推理,无需显式物体编码即可进行置换不变推理。 在超过10万条模拟轨迹上训练后,PhysiFormer 能生成刚性和弹性力学,并泛化到混合材料设置、未见真实世界几何及更多物体计数。它在轨迹精度、刚性保持和基于动量的物理一致性上显著优于自回归基线。 我们的结果将坐标空间扩散定位为迈向视图不变、几何感知的世界建模的有前景一步,适用于机器人、图形学和物理设计。可视化、代码和模型见 https://yimingc9.github.io/physiformer。
论文精读
TL;DR PhysiFormer 在 3D 世界坐标下对网格顶点轨迹做扩散采样,无需刚性/弹性归纳偏置即可生成符合物理的物体运动,并能泛化到混合材料与未知几何。
问题
问题背景
物理仿真与物体运动预测是 机器人操作、图形学 和 物理设计 的关键技术。传统基于方程的仿真器计算成本高,且难以从视觉观测中直接推理。数据驱动方法期望从大量轨迹中学习动态规律,实现快速、可泛化的运动生成,但如何在保留物理一致性的同时摆脱对视角和强先验的依赖仍是一个核心难题。
现有方法局限
主流 视频世界模型 以像素空间为输入/输出,严重受限于观察视角,缺乏对三维几何的显式理解,难以迁移到新相机位姿或新场景。神经物理方法 常引入专门设计的潜在空间,或强制施加刚体约束、因果性等归纳偏置,虽提升了稳定性,却牺牲了对弹性体、混合材质等复杂情形的通用性。此外,自回归模型 在长时间轨迹上会积累误差,导致物理属性(如动量守恒、刚体形态保持)逐渐退化。
为什么这个问题难且重要
直接在世界坐标下预测顶点轨迹,要求模型在无显式物理约束的情况下仍能保持 物理合理性,这对学习范式提出极高要求:
- 几何感知:需理解三维形状与空间变换,保持旋转/平移不变性;
- 多物体交互:处理不同材质、数量的物体间的碰撞与力传递;
- 不确定性建模:物理系统常包含未观测变量(如摩擦系数),需要生成多样但合理的未来。
业界对 视角不变、几何感知的世界模型 需求迫切,它可赋能机器人操作规划、动画生成、数字孪生等应用,但缺乏强先验下的稳定动力学学习仍是公认挑战。
行业类比
这类似于 自动驾驶占用网络 将感知从像素提升到世界坐标系,以支持鲁棒的运动预测与规划——PhysiFormer 通过坐标空间扩散,为三维世界物理推理提供了一条摆脱视角束缚的新路径。
核心洞察
- - **直接在 world-space 坐标做去噪扩散,无需归纳偏置即可学习物理交互**:PhysiFormer 将顶点轨迹的预测建模为单一去噪扩散过程,直接在 3D 世界坐标空间操作,没有任何显式刚体约束、因果性注入或针对特定物理现象的潜在空间设计。这与大多数神经物理模拟器形成鲜明对比,那些方法通常依赖特定于物理的潜变量、强制能量守恒或分解刚体运动。这种极简设计使模型能够自然捕获刚体与弹性体的混合行为,并泛化到未见几何体与多物体配置,证明坐标空间扩散本身已足够捕捉丰富的力学模式。
- - **因式分解注意力实现置换不变的多物体高效推理**:PhysiFormer 将注意力机制沿时间、空间和物体三个维度分解,在不使用显式物体编码的情况下实现了对物体数量的置换不变性。这意味着模型可以将任意数量的物体作为输入,并输出它们之间的动态交互,无需为每个物体单独设计表示或预测管道。与自回归基线相比,该设计在轨迹准确性、刚体姿态保持和基于动量的物理一致性上均有显著提升,为需要处理变数量物体的机器人操控与场景理解场景提供了一种更简洁且可扩展的方案。
方法
输入表示
PhysiFormer 接收初始顶点位置与顶点速度,以及物体材质类别(刚性或弹性)。所有几何信息统一在世界坐标系下表达,避免依赖视角的像素空间,从而实现视角无关、几何感知的运动建模。
核心架构:去噪扩散Transformer
模型将顶点轨迹预测形式化为一个单一的去噪扩散过程,直接在坐标空间操作。给定含噪声的未来轨迹,网络学习逐步还原出符合物理规律的干净轨迹。架构采用扩散 Transformer,关键设计在于注意力分解:
- 时间维:捕获轨迹的时序因果;
- 空间维:建模同一物体不同顶点间的力学相互作用;
- 物体维:实现多物体场景下的排列不变性,无需显式物体编码即可同时推理多个物体。 这种因子化注意力在提升效率的同时,天然支持跨物体交互与数量泛化。
概率建模与不确定性
扩散过程的概率本性使模型能生成多样化的可能未来轨迹,反映所学动力学的内在不确定性。这一特性在存在未观测不确定性(如碰撞检测失败、材质参数噪声)的实际应用场景中尤为重要。
训练与数据
模型在 超过 100k 条模拟轨迹上训练,涵盖刚体与弹性体运动。训练目标为标准扩散模型的去噪损失,仅用坐标残差监督,无需任何显式物理归纳偏置(如强制刚性约束、因果编码或专用潜空间)。
与同类方法的差异
与现有神经物理模拟器(如 GNN 图网络、基于潜变量的扩散模型或自回归模型)不同,PhysiFormer 完全放弃显式注入物理先验(如动量守恒约束、刚体变换等变性),直接在原始世界坐标上执行去噪扩散,却能获得更优的轨迹精度、刚性保持与动量物理一致性,证明了纯数据驱动的坐标空间扩散框架在力学模拟中的有效性。
实验
实验设计
模型训练使用超过 100k 条模拟轨迹,每条轨迹包含物体由初始顶点位置、速度和材料类型(刚体rigid或弹性体elastic)出发的顶点序列。数据集模拟多种材质与交互场景,未公开具体模拟器或采样细节。
模型架构为 扩散 Transformer,在世界坐标空间直接对顶点轨迹进行去噪生成,不依赖显式刚性约束或因果归纳偏置。注意力机制按时间、空间和物体三个维度因式分解,实现面向任意数量物体的置换不变推理。
评估涵盖:
- 轨迹预测精度
- 刚性保持(位姿、形状)
- 基于动量的物理一致性
- 泛化能力:混合材质、未见真实几何、更多物体数量
关键发现
- 无需归纳偏置的强物理模拟:纯扩散过程在坐标空间即可学到刚体与弹性体的力学行为,挑战了依赖专门编码或硬约束的传统思路。
- 显著的性能优势:在轨迹准确度、刚性保持率和动量守恒指标上大幅超越自回归基线(如逐帧预测模型)。
- 不确定性建模:概率式扩散使模型能输出多条合理未来轨迹,对含未观测噪声的应用(如机器人操控)具有价值。
- 高效多物体推理:因式化注意力避免了显式物体编码,模型可泛化到训练时未见过的物体数量,且计算效率随物体数线性增长。
- 跨领域泛化:对混合材质场景和真实扫描的物体几何,模型仍能生成物理合理的运动。
与基线的深度对比
自回归基线(如RNN/Transformer逐帧预测)存在误差累积问题:早期预测偏差会被放大,导致轨迹发散或刚性物体形变。此外,这类方法常需因果掩码,限制了同时利用全局时序信息的能力。PhysiFormer 通过一次性去噪生成完整轨迹,从根本上避免了累积误差,且非因果注意力使模型可捕捉全局时空依赖。
在物理一致性方面,自回归基线难以保持动量守恒或物体刚性,因其损失函数仅逐帧计算位置偏差。PhysiFormer 尽管未显式施加物理约束,但通过扩散模型对整体轨迹分布建模,隐式地学到了物理定律,生成的运动在动量、角动量等守恒量上与真实模拟数据高度一致。
这一对比表明,坐标空间的扩散生成为几何感知、视角不变的世界模型提供了新路径,在机器人学、图形学和物理设计等领域具有广阔应用前景。
行业影响
落地场景
PhysiFormer 直接面向物理直觉驱动的 3D 内容生成与仿真加速,可嵌入到机器人仿真、计算机图形学、工业设计验证以及混合现实交互等产品。
- 机器人与自动驾驶仿真:为感知训练和规划测试生成多样化、物理合理的对象运动轨迹,替代费力的人工规则和传统引擎调参。
- 3D 动态内容平台(游戏、影视、电商展示):实时添加物理效果,降低动画师手工 K 帧成本。
- 工业设计辅助:对 CAD 装配体进行“一键”运动预测和碰撞检测,快速筛选设计方案。
商业价值
降本:直接对世界坐标顶点轨迹去噪,跳过传统物理求解器的网格划分和参数调优,大幅缩短模拟周期;对弹性和多体场景尤甚,可将一次仿真从数小时压缩到秒级推理。
增收与体验提升:电商 3D 商品展示集成物理交互后,停留时长与转化率有望提升;内容创作工具加入“物理感知”可吸引更广泛用户,拓展订阅收入。
不确定性建模:概率化轨迹输出允许生成多种可能未来,赋能安全仿真(如预测物体跌落后分布)或虚拟拍摄中的“what-if”预览,创造传统确定性引擎难以提供的价值。
与现有产品/工作流的接口
PhysiFormer 以网格顶点序列为接口,与主流 3D 资产管线天然耦合:
- 输入:初始顶点位置、速度、材质标签(刚性/弹性),格式兼容
.obj,.ply或 Unity/Blender 内部数据。 - 输出:未来顶点轨迹 tensor,可直接驱动渲染或由脚本转换为关键帧。
- 部署方式:模型轻量级,支持在 GPU 上作为微服务(FastAPI/gRPC)运行,可封装为 Blender/Maya 插件、Unity/Unreal 组件,或集成到 Omniverse / Isaac Sim 仿真流中。
- 条件控制:扩散采样可与碰撞避免、目标位姿等外部梯度结合,实现可控生成,无需重训模型。
具体案例
1. 电商 3D 商品交互预览
用户在虚拟样板间拖拽一把椅子,PhysiFormer 实时预测其滑动/倾倒轨迹和站立的物理行为,替代预烘焙的固定动画,使交互更真实、增加购买信心。模型可直接集成至基于 WebGL 的前端,在客户浏览器内推理,降低服务端压力。
2. 自动驾驶传感器仿真数据生产
仿真栈需要大量动态交通流中的车辆、行人运动。PhysiFormer 根据初始状态生成多种符合物理的个体轨迹,用于训练感知和预测模型。相比纯规则或游戏引擎,其概率输出能覆盖更丰富的边际案例,提升模型稳健性,并减少人工设计轨迹的成本。
局限
- **模拟到现实的泛化差距**:模型完全在合成轨迹(超过 100k 条)上训练,虽然展示了在未见过的真实几何体上的零样本泛化,但真实物理交互中的复杂摩擦、碰撞响应、非均质材料等可能与模拟分布存在系统性偏差。论文未在真实传感器数据(如深度相机点云)上验证,限制了其在机器人操作等需强泛化场景中的直接部署。
- **推理效率瓶颈**:PhysiFormer 基于扩散模型的去噪过程通常需要数十到数百步采样,相比自回归或前馈方法推理延迟更高。虽然论文未详细分析推理时间,但对于需要实时响应的交互式应用(如物理模拟集成、机器人控制)可能成为制约因素。
- **物理现象覆盖范围有限**:当前模型仅处理刚体和弹性体,未涉及塑性变形、断裂、流体等多物理类别。实验虽包含混合材质设置,但本质上仍属刚-弹二类组合,无法应对更普遍的多物理耦合问题,限制了模型在通用物理设计工具中的适用性。