PhysisForcing: 物理增强的机器人操作世界模拟器
视频生成模型已成为具身世界模拟的一种有前景的范式。然而,通用域视频生成器和机器人特定数据微调模型仍会产生物理上不合理的操作,包括不连续的运动轨迹和不一致的机器人-物体交互,这限制了其作为世界模拟器的可靠性。通过大量实验,我们发现这种物理不稳定性主要源于两个因素:运动物体的变形以及交互实体之间(尤其是接触时)不合理的时空相关性。基于此观察,我们提出 PhysisForcing,一个可扩展的训练框架,通过联合优化像素级和语义级特征,加强对物理信息区域的监督,从而增强物理一致性。该框架包含两个核心损失: - 像素级轨迹对齐损失:利用参考点轨迹监督 DiT 特征; - 语义级关系对齐损失:将 DiT 特征与从冻结视频理解编码器中提取的区域间关系对齐。 在 R-Bench、PAI-Bench 和 EZS-Bench 上的大量实验表明,PhysisForcing 在强基线上持续改进了具身视频生成:将 Wan2.2-I2V-A14B 和 Cosmos3-Nano 基础模型在 R-Bench 上的性能分别提升了 22.3% 和 9.2%(超过普通微调的 7.1% 和 3.7%),其中 Cosmos3-Nano 变体取得了最佳总体得分。在生成之外,作为 WorldArena 动作规划器协议下的世界模型,它将闭环成功率从 16.0% 提升至 24.0%,并进一步改进了下游策略的成功率,表明物理对齐的视频模型能为机器人操作提供更强大的表征。
论文精读
TL;DR PhysisForcing 通过对扩散 Transformer 特征施加像素级轨迹对齐和语义级关系对齐损失,强化视频生成在机器人操作中的物理一致性,显著提升生成质量和下游策略成功率。
问题
具身世界模拟 正成为具身智能的关键技术,以视频生成模型构建机器人操作环境的动态预测器,为策略学习与规划提供高保真训练信号。但当前方法面临严重的物理合理性瓶颈,制约其实用化。
现有通用视频生成器(如 Wan2.2-I2V-A14B、Cosmos3-Nano)或经机器人数据微调后的模型,仍频繁产生物理上不可信的操纵行为,典型表现为:
- 运动轨迹不连续:末端执行器或物体在画面中跳变,违背运动平滑性。
- 接触交互不一致:抓取、放置等动作中物体与夹爪的相对关系错误,如穿透、滑脱或形变异常。
作者通过大量实验定位两大根源:移动物体的几何形变 和 交互实体间时空关联的缺失。现有方法在像素级生成损失(如 MSE)下训练,缺乏对运动轨迹与物体间关系的显式约束,导致模型习得的时空特征仅在统计上匹配真实画面,但在物理因果上脆弱。微调仅引入新数据分布,未能从根本上注入物理先验。
该问题的难度在于:
- 细粒度时空对齐:需在像素空间中追踪运动连续性和接触一致性,但高维视频生成中轨迹信号微弱且易被其他纹理信息淹没。
- 语义级关系建模:接触力学、物体约束等抽象概念需从视频中提取并与生成特征对齐,但传统自监督特征表达力不足。
- 规模化训练:物理监督必须与大规模生成框架兼容,计算开销和收敛稳定性是巨大挑战。
业界的广泛关注源于 世界模型 在具身规划中的核心地位——若视频模拟的物理可信度不足,其作为“无成本环境”训练出的策略将在现实世界崩坏。这类似于 自动驾驶仿真 中传感器数据的物理真实性对规控算法有效性的决定性作用,任何幻觉都可能引发灾难性迁移。
该工作为视频生成模型注入显式物理约束提供了可扩展框架,打通了从生成式世界模拟到可靠策略部署的关键一环。
核心洞察
- 物理不稳定的根因诊断与靶向监督:以往 embodiment video generation 常通过扩大数据或微调来缓解物理失真,但未系统追问“哪里不正确”。PhysisForcing 通过大量实验锁定两大根源——运动物体变形和接触时交互实体间不合理的时空关联——进而针对 DiT 特征设计像素级轨迹对齐和语义级关系对齐损失,将监督精确聚焦于物理信息区域。这种“诊断-靶向”设计比普适的物理损失或数据增强更精细地提升生成的真实性与下游任务表现。
- 从感知先验中蒸馏物理常识,避免昂贵显式建模:许多世界模拟方案依赖动力学模型、3D 标注或物理引擎,成本高且泛化受限。PhysisForcing 另辟蹊径,仅利用冻结视频理解编码器提取的语义关系作为监督信号,将结构化的物理常识(如物体间接触、相对运动)蒸馏进 DiT 特征,不依赖显式物理仿真。这一轻量、可扩展的物理注入范式,为在大型视频生成模型上建立物理一致性提供了低成本、可复用的新路径,且在下游机器人策略学习中展现出更强的表征迁移能力。
方法
PhysisForcing 是一种可扩展的训练框架,用于增强视频生成模型在具身操控场景下的物理一致性。输入为预训练的基于 DiT 的视频生成模型(如 Wan2.2 或 Cosmos3)与带操控动作的机器人视频数据。方法首先通过物理信息区域提取(Physics-informative Region Extraction)模块,利用现成的感知模型自动识别每帧中移动物体和交互部位(如机械臂末端、被抓物体),并提取其参考点轨迹和对应的区域掩码。这些区域作为训练中强监督的焦点对象。
训练过程联合两个对齐损失来微调 DiT 模块:
- 像素级轨迹对齐损失(Pixel-level Trajectory Alignment Loss):在 DiT 的中间特征层上,沿参考轨迹点的时空位置抽取特征向量,通过一个轻量对齐层将特征映射为与参考轨迹一致的位移预测,优化生成点轨迹与真实轨迹之间的差异,强制模型保持运动轨迹的连续性和合理性。
- 语义级关系对齐损失(Semantic-level Relational Alignment Loss):使用一个冻结的视频理解编码器(如 VideoMAE)提取各物理区域的空间特征,计算区域间的关系矩阵(如相似度矩阵);同时对 DiT 对应特征层也计算区域关系,通过对比损失(如 InfoNCE)拉近两者的分布,从而迫使模型学习物体-物体、物体-机器人之间在接触等关键交互时的正确时空关联。
两个损失共同作用于 DiT 特征空间,既在底层约束运动轨迹,又在高层约束语义关系,并且仅在物理信息区域上计算损失,避免背景噪声干扰。训练期间冻结基座模型的大部分参数,仅更新对齐层和部分 DiT 参数,保持高效。推理时无需额外模块,直接使用微调后的 DiT 生成视频。
与同类物理感知微调方法相比,PhysisForcing 的差异在于同时从像素轨迹和语义关系两个层级注入物理监督,并针对交互区域进行焦点训练,显著减少了物体形变和不合理的时空关联,而不仅仅是提升生成视频的视觉质量。
实验
实验设计
训练数据使用机器人操作视频,在 Wan2.2-I2V-A14B、Wan2.2-TI2V-5B 和 Cosmos3-Nano 等 DiT 基座模型上微调。评估采用 R-Bench(真实感与物理合理性)、PAI-Bench(物体交互准确性)和 EZS-Bench(具身场景生成质量),并与基线(原始基座模型和普通微调)对比。此外,在 WorldArena 动作规划协议下测试闭环操控成功率。
关键发现
PhysisForcing 通过像素级轨迹对齐损失和语义级关系对齐损失联合优化,显著提升生成视频的物理一致性:在 R-Bench 上,Wan2.2-I2V-A14B 得分提升 22.3%(相较基座),Cosmos3-Nano 提升 9.2%,且 Cosmos3-Nano 变体取得所有模型最佳总分。定性分析表明,运动轨迹更连续,接触交互更稳定。作为世界模型,闭环成功率从 16.0% 提高到 24.0%,下游策略成功率也得到增益,证明物理对齐的视频生成能提供更强的操控表示。
与基线对比解读
普通微调(vanilla finetuning)仅使 Wan2.2 和 Cosmos3-Nano 分别提升 7.1% 和 3.7%,而 PhysisForcing 额外带来 15.2 和 5.5 个百分点的增益,表明仅靠数据驱动微调难以纠正深层物理偏差。像素级对齐直接约束运动轨迹,语义级对齐增强区域间时空关联,两者协同避免了物体形变和不合理接触。该框架可即插即用地部署到不同 DiT 架构,为构建可信的具身世界模拟器提供了可扩展的训练范式。
行业影响
落地场景
PhysisForcing 强化视频生成的物理一致性,可集成到机器人仿真与具身智能训练管线,为仓储物流、柔性制造等场景提供高保真世界模拟器。在自动驾驶仿真中,它能生成更真实的车辆-行人交互视频,辅助感知与规划算法迭代。在AR/VR 内容生成领域,可提升虚拟物体操作的物理可信度,减少人工后期修正。此外,视频编辑与生成平台(如电商虚拟试穿戴、游戏动画预演)可借助该框架避免物体形变与运动间断,输出物理上合理的交互序列。
商业价值
该框架通过物理一致性约束降低生成内容的人工审核与修正成本,直接提升视频生成模型在B端场景的可用性。对于机器人仿真平台(如NVIDIA Isaac Sim、MuJoCo集成方案),更真实的视频世界模型可减少对昂贵真实世界遥操作数据的依赖,节省数据采集费用。在内容电商中,物理上连贯的商品展示视频能增强用户信任感,提升转化率。对于AI 视频生成服务商,物理稳定性是区分通用模型的核心竞争力,可借此开拓工业仿真、教育培训等高客单价市场。
与现有产品/工作流的接口
PhysisForcing 基于 DiT 架构,可与主流视频生成模型(Wan2.2、Cosmos 系列)无缝对接,作为微调阶段的可插拔模块。在机器人仿真栈中,它可以嵌入 WorldArena 行动规划器等世界模型协议,直接输出用于策略学习的结构化表征,无需额外适配。对于视频理解 encoder(如冻结的 ViT 模型),语义对齐损失可使用现成模型,降低集成门槛。推理阶段不改变模型结构,仅需加载微调后的权重,可复用现有 DiT 推理流水线。
具体落地用例:
- 仓储机器人分拣仿真:电商仓库中,使用 PhysisForcing 微调的 Cosmos3-Nano 生成更真实的机械臂抓取与放置视频,替代部分真实采集数据,用于视觉-运动策略训练,降低试错成本。
- 内容平台虚拟试穿:用户上传服装图片后,生成穿衣过程动画。物理损失约束确保布料无异常拉伸、肢体穿透,提升用户体验与平台停留时长,直接关联GMV增长。
局限
- **物理信息区域提取依赖外部感知模型**,如光流估计和实例分割网络。这些模型本身的误差可能传播到对齐损失中,限制物理一致性的上限;额外的前向过程也增加了训练和推理的计算开销,可能不适合资源受限的部署场景。
- **世界模型闭环成功率依然有限**。虽然 PhysisForcing 将 WorldArena 下的闭环成功率从 16.0% 提升到 24.0%,但绝对数值仍偏低,说明在长序列交互中物理崩溃或违背任务约束的问题并未完全解决,距离可靠地用于真实机器人策略训练仍有较大差距。
- **评估场景和对象的多样性有限**。实验主要集中在 R-Bench、PAI-Bench 和 EZS-Bench 等固定基准,这些基准涵盖的操作任务和物体类别可能无法覆盖开放世界中丰富物理交互模式(如可变形物体、流体等),方法的泛化能力有待更广泛的测试。