EgoPhys: 从第一人称视频学习可变形物体的通用物理模型
人类通过日常互动自然理解物体物理特性,但精确预测弹性材料、织物等复杂可变形动力学仍是计算机视觉和机器人领域的重大挑战。 我们提出 EgoPhys,一个从仅含 RGB 的第一人称视频中利用通用先验构建可变形物理数字孪生的框架。该框架通过将逐物体的逆物理解蒸馏为紧凑码本,无需逐弹簧测试时优化即可预测未知物体的稠密弹簧刚度场,克服了现有方法局限,实现了从第一人称视频生成可控可变形数字孪生。 使用来自多样化第一人称互动的通用先验训练,EgoPhys 在重建、未来预测和零样本泛化方面优于基线方法。为支持训练与评估,我们整理了一个涵盖多种可变形物体、场景和操作风格的第一人称互动数据集。 我们将 EgoPhys 部署在真实 xArm6 机器人上,证明从单个第一人称人类玩耍视频初始化的数字孪生可作为内部世界表示,辅助可变形物体规划,突显第一人称 RGB 观测作为通向实到模拟管道的可扩展路径。
论文精读
TL;DR EgoPhys 从第一人称 RGB 视频构建可变形物体的物理数字孪生,通过码本先验预测弹簧刚度场,实现零样本泛化并驱动真实机器人规划。
问题
问题背景
在计算机视觉和机器人领域,理解和预测可变形物体(如弹性材料、织物)的物理动态是一个核心挑战。人类通过日常交互能自然掌握这些物理特性,但要让机器从视觉输入中重建并模拟这些物体的形变行为,依然十分困难。这个问题直接关系到机器人灵巧操作、AR/VR 中的真实感交互以及仿真到现实的迁移。
现有方法局限
现有方法主要存在三类不足:
- 依赖每物体优化:许多逆物理求解器需要对每个场景的弹簧刚度等参数进行测试时迭代优化(如基于梯度的搜索),计算成本高,且无法泛化到未见过的物体。
- 依赖多模态传感:一些方法需要深度相机或触觉传感器才能精确估计物理参数,限制了在纯 RGB 设备上的扩展性。
- 缺乏通用先验:现有工作多针对刚性物体或简单场景,对可变形体的密集弹簧场建模缺乏可迁移的归纳偏置,导致从稀疏视角(如第一人称视频)重建的精度和预测能力不足。
为什么这个问题难且重要
可变形物体的物理参数化远比刚体复杂,因为形变是连续、高维且非线性的。仅从单目 RGB 视频中提取稠密的内部物理属性(如弹簧刚度分布)本质上是一个病态问题,需要结合强先验来缩小解空间。同时,业界对可变形物体操作的需求日益增长(如服装折叠、软体手抓取),但当前缺乏快速、低成本的“真实到仿真”管线,导致 sim-to-real 循环漫长。因此,一种能够从随意拍摄的第一人称视频中即时构建物理数字孪生的方法,对于机器人中的世界模型构建具有重要意义,可大幅降低数据采集与部署成本。
行业类比
这类似于在计算机图形学中,从多视角照片重建 3D 内容并进行物理模拟的任务——但这里要求从第一人称日常视频中恢复可变形体的物理属性,并使其能直接迁移到真实机器人规划,如同为物理世界提供了“可训练的直觉”模块。
核心洞察
- 从逐对象逆物理优化到可泛化先验:EgoPhys 通过将逆物理求解过程蒸馏为紧凑码本,直接预测密集弹簧刚度场,避免测试时对每个弹簧的优化,实现对未见物体的零样本物理参数估计。与依赖在线优化(如 CMA-ES)的传统方法不同,这种先验使物理数字孪生生成从“手工精调”转向“即刻推理”,大幅降低计算成本并提升泛化能力。
- 自我中心 RGB 视频作为可扩展的 real-to-sim 数据源:EgoPhys 仅从一段人类交互的第一人称 RGB 视频即可构建可变形物体的物理数字孪生,无需多视角、标记或深度传感器。这显著降低了真实到仿真的数据获取门槛,使得从日常操作视频中学习机器人可用的内在世界表示成为可能,为数据驱动的机器人操作提供了高扩展性的获取途径。
方法
输入与目标
输入 是单目自我中心 RGB 视频,记录了人类与可变形物体(弹性材料、织物等)的日常交互。目标 是从中构建物体的物理数字孪生,使其在未来交互中能被可控地模拟和规划。
关键模块
自我中心 4D 重建 对视频进行帧提取、实例分割与跟踪,得到物体的 2D 掩膜。通过单目深度估计与置信度滤波,将掩膜反投影为带噪声的 3D 点云,再经泊松重建与网格补全,输出物体的时序四面体网格
M_t,保留交互过程中的几何形变。逐物体物理初始化(逆物理求解) 对训练集中的每个物体,以
M_t的表面顶点位移作为约束,引入基于 弹簧-质点模型 的 FEM 表示。使用 CMA-ES 优化器粗搜索每个弹簧的刚度k_i,同时嵌入应变限制与地面接触力投影,使模拟轨迹与观测几何匹配。这一过程为每个物体产生一套稠密的弹簧刚度场K。码本物理先验 将多个物体的
K场编码为紧凑的 离散码本,并训练一个条件生成模块(egoprior)。给定新物体的重建几何M_0与交互轨迹,模型从码本中查询组合出对应的刚度场,无需逐弹簧测试时优化。先验在多样化的交互数据上训练,学会了从几何与运动线索推断材料属性的泛化能力。
输出与应用
对于未见过的物体,EgoPhys 仅凭单视角 RGB 视频即可输出其带物理参数的四面体网格数字孪生。该孪生可用于前向模拟、未来状态预测,并作为机器人内部世界模型,辅助操控规划。在真实 xArm6 机器人上,由人类玩耍视频初始化的数字孪生成功指导了可变形物体的操控任务。
与依赖在线参数辨识或逐场景优化的方法不同,EgoPhys 将逆物理求解蒸馏为可泛化的码本先验,避免了测试阶段昂贵的弹簧级优化,首次实现了从自我中心视频到可变形数字孪生的零样本构建。
实验
实验设计
EgoPhys 在一个自采集的自我中心交互数据集上进行评估,该数据集涵盖多种可变形物体(弹性材料、布料等)、不同场景和操作风格,按物体类别划分训练/测试集以测试泛化能力。实验包括:(1) 4D 重建与重仿真精度对比;(2) 未来帧预测;(3) 对未见物体与交互方式的零样本泛化;(4) 在真实 xArm6 机器人上部署,验证从单段自我中心演示视频构建的数字孪生能否支撑可变形物体操作规划。
关键发现
- 码本先验显著提升泛化:将逆物理解蒸馏为紧凑码本后,模型可为未见物体直接预测密集弹簧刚度场,无需测试时逐弹簧优化,零样本泛化能力远超基于优化的基线。
- 重建与预测精度均领先:在 4D 重建、重仿真误差和未来帧预测指标上,EgoPhys 均优于现有方法,表明通用先验有效捕获了可变形动力学的共享结构。
- 真实机器人应用可行:通过单次自我中心人类玩耍视频所初始化的数字孪生,成功辅助 xArm6 完成可变形物体操作,证明 real-to-sim 管线的可扩展性。
与基线对比解读
EgoPhys 的核心优势在于通用先验学习的效率与泛化性。传统逆物理方法对每个物体进行测试时迭代优化,计算开销大且不适于实时控制;而 EgoPhys 将物理参数估计转化为一次前向推理,以码本为中介,将特定物体刚度场回归问题嵌入可学习的共享潜空间,大幅降低部署成本。与直接回归刚度场的监督学习方法相比,EgoPhys 的码本设计保证了物理参数在仿真中的稳定性,避免非物理解。在零样本场景中,基线方法往往因缺少先验而失败,EgoPhys 则可复用从多样交互中学到的结构模式,验证了通用可变形物理先验的可行性,为未来从被动视频构建交互式数字孪生奠定了新范式。
行业影响
落地场景
EgoPhys 框架从第一人称 RGB 视频直接生成可变形物体的物理数字孪生,适用于机器人操作、虚拟仿真与内容生产。典型场景包括:
- 机器人灵巧操控:家庭服务机器人抓取衣物、整理布料;柔性生产线中机器人处理弹性元件。
- 物流与仓储:自动分拣系统识别并操作未知的软包物品,避免损坏。
- 虚拟试穿与内容创作:电商平台将用户上传的日常把玩视频转为高保真衣物物理模型,驱动真实褶皱与弹性形变;游戏/影视制作中快速生成符合物理的软体资产。
- 增强现实:眼镜端第一视角见到的织物、玩具等物体获得实时物理交互反馈。
商业价值
核心降本点在于消除逐物体物理参数标定。传统方法需对每个新对象进行耗时的手动调整或在线优化,EgoPhys 通过可泛化的 codebook 先验实现零样本预测弹簧刚度场,大幅缩短部署周期。
- 降本:减少人工调参与运算资源,例如在柔性制造中,更换产品型号时无需重新编程动力学参数。
- 增收:更稳定、更通用的抓取成功率和生成式内容质量可提升客户转化率与生产效率。
- 体验提升:实时、逼真的物理交互增强用户沉浸感(购物试穿、游戏交互)。
与现有产品/工作流的接口
EgoPhys 可作为物理初始化模块嵌入现有仿真与感知 pipeline:
- 输入层接入 RGB 视频流,结合 SLAM/NeRF 给到的几何重建,输出结构化的弹簧网格与刚度分布。
- 仿真侧直接对接 Isaac Sim、PyBullet 等环境,替代硬编码的物理参数或需要手动校调的质量-弹簧系统。
- 机器人操作栈可将其作为 real-to-sim 预训练阶段的资产生成器,快速批量构造多样化的训练场景。
具体落地 use case
- 电商虚拟试穿服务:用户戴头显或手机拍摄一段拿捏衣物的第一视角视频,后端 EgoPhys 实时生成该衣物的物理数字孪生,驱动虚拟化身身上的布料自然垂坠与动态褶皱。相比当前依赖物理引擎固定模板的方式,个体化物理响应使试穿还原度大幅提升,退货率有望下降。
- 物流柔性分拣:传送带上的商品种类千变万化,机器人通过顶置摄像头持续观察被夹持物体的形变过程,利用 EgoPhys 的零样本泛化即时推断其硬度与弹性,动态调整夹持力度与路径,在无需预注册 SKU 的条件下显著降低破损率。
局限
- **对 4D 重建精度高度依赖**:EgoPhys 需要从 egocentric RGB 视频中提取精准的 4D 动态几何,包括分割、跟踪与 3D 补全。该方法对快速运动、遮挡及光照变化敏感,若初期重建存在误差,将直接传播至后续物理参数估计与仿真,导致数字孪生失真。作者虽使用 3D Gaussian Splatting 改善表达,但并未系统评估在困难场景下的鲁棒性。
- **通用先验的覆盖范围有限**:码本训练所基于的交互数据集虽尽力涵盖多样物体(弹性体、织物等)与抓取方式,但物体类别总量仍受限。对于未见过的极端形变、不均匀材料或复杂拓扑的物体,零样本泛化的物理估计准确度可能急剧下降,无法保证预测的弹簧刚度场的物理真实性,从而影响机器人规划的安全性。
- **计算管线冗长,缺乏实时性分析**:从视频到形变仿真再到机器人规划,整个流程包括多步优化(4D 重建 → CMA-ES 粗优化 → 码本推理 → 前向仿真),没有给出端到端延迟分析。在需要快速适应的真实机器人场景中,这种非实时性可能构成瓶颈,论文未讨论任何加速策略或轻量化部署方案。