EMMA: Extracting Multiple physical parameters from Multimodal Data
现有视频-only方法在状态遮挡、隐藏驱动输入或依赖已知初始条件与坐标框架时存在局限性。为此,我们提出 EMMA,一个基于物理信息的多模态框架,能够从原始视频、音频和基于图像的时间序列观测中,直接恢复系统的所有可辨识动力学参数。 EMMA 采用 液态时间常数(Liquid Time-Constant, LTC) 网络从异质模态中学习潜在动力学,并通过物理约束损失强制与支配性微分方程一致。统一特征流水线实现视频轨迹、声学特征和图表衍生测量之间的对齐,无需分割掩码、可微渲染或专用传感器,即可在强制、隐式和多元动力学下估计参数。 在超过 100 个场景中,包括 5 个标准动力学基准(75 个 Delfys 视频)、真实世界隐藏输入的轮式机器人和四旋翼系统,以及涵盖生物和混沌系统的仿真图表案例研究,EMMA 实现了稳健的多参数恢复,并显著优于现有的单模态和方程发现基线。 实验证明 EMMA 是一种通用、可扩展的解决方案,用于从机会性多模态数据中进行物理一致的模型提取。代码与数据见:https://github.com/ImpactLabASU/EMMA-CVPR2026
论文精读
TL;DR EMMA 是一个物理信息多模态框架,无需已知初始状态或坐标帧,即可从原始视频、音频和图表数据中联合推断系统全部可辨识动力学参数,在 100+ 场景中显著超越单模态和方程发现基线。
问题
问题背景
从物理系统观测数据中自动辨识动力学参数,是系统辨识与科学发现的核心课题。传统上依赖接触式传感器和手动建模,而随着深度学习与多模态感知的进步,直接从视频、音频、图表等非侵入式信号中提取物理规律正成为新兴方向,有望大幅降低实验成本并拓展科学发现的自动化边界。
现有方法局限
当前主流方法多依赖单一模态(如纯视频)和离散时间模型,存在三个关键短板:
- 状态不可观测:当系统状态被遮挡或驱动输入隐藏时(如自主机器人内部指令),纯视觉方法无法推断完整动力学;
- 初始条件依赖:多数工作需要已知初始状态或坐标系,限制了在“机会式”数据(如随手拍摄的视频)上的泛化;
- 参数耦合假设:视频-only方法通常假设已知部分参数(如质量、长度),或需要分割掩码、可微分渲染等强监督,难以处理建模中隐式变量和校准不变量。
这些限制导致现有方法在多参数联合推断、隐式动力学和多变量系统面前失效,无法满足真实场景对泛化性和鲁棒性的要求。
为什么这个问题难/重要
物理参数恢复的难点在于异质多模态数据的对齐与融合,以及如何在缺乏显式监督时强制模型遵守底层微分方程。同时,环境中普遍存在噪声、遮挡和未知驱动,要求模型具备连续时间推理能力,能够从稀疏、异步的观测中学习一致的隐空间动力学。行业关注度极高:从无人机故障诊断、机械臂动力学辨识到生物系统建模,都需要一种能从“随手可得”的多模态数据中挖掘物理规律的通用的、可扩展的方案,减少对专用传感器和标定流程的依赖。
行业类比
类似自动驾驶中从相机-雷达-激光雷达多模态输入重建场景流与物体运动参数,EMMA 的目标是在物理系统辨识场景下实现“多模态物理推理即服务”——给定任何可感知的观测数据流,直接输出符合物理定律的完整参数集。
核心洞察
- EMMA 证明了将多模态互补信号融入物理约束的学习框架可以有效克服单模态数据中常见的信息缺失问题:仅依赖视频的动力学参数估计在目标被遮挡、激励输入未知或初始状态不确定时会失效,而 EMMA 通过同时处理视频、音频和图表图像,从光学、声学和标量时序中提取一致的潜在状态,使得隐式动力学成分(如电机扭矩或外部扰动)能够被联合推断。这与现有基于方程发现或纯视觉方法形成本质差异——后者通常假设完整可观测性或需要精确校准的坐标体系,EMMA 则利用机会性多模态数据,在不依赖分割掩码、可微分渲染或专门传感器的情况下实现了更通用的动态系统重构。
- Liquid Time-Constant (LTC) 网络在连续时间潜在动力学学习上提供了相较 Neural ODE 更鲁棒且扩展性更强的选项:传统物理-神经网络混合模型常用 Neural ODE 来刻画连续演化,但 ODE 求解器对噪声和长序列梯度稳定性敏感;EMMA 引入 LTC 这一受生物神经元启发的架构,通过门控时间常数机制自适应地调节记忆与遗忘,使得模型在异构多模态输入下能更平滑地学习瞬时动力学,同时物理约束损失保证了推断参数与支配微分方程的一致性。在消融实验中,LTC 在无外力、有外力及多模态噪声场景下均显著优于 Neural ODE 和 CT-GRU,说明这类隐式连续动力学网络更适合从非结构化传感数据中提取物理参数,为后续工程中的物理仿真模型校准提供了新的基准选择。
方法
输入与预处理
EMMA 接收未对齐的多模态机会数据:原始视频、环境音频、以及包含观测时间序列的图表图像。视频无需分割掩码或可微渲染;音频捕获隐含的驱动信号;图表图像(如传感器记录的曲线图)通过数字识别转为数值序列。统一特征流水线将三者对齐:视频轨迹通过检测器(如 YOLO)与光流提取对象运动;音频经过梅尔谱与声学特征编码;图表数据经 OCR 或曲线提取转为结构化时间序列。所有模态被投影到共享维度的嵌入空间,支持不同采样率的连续时间融合。
核心模块:LTC 网络与物理约束
动力学学习由Liquid Time-Constant (LTC) 网络完成。LTC 是一种连续时间递归网络,其状态更新由微分方程控制,天然适配不规则采样和异构模态。它从融合特征中学习潜在动态,同时输出显式物理参数(如阻尼系数、质量、摩擦因数)和隐式动力学成分。
训练依赖物理约束损失:数据重建损失确保预测轨迹拟合观测,而微分方程残差损失将 LTC 的预测时间导数与已知控制方程(如拉格朗日力学模型)比对,强制潜在动态符合物理定律。联合优化使网络恢复的不仅是拟合参数,更是物理一致的参数。
输出:可辨识的全参数集
框架输出系统所有可辨识的动力学参数,包括显式参数(如转动惯量、弹簧常数)、隐式驱动(如未观测到的输入力)以及校准不变量(如相机与机器人基座的坐标变换)。无需已知初始条件,对遮挡状态和隐藏输入鲁棒。
与同类工作的关键差异
相比依赖分割掩码、可微渲染或专有传感器的视频方法,EMMA 利用多模态机会数据实现端到端参数估计;相比方程发现方法,它无需假定参数稀疏性或人工设计基函数,能直接恢复物理参数而非仅“发现”方程形式。
实验
实验设计
EMMA 在超过 100 个场景中进行了系统性验证,覆盖五大类标准动力学基准(含 75 个 Delfys 视频)、真实漫游车与四旋翼系统(含隐藏驱动输入),以及仿真图表案例(生物及混沌系统)。每个场景需要从原始视频、音频或图像时序中恢复全部可辨识的物理参数。基线包括单模态视频方法、方程发现方法等。评估关注参数恢复精度、对遮挡/隐输入的鲁棒性,以及执行效率(见第 4.2 节)。
关键发现
EMMA 在所有场景中均实现鲁棒的多参数恢复,性能显著超越现有单模态与方程发现基线:
- 在 Delfys 基准上,无需分割掩码或可微渲染即可精确估计阻尼、摩擦等系数;
- 对真实漫游车与四旋翼,EMMA 能处理隐藏驱动输入和部分可观测状态,而视频-only 方法因无法感知驱动力或声学特征而失效;
- 仿真图案例证实,跨模态特征对齐使 EMMA 可从时间序列图像中提取 ODE 参数,即使原始数据缺少坐标标定。
基线对比深度解读
传统视频-only 动力学推断依赖明确的物体分割、已知初始条件或坐标系,当发生遮挡或输入不可见时误差骤增。EMMA 通过 LTC 网络 融合视频、音频、图表等多模态特征,联合推断显式参数与隐式动力学,物理约束损失强制与微分方程一致。这使得 EMMA 能利用“机会性”多模态数据构建物理一致的模型,无需专用传感器,从而为复杂系统的离线参数辨识提供了可扩展的通用框架。
行业影响
落地场景
EMMA 可直接应用于机器人、自动驾驶、工业预测性维护、增强现实等领域。例如:
- 自适应机器人操控:单目或RGB-D摄像头搭配麦克风,实时估计末端执行器或移动底盘的惯性参数、阻尼、摩擦系数、执行器增益,无需力矩传感器或精确CAD模型,便能在负载变化或地面条件切换时在线调整控制策略。
- 设备健康监测:从运转中的电机、泵、齿轮箱的视频和声学信号中提取隐性物理参数(如阻尼、刚度、摩擦),实现早期故障预警和剩余有用寿命估计,降低对振动传感器的依赖。
商业价值
- 降本:省去专用传感器(如力/力矩传感器、高精度编码器)和手动标定流程,用现成摄像头与麦克风即可完成参数辨识,尤其适用于大规模设备群和成本敏感型产品。
- 增收:通过高保真物理模型提升模型预测控制(MPC)与仿真精度,缩短新产品调试周期,加速上市;同时准确的参数估计可减少故障停机,提升产线OEE。
- 体验提升:在AR/VR、游戏物理引擎中,EMMA可从现实视频/音频中自动提取物体动力学参数,实现更真实的实时模拟,增强沉浸感。
与现有产品 / 工作流的接口
EMMA 框架以模块化方式接入现有AI栈:
- 前端感知:兼容主流检测器(如YOLO)和光流,直接消费边界框或关键点序列,不绑定特定算法。
- 特征编码:统一多模态特征流水线可将视频、音频、图表截图对齐为时间序列,便于集成到ROS节点或IoT数据管道。
- 物理约束训练:轻量级LTC网络输出连续时间隐状态,配合物理损失函数,可训练为无监督或多任务目标,输出可直接作为Kalman滤波器或MPC的先验参数。
- 部署:架构不依赖可微渲染,推理以毫秒级完成(论文报告在100+场景中快速执行),适合边缘设备。
具体落地用例
- 配送机器人跨场景自适应:一家机器人公司部署EMMA,机器人通过前置摄像头和麦克风分析自身运动与电机噪声,在瓷砖、地毯、坡道等不同表面实时估计轮地摩擦系数和质心偏移,动态调整控制器增益,避免打滑和倾覆,无需预建每种地面的模型。
- 工业协作机械臂预测性维护:制造企业集成EMMA到机械臂监控系统,利用现成摄像头和车间麦克风捕捉关节运动轨迹与声音,持续提取关节摩擦、反向间隙等隐性参数,当参数偏离正常范围时触发维护工单,避免突发停机,并优化备件库存。
局限
- **依赖已知方程结构**:EMMA 要求事先给出物理系统的微分方程形式,仅学习参数。对于方程未知或黑箱系统,无法直接应用,而纯数据驱动的方程发现方法(如 SINDy)可直接从数据中同时推断方程与参数,适用范围更广。
- **多模态数据同步与质量敏感**:框架依赖视频、音频与图像等多模态信号的精确时间同步和较高质量。真实场景中,音频易受环境噪声污染,视频可能因遮挡、光照不足导致特征提取失败,单模态退化会严重影响联合参数估计的准确性。
- **计算开销与实时性未充分验证**:论文未深入分析执行时间与计算效率。LTC 网络联合物理约束损失以及可微轨迹生成过程可能带来较大训练开销,难以直接部署于高频控制循环或需在线参数估计的实时任务。