论文

Dream.exe: 视频生成模型能否梦到可执行的机器人操控?

Dream.exe: 视频生成模型能否梦到可执行的机器人操控?

视频生成模型在合成视觉上令人信服的内容方面取得了令人瞩目的进展,但其输出仍局限于虚拟领域。一个自然的问题随之而来:当这些模型生成的视频离开屏幕进入现实时,它们能在多大程度上反映物理世界? 我们提出将机器人操控作为衡量这一问题的具体、可测量窗口:如果模型真正内化了物理定律,它所描绘的运动应能转化为可执行的机器人行为。我们引入Dream.exe,一个通过视频到执行管线来操作化这一标准的评估框架。给定场景图像和任务描述,Dream.exe 合成操控视频,将生成的运动转换为机器人轨迹,并在物理模拟器中执行,从而提供纯视觉指标无法提供的接地信号。 使用该管线,我们评估了 8 个模型,涵盖前沿闭源生成器、开源生成器和机器人专用模型。我们的基准测试覆盖101个手工制作的操控任务,分为三个物理复杂度级别,从视觉质量、轨迹保真度和执行成功率三个维度进行测量。令人鼓舞的是,多个模型取得了可衡量的执行成功,表明从互联网规模数据中学习的生成先验已经编码了有意义的物理知识。然而,视觉质量并不能很好地预测可执行性,这揭示了标准视觉评估未能捕捉到的模型能力维度。 Dream.exe 将在 https://github.com/showlab/Dream.exe 开源。

论文精读

TL;DR 提出 Dream.exe 框架,将视频生成模型输出的操作视频转化为可执行机器人轨迹,在仿真器中评估物理合理性,揭示视觉质量与可执行性脱钩。

问题

问题背景

视频生成模型正从纯粹视觉合成向可指导的物理仿真延伸,但生成内容是否真实反映物理规律仍是开放问题。机器人操控作为物理交互试金石,成为检验模型物理理解的前沿窗口。

现有方法局限

当前视频生成评估依赖 FVDIS 等视觉质量指标,只能衡量像素级保真度,无法判断生成运动的物理可行性。机器人学习虽尝试从视频提取控制策略,但多面向真实拍摄视频,未系统评估生成式模型的物理先验。更关键的是,缺少将生成视频直接转化为可执行机器人轨迹的闭环验证流程,导致 “视频生成模型是否真正内化物理规律” 这一问题悬而未决。

为什么这个问题难且重要

视频到执行的转化是技术瓶颈:从 2D 像素估计深度、跟踪点云、推断末端姿态和夹具动作,每一步都存在噪声与歧义,需要鲁棒的 video2traj 管线。然而一旦打通,它将为具身智能开启新范式:利用互联网视频数据学到的生成先验直接指导机器人操控,这触及 AI 核心挑战——让生成模型不仅 “好看”,还要 “可用”。业界对世界模型、具身 AI 的追求使该方向高度活跃。

行业类比

这类似于代码生成领域用执行成功率补充 BLEU 评分:Dream.exe 为视频生成模型提供了 “物理执行正确性” 这一面向真实的衡量尺度。

核心洞察

  • 视觉质量无法预测物理可执行性。Dream.exe 通过将生成的视频转换为机器人轨迹并在模拟器中执行,定量揭示了 FVD 等传统视觉指标与任务成功率之间的弱相关性。这一发现挑战了“生成越逼真,理解越深刻”的默认假设,指出当前视频生成模型的评估体系存在根本缺陷,必须引入与物理交互绑定的基础性指标,才能衡量模型是否真正内化了世界规律。
  • 开源生成式先验蕴藏可迁移的物理知识,但难以应对长时程操控。实验表明,源自互联网视频训练的通用生成模型在简单抓取任务上可零样本产生可执行轨迹,证明其隐式编码了部分物理常识;然而在需要多步时序推理的复杂任务中成功率骤降。这暗示了下一阶段突破的瓶颈不在于单帧质量,而在于模型的事件级因果理解与长程规划能力,为视频生成与机器人策略学习的交叉融合指明了关键改进方向。

方法

Dream.exe 构建了一条从视频生成到机器人执行的全自动评估管道,将物理可行性作为衡量生成模型世界认知的新维度。

输入与任务定义

  • 输入:单帧场景图像 + 自然语言任务描述(如 “拾取红色积木”“将杯子推至右侧”)。
  • 任务套件:101 组手动策划的桌面操作任务,按物理复杂度划分为 3 级——
    • Level 1:单物体平移、无接触;
    • Level 2:多物体交互、需理解遮挡与支撑;
    • Level 3:长序列精密操作、涉及工具使用或多步规划。

四阶段评估管道

  1. 视频生成:模型根据场景图与指令生成长度 1–5 秒的未来操作视频。涵盖 8 个模型,包括商业黑盒 API、开源扩散/自回归生成器、以及机器人专用策略模型。
  2. 视觉质量评分:用 VLM (GPT-4o) 从指令遵循度、时序一致性、物体形变等维度自动打分,同时记录 FVD、CLIP 分数等参考指标。
  3. 轨迹提取(核心桥接模块)
    • 针对生成视频,使用 2D 点跟踪(CoTracker)获取像素运动轨迹;
    • 通过深度估计(DepthAnything V2)将 2D 轨迹提升至 3D 相机坐标;
    • 结合机器人手眼标定关系映射到 TCP 末端执行器位姿序列,并估计离散旋转动作与夹持器开合信号;
    • 最终形成可供机器人执行的 6-DoF 轨迹序列。
  4. 物理执行:将提取的轨迹注入 Isaac Sim 等仿真器,由机器人精确回放,记录任务完成成功率、轨迹平滑度、与 ground-truth 演示的相似度(DTW 距离、ATE 等)。

关键信号:可执行性

  • 输出包括 执行成功 / 部分完成 / 失败 的分类,以及详细的失败模式(碰撞、抓取失败、时序错位等)。这些信号揭示模型是否真正内化了质量守恒、接触力学等隐式物理约束。
  • 对比纯视觉指标,发现视觉质量与可执行性存在显著解耦:某些视频视觉逼真但轨迹无法驱动真实机器人;反之,部分视觉瑕疵的视频却能正确完成操作逻辑。

与同类工作的差异

不同于现有视频生成基准仅依赖 FVD/CLIP 等像素级指标,Dream.exe 首次将生成动作的可执行性作为评测锚点,通过物理仿真接地信号衡量生成内容是否符合真实世界运动规律,为视频生成模型的物理理解能力提供了可量化、可复现的检验手段。

实验

实验设计

Dream.exe 构建了一条 视频生成→轨迹提取→仿真执行 的评估流水线,旨在回答视频生成模型是否隐含物理规律,并能产生可执行的机器人运动。基准包含 101 个手工策划的操纵任务,按物理复杂度分为三个层级(如推、抓、堆叠等),覆盖短至中长时序。评估对象为 8 个模型:前沿闭源生成器(如最新商用模型)、主流开源生成器(如 Stable Video Diffusion、Open-Sora)以及专为机器人设计的策略模型(如 π0、RDT)。对于每个任务,输入场景图像与文本描述,模型输出操作视频;随后通过 2D 点跟踪、深度估计与 3D 提升,将画面运动转化为机器人末端执行器轨迹,最终在 物理仿真器(SAPIEN) 中闭环执行。评测维度分为 视觉质量(VLM 评分)轨迹保真度(ATE、RPE)执行成功率,并辅以人工主观评价。

关键发现

  1. 视觉质量不等于可执行性:VLM 视觉评分高的视频,其提取轨迹的物理成功率往往较低,表明传统外观指标无法捕捉物理合理性。
  2. 互联网规模的生成先验确实编码了物理知识:多款模型在简单任务上获得了 > 0 的执行成功率,证明其生成的运动在一定程度上可落地。
  3. 长时序任务仍是瓶颈:随着步骤增加,所有模型性能显著下滑,暴露出时序一致性与物理连贯性的不足。
  4. 机器人专用训练强化了几何精度,但无助于任务成功率:策略模型产出的动作轨迹更接近真值,但整体任务完成度并未优于通用生成器,说明几何对齐与物理任务理解之间仍有鸿沟。
  5. 域内微调改善外观,而非物理:在机器人数据上微调后模型视频更逼真,但执行率没有明显提升,暗示微调偏向视觉分布匹配而非物理规律学习。

与基线对比解读

实验并未设立单一基线,而是将多类模型并行比较。关键洞察在于:目前以视觉保真为导向的生成模型评测,完全忽略了视频是否能在现实世界中“运行”这一维度。Dream.exe 首次将视频生成模型的评估从像素空间拉入物理交互空间,补上了这一短板。与仅看 FVD、CLIP-Score 等指标的常规做法相比,本框架揭示了不同模型在“幻觉式逼真”与“物理可执行”间的显著差异——即使是最强的闭源模型,其表面惊艳的生成效果也不能直接转化为可靠的机器人操控,这对于利用生成模型进行机器人仿真的研究方向具有警示意义。

行业影响

落地场景

Dream.exe 建立了一套直接衡量视频生成模型中物理合理性的闭环评估体系,其核心思想——将生成视频转化为可执行机器人轨迹——可快速移植到以下产品与业务中:

  • 机器人自动化解决方案提供商:在部署前,利用大规模视频生成模型快速产生候选操作序列,通过 Dream.exe 流水线在仿真中验证可行性,缩短任务编程与测试周期。
  • 制造业数字孪生与仿真平台:为数字孪生环境自动生成多样化的操作演示,扩充训练数据,并利用可执行性指标过滤不符合物理约束的样本。
  • 物流仓储视觉拣选系统:根据货架图像与任务描述,生成拣选动作视频并转换为机械臂轨迹,辅助无示教快速切换 SKU。
  • 内容与游戏引擎:为虚拟环境中的 NPC 操作提供物理上更可信的动作合成,并通过可执行性校验提升交互真实性。

商业价值

  • 降本:减少机器人专家在任务编程与调试上的人力投入。传统上每个新的操作任务都需要大量人工示教或精心设计的奖励函数,Dream.exe 方法使模型直接从场景图 + 文本生成候选轨迹,将人工介入降低到仅需少量验证。
  • 增收:对于机器人即服务(RaaS)厂商,更快的新任务适配意味着更短的交付周期和更高的客户吞吐量;对于仿真软件厂商,集成可执行性指标可提升产品差异化竞争力,吸引更多工业用户。
  • 体验提升:在人机交互场景中,可执行的动作生成让机器人对自然语言指令的响应更稳健,减少因物理不可行导致的碰撞或任务失败,提升整体系统安全性与用户信任。

与现有产品/工作流的接口

  • 接入现有视频生成模型池:Dream.exe 流水线作为评估后端,与 OpenAI Sora、Runway Gen-3、开源模型(如 CogVideoX)等通过统一 API 对接,输入场景图与指令,输出视频后自动进行点跟踪、深度估计、轨迹提取与仿真执行,最后返回可执行性评分。
  • 与机器人操作系统(ROS)及仿真器集成:轨迹输出可直接转换为 ROS 的 JointTrajectory 消息,送入 Gazebo、Isaac Sim 等仿真器执行。已有基于 Python 的运动规划栈可轻易封装 Dream.exe 的轨迹提取模块。
  • 嵌入 MLOps 流程:在模型持续集成/持续部署(CI/CD)中,将 Dream.exe 作为物理可行性测试关卡,只有通过可执行性阈值的模型更新才能推送到物理机器人,显著降低真机调试风险。

具体落地用例

  1. 电商物流中心的拆零拣选自动化
    一家大型电商仓库面临频繁变动的商品品类,需要快速切换机械臂拾取策略。利用 Dream.exe 框架,仓库系统只需拍摄箱内商品图像并输入“从左边取出红色瓶子”的指令,视频生成模型产出操作视频,流水线自动转换为六轴机械臂轨迹并在仿真中验证,验证通过的轨迹直接下发至物理机器人。整个过程无需人工示教,新 SKU 上线时间从数小时缩短至分钟级。
  2. 自动驾驶仿真场景的灵活动作生成
    自动驾驶仿真平台需要大量边缘场景(如路边行人突然闯入、锥桶被风吹倒)来测试感知与规控模块。将 Dream.exe 流水线用于操作层面,可让视频生成模型“想象”出物体运动,再通过运动结构恢复出 3D 轨迹并注入仿真环境,批量生成带物理约束的 corner cases,填补人工设计场景的不足,提升测试覆盖度与模型鲁棒性。

局限

  • **模拟器与真实世界的差距**:评估完全依赖于物理模拟器,其摩擦、接触和碰撞等动力学参数无法完全复现真实环境。执行成功率可能高估模型的物理理解,实际部署到真实机器人时将面临 sim2real 鸿沟。此外,闭环执行依赖于深度估计和点跟踪等模块,累积的误差会混淆对生成视频本身质量的判断,限制了对模型内在物理知识的直接测量。
  • **任务集与难度划分的主观性**:101 个手动策划的任务虽经过三级难度分类,但这一分类基于人类直觉,可能无法精确刻画不同模型所需的物理推理深度。任务分布可能偏向互联网视频中常见的操作场景,使某些模型因训练数据中的曝光偏差而受益,削弱了对泛化能力的衡量。
  • **视频到轨迹管道引入的复合误差**:从生成视频到执行轨迹的转换涉及 2D 点跟踪、单目深度估计、3D 坐标提升等多个容易出错的步骤,且遮档、快速运动等情况会加剧失败。最终执行失败可能源自管道误差而非生成视频缺乏物理可行性,使得分离生成模型贡献与下游模块噪声变得困难,限制了评估的归因能力。
论文Rui Zhao2026-06-04原文

相关内容