论文

Ego2Act: 评估自我中心视频生成中的目标导向操作

Ego2Act: 评估自我中心视频生成中的目标导向操作

视频生成模型正被探索作为具身规划与学习的世界模拟器,这要求它们不仅生成视觉上吸引人的帧,还要预测执行目标导向动作时环境如何动态演化。但现有基准多关注单个短动作或分步指令,多步物理推理 仍未被充分探索,尤其是在需要规划多步真实操作的自我中心视频生成 中。 我们提出 Ego2Act,一个目标导向基准,包含 110 个真实世界任务的 2,640 段视频,覆盖日常场景及不同的物体杂乱度与多步复杂度。给定初始场景图像与高层目标,Ego2Act 评估视频生成模型能否生成手部操作物体的真实自我中心视频。为支持可扩展评估,我们还提出 Ego2ActJudge,一个无参考评估流程,在任务完成度与物理合理性上与人类共识的对齐优于相关基线。 实验发现,模型生成的模拟常跳过或仅部分执行步骤,使后续步骤缺失依赖状态,最终目标无法完成;模型在细粒度物理动力学 上也持续失败,尤其是在复杂物体操作与持续性世界建模中。我们希望 Ego2Act 成为推动视频模型走向物理合理、目标导向模拟的严格测试平台。

论文精读

TL;DR Ego2Act 构建首个面向目标导向操作的第一人称视频生成基准,用 2640 个真实任务视频评估模型的多步物理推理,并引入无参考评估管线 Ego2ActJudge,揭示现有模型常跳过步骤、物理细节失败。

问题

问题背景

视频生成模型正被探索作为 世界模拟器 用于具身规划与学习。业界关注其能否在给定初始场景与高层目标后,生成物理合理、逐步执行的操作视频,以支撑机器人策略学习或仿真数据增强。

现有方法局限

现有基准如 WR-Arena、RBench 主要评估单步短动作或逐步指令执行,缺乏对多步物理推理的覆盖。具体缺陷包括:

  1. 任务设定偏向单一动作,未要求模型跨步骤维护状态依赖(如物体被遮挡后仍需持续存在);
  2. 评估指标依赖参考视频或人工打分,难以规模化;
  3. 缺少自我中心视角下的手部精细操控基准,导致模型在真实世界任务中的泛化能力无法衡量。

为什么难/重要

多步目标导向操作要求模型在长时间范围上预测接触丰富的物理动态,包括物体形变、作用力传导、遮挡与持久性。同时,自动评估任务完成度与物理合理性需要与人类判断对齐,技术上挑战大。业界对 具身智能 与世界模型的投入持续增加,一个严格测试平台能推动视频生成模型从视觉逼真走向物理可信。

行业类比

该问题类似自动驾驶中合成场景生成用于闭环测试,但更强调手部精细操作与多步规划,直接决定模型能否作为机器人策略的可靠仿真后端。

核心洞察

  • Ego2Act 将评估重心从单步动作正确性转向多步骤、目标导向的长期物理一致性。现有基准(如 WR-Arena、RBench)大多关注单步或短动作序列,而 Ego2Act 要求模型从初始场景图像和高层目标出发,生成完整执行过程,并显式检查步骤间依赖状态的满足情况。这种设计直接暴露了当前视频生成模型在“跳过或部分执行步骤”上的典型失败——后续步骤因缺少前置状态而无法达成目标,说明模型虽能生成视觉上合理的帧,但缺乏对任务逻辑链条的因果推理能力。
  • Ego2ActJudge 无参考评估流水线通过子目标分解与多阶段物理门控,显著提升了与人类判断的一致性,并揭示了通用视觉 backbone 在物理理解上的局限。与依赖参考视频或简单 VQA 的 baseline 相比,Ego2ActJudge 采用 staged evidence gathering 和 gated evaluation 防止分数通胀,同时能区分任务错误与物理错误,为模型调试提供细粒度信号。这为可扩展的 embodied 视频生成评估建立了新范式,也指明了未来需强化世界模型中的长期状态追踪与接触动力学建模。

方法

输入与任务定义

给定初始场景图像 I0 和高层目标 G(如“把马克杯放进洗碗机”),模型需生成第一人称视频,展示手部执行多步操作完成该目标。

关键模块

基准构建:从 110 个真实日常任务采集 2,640 条视频,覆盖不同物体杂乱度与多步骤复杂度。每条视频由人类操作者录制,经过人工验证确保任务可达、动作真实,并标注步骤序列、关键物体、动作家族等元数据。

评估器 Ego2ActJudge:采用视觉语言模型作为 backbone,接收生成视频帧序列、初始图像与 G。首先将 G 分解为 subgoal plans,再按任务完成与物理合理性两维度分阶段收集证据:

  • 任务完成:T1 可识别启动、T2 关键过程、T3 最终状态,均为 gate 判断。
  • 物理合理性:P1 实体与世界连续性、P2 可见运动原因、P3 交互中的物理可能性、P4 结果持久性。 各 gate 独立评分,避免无关缺陷影响任务完成判断。

输出

基准提供生成模型的任务完成得分与物理合理性得分,并输出诊断信息(如缺失步骤、物理错误类型)。

与同类方法的差异:现有基准(如 WR-Arena、RBench)多聚焦单步动作或指令跟随,Ego2Act 强调多步骤物理推理与目标导向的长期操作,并通过无参考多阶段 gate 评估对齐人类共识。

实验

实验设计

Ego2Act 基准包含 110 个任务、2,640 段视频,涵盖日常场景、物体杂乱与多步复杂性。给定初始场景图与高层目标,评估视频生成模型能否生成真实第一人称手部操纵视频。引入 Ego2ActJudge 无参考评估管线,通过多阶段门控判定任务完成与物理合理性。

关键发现

  • 生成视频常跳过或部分执行步骤,后续步骤缺少依赖状态,导致目标无法完成。
  • 模型在细粒度物理动态上持续失败,尤其复杂物体操纵与持续世界建模。
  • 接触丰富动作是生成失败的主要驱动因素。
  • 门控评估机制有效防止分数膨胀,多阶段判定器与人类共识对齐更好。

基线对比解读

现有基准多关注单步短动作或逐步指令,Ego2Act 强调多步物理推理与目标导向执行,更贴近真实世界模拟需求。相比相关基线,Ego2ActJudge 在任务完成与物理合理性评估上更接近人类判断,且采用无参考设计,扩展性更强。该工作为视频生成模型作为世界模拟器提供了更严格测试床。

行业影响

落地场景

  • 具身智能与机器人:Ego2Act 可作为世界模型评估基准,用于筛选和迭代能生成目标导向操作视频的模型,直接服务于机器人策略学习、仿真数据生成和 Sim2Real 迁移。
  • 视频生成即服务:在 AR/VR 助手、智能家居控制、游戏 NPC 行为模拟等产品中,需要生成符合物理规律和任务目标的交互视频,Ego2Act 提供统一评测标准。
  • 内容平台与电商:自动生成产品使用演示、组装教程等操作视频,减少人工拍摄成本,提升内容供给效率。

商业价值

  • 降本:Ego2ActJudge 提供无参考自动评估,替代昂贵的人工标注和物理仿真,加速模型研发迭代,降低测试成本。
  • 增收:高质量操作视频生成能力可开放为 API 或模板,帮助商家快速制作产品演示,提高转化率;同时作为技术壁垒增强产品竞争力。
  • 体验提升:模型对多步物理推理和细粒度操作准确性的提升,直接改善生成内容的真实感和可信度,减少用户对 AI 生成内容的质疑,增强交互体验。

跟现有产品/工作流的接口

  • 评估管道集成:Ego2ActJudge 可以作为独立评估模块嵌入视频生成模型的训练循环或 CI/CD 流水线,输出任务完成度(T1-T3)和物理合理性(P1-P4)分数,用于模型选择与回归测试。
  • 数据增强与 RLHF:利用 Ego2Act 的任务定义和评分反馈,构建偏好数据集,用于强化学习或 DPO 优化视频生成模型的目标导向能力。
  • 多模态 Agent 编排:将视频生成作为规划模块,与 LLM、视觉语言模型结合,根据高层目标生成可执行的操作序列,适用于智能助理或自动化工作流。

具体使用案例:

  1. 电商场景:用户上传一张桌面照片并输入“组装书架”,模型生成第一人称操作视频,展示逐步拧螺丝、拼接木板过程。Ego2Act 评估确保关键步骤不遗漏且物理动作合理,商家可将此能力集成到产品详情页,降低视频制作成本并提升用户购买信心。
  2. 企业服务:在工业设备维护中,维修人员输入设备当前状态和“更换滤芯”目标,系统生成标准操作视频用于培训或远程指导。Ego2Act 的细粒度物理评估帮助过滤掉手部遮挡、物体瞬移等错误生成,保证操作指引的可靠性。

局限

  • **数据规模与任务多样性受限**:Ego2Act 包含 110 个任务、2640 个视频,虽然覆盖多步骤操作与不同物体杂乱度,但任务集中于日常起居场景,缺少工业制造、医疗操作等专业领域覆盖。与 Ego4D、Epic-Kitchens 等大规模第一人称视频数据集相比,任务数量低两个数量级,对于训练或评测大规模生成模型的泛化能力可能不足。此外,数据采集依赖人工演示,动作风格与场景变化可能不够丰富。
  • **Ego2ActJudge 可靠性受 VLM 物理理解能力制约**:论文消融实验明确指出 `Limited Physics Understanding of Vision Backbones`,即视觉语言模型对精细物理交互(接触力、物体形变、流体运动等)判断可能失真。尽管多阶段门控与子目标分解提升了对齐度,但在复杂物理场景下自动评分与人类判断仍可能偏差,影响大规模评测的效度。评委模型对罕见但关键的错误(如物体穿透、受力方向错误)可能漏检。
  • **评估维度单一,未覆盖生成质量与多种视角**:基准仅评估任务完成与物理合理性,未纳入传统视频生成质量指标(清晰度、纹理保真、时序稳定性),也未评估动作多样性或风格控制能力,无法全面反映视频生成模型的实际应用潜力。同时,基准只考虑第一人称自视视角,对于第三人称、机器人固定视角或跨视角场景的泛化评估仍属空白。
论文Patrick Amadeus Irawan2026-10-01原文

相关内容