论文

AnchorWorld: 基于视角演化定制的具身化自我中心世界模拟

AnchorWorld: 基于视角演化定制的具身化自我中心世界模拟

尽管交互式世界建模是前沿方向,但在实际应用所需的多功能可控性方面仍未充分探索。为填补这一空白,我们提出 AnchorWorld,一个通过增强交互完整性和灵活的世界定制机制来推进自我中心模拟的框架。 首先,我们利用 3D human motion 作为主要交互模态。为了补充自我中心视角中不可见或被截断的身体部位,我们引入一种辅助训练监督,利用从智能体第一人称感知中解耦的外部视角(exogenous viewpoints)。这使得模型能够观察智能体相对于环境的全身定位,促进人-世界交互的更强空间基础(spatial grounding)。此外,我们提出一种简单而有效的机制来定制自我演化的世界(self-evolving worlds)。这通过在世界统一坐标系内定义 anchor views,并结合描述局部场景动态演化的文本描述(textual descriptions)来实现。 实验结果表明,AnchorWorld 显著优于最先进的基线方法,消融研究验证了我们关键设计的有效性。值得注意的是,我们的定制方案展现出有前景的时空几何一致性,并严格遵循规定的演化动态。

论文精读

TL;DR AnchorWorld 通过混合视角人体动作控制与锚点视图文本演化定制,显著提升自我中心世界模拟的交互完整性与动态场景可控性。

问题

问题背景

交互式世界建模致力于生成可根据用户介入而动态变化的 3D 视觉环境,是虚拟现实、具身 AI 等领域的关键技术。近年来,该方向以第一人称(egocentric)仿真为核心突破点,旨在为智能体提供沉浸式的感知与交互基础。

现有方法的局限性

当前方法主要存在两大瓶颈:

  1. 交互完整性不足:大多数第一人称仿真仅依赖单视角视频训练,由于视场限制,智能体的四肢频繁被遮挡或截断,导致模型无法准确推断自身在环境中的完整位姿。这种信息缺失严重削弱了交互动作的空间定位精度,使得抓取、行走等行为偏离物理真实。
  2. 世界进化定制能力弱:现有模型通常只能生成固定的场景序列,缺乏依据文本指令灵活控制环境动态演变的能力。即使少数工作尝试结合语言引导,其生成的动态过程也常出现时空几何不一致(如物体突然闪现、运动轨迹断裂),难以满足长时、连贯的交互需求。

为什么这个问题既困难又重要

第一人称视角天然存在感知盲区,恢复全身-环境空间关系必须融合多视角信息(例如外生视角),并在生成过程中施加显式的几何约束,这对模型架构与训练范式提出了更高要求。同时,可定制的世界进化要求生成模型理解自然语言描述的演变规则,并在长序列中严格保持三维一致性与时序连贯性,这直接挑战了当前视频生成模型的泛化能力。业界对构建面向具身智能的可控世界模拟器需求迫切,该方向若能突破,将极大推动仿真平台、交互式数字孪生等应用的发展。

行业类比

这类似于为自动驾驶仿真系统提供可编程的场景演化引擎——不仅需要合成多传感器、多视角的逼真数据,还要允许开发者通过文本或参数精确控制交通流、天气等动态元素。AnchorWorld 正尝试在以人为本的交互仿真中建立同等级别的控制力与一致性。

核心洞察

  • 通过外源视点辅助监督解决第一人称视角中身体截断问题:传统以自我为中心的视频生成仅依赖第一人称传感器信息,导致模型无法可靠推理被遮挡肢体的空间位置及其与环境的交互。AnchorWorld 引入来自外源(exogenous)视角的辅助训练监督,使模型能观察代理全身姿态与环境的关系,从而建立更稳健的人-物空间对齐。这一思路突破了常规的第一人称学习范式,有效弥合了有限视场下交互完整性的缺陷。
  • 基于锚定视图的文本驱动世界演化定制:一般场景演化控制通常依赖全局文本或简单相机轨迹,难以保证局部场景变动的几何一致性和时空持续性。AnchorWorld 在世界坐标系内定义可选的锚定视图,并联合文本描述驱动局部场景进行动态演化,使生成内容严格遵循预设的演化指令。该方法简单高效,在保持第一人称沉浸感的同时,实现了细粒度、可解释的世界状态编辑,为交互式世界模型的下游应用提供了新范式。

方法

整体框架

AnchorWorld 以 3D 人体动作作为核心交互输入,目标是生成具身第一人称视角(egocentric)的动态世界视频,并支持对场景演化的用户定制。整个方法遵循“输入姿态序列 → 跨视角空间扎根 → 可演化锚视角注入 → 输出交互一致的自我中心视像”的线索。

关键模块

  1. 混合视角动作控制(Hybrid-View Action Control) 为解决第一人称画面中肢体截断或移出视野的问题,模型在训练时引入**外生视角(exogenous views)**作为辅助监督。这些视角与代理(agent)的自身传感器解耦,提供代理全身与环境相对位置的完整可见性。通过 Spatial Pose Attention 模块,模型学习将 3D 骨架姿态信息跨视角对齐并注入第一人称生成流,从而增强人-世界交互的空间扎根(spatial grounding)。该机制不改变推理时的纯第一人称输入,仅在训练阶段提供额外几何约束。

  2. 可演化锚视角定制(Evolvable Anchor-View Customization) 世界定制部分的核心是锚视角(anchor views)定义:在统一的世界坐标系下选取若干参考相机位姿,并配套文本演化描述(如“桌子逐渐出现咖啡杯”),以控制局部场景的动态变迁。具体实现由三个子组件支撑:

    • In-Context Anchor-View Priors:利用上下文先验捕获锚视角间的 3D 几何一致性;
    • View Pose Injection:将锚视角的位姿信息编码为可注入特征,指导生成器建立多视角间的对应关系;
    • Text-Driven Anchor-View Evolution:通过文本条件控制锚视角内容的时序演化,使模型严格遵循预定义的演变规律。
  3. 渐进式多阶段训练 训练分为逐步递进的阶段:首先在基础数据上学习第一人称生成,然后加入外生视角监督以强化交互完整性,最后引入锚视角文本演化任务实现可定制世界模拟。

输出与差异点

模型最终输出具有时空几何一致性的自我中心视频,且在锚视角强约束下能精准遵循文本所描绘的演化过程。与以往交互世界模型相比,AnchorWorld 的突出差异在于利用外生视角弥补第一人称几何盲区,从而提升交互完整性,并首次提出锚视角驱动的文本可控世界进化机制,将静态场景生成拓展到动态、精准可控的自我世界模拟。

实验

实验设计

论文围绕 第一人称交互式世界模拟 的两个核心挑战设计实验:动作完整性场景可定制性。实验采用 多阶段渐进训练:首先利用混合视图(第一人称 + 外源视角)监督,使模型从第三人称视角学习全身姿态与环境的空间关系;随后引入 锚点视图(anchor views) 机制,通过在世界坐标系中预设视点并结合文本描述,驱动局部场景的动态演化。评估在多个 egocentric 视频生成基准上进行,对比方法包括现有交互式世界模型和视频扩散模型。

关键发现

  • 交互完整性大幅提升:引入外源视角监督后,模型能更准确地恢复被遮挡或截断的肢体,生成的动作与场景交互的物理合理性显著增强,有效缓解了传统第一人称模拟中常见的身体漂移和穿模问题。
  • 世界自定义机制有效:基于锚点视图的演化定制严格遵循文本描述,在保持全局几何一致性的同时实现局部场景的动态变化(如物体增减、光照变化),且时空一致性优于基线方法。
  • 消融实验:分别移除辅助视角监督、锚点视图先验或文本驱动模块,均导致生成质量下降,验证了各组件不可或缺。

与基线的对比解读

相较于现有方法(如仅使用第一人称视频训练的扩散模型),AnchorWorld 的核心优势在于 空间锚定与灵活可控的演化。基线方法常因缺乏完整人体-环境空间信息而产生不合理的交互结果,而我们的混合视图策略从训练阶段就引入了外源观测,使得模型能够隐式学习到鲁棒的 3D 空间对齐。在场景定制方面,多数基线只能通过修改全局文本提示来改变整个场景,缺乏对局部区域的精确定义;我们的锚点视图方案允许在任意感兴趣区域独立注入演化描述,实现了 局部可控且全局一致的场景演化。这种设计更贴近实际 AR/VR 应用中对沉浸式环境动态编辑的需求,同时保持了生成视频的几何和时序稳定性。

行业影响

落地场景

AnchorWorld 提供的具身自我中心世界模拟能力,可被以下产品与业务直接采用:

  • VR/AR 沉浸式内容平台:生成以第一人称视角驱动的虚拟空间,用于虚拟旅游、社交应用或沉浸式训练。
  • 具身 AI 训练数据工厂:自动产生带精确人体-环境互动的视频序列,降低机器人导航、操作模仿学习的数据采集成本。
  • 游戏与元宇宙引擎:实现由玩家动作实时驱动、且环境随文本描述动态演化的开放世界生成。
  • 视频电商:让买家以自我中心视角与商品交互,如虚拟试衣、居家场景漫游,提升决策信心。

商业价值

  • 降本:传统具身交互数据依赖昂贵动捕棚或人工构建 3D 场景;AnchorWorld 通过 辅助外源视角监督锚定视图进化机制,将 3D 人体运动自动映射为多视角一致视频,大幅降低标注与建模开销。
  • 增收:更强的交互完整性(全身体呈现)和定制化世界演化能力,可延长用户沉浸时长、提高转化率(如电商产品页停留时间与下单率)。
  • 体验提升:模型严格遵循文本描述的动态演变逻辑,并保持时空几何一致性,避免了传统方案中场景突变或人物截断问题,直接提升用户对生成内容的感知质量。

与现有产品/工作流的接口

AnchorWorld 可作为视频生成管线世界模型的插件集成:

  1. 上游:输入标准 3D 人体运动数据(如 AMASS 格式)和文本描述,输出多视角视频流。
  2. 下游:生成的视频可通过 神经辐射场 (NeRF)3D Gaussian Splatting 重建为可交互场景,供引擎二次开发。
  3. 模型服务化:将 AnchorWorld 包装为 REST API,接收动作序列与场景描述,返回 MP4 或图像序列,便于内容平台、电商 SaaS 直接调用。
  4. 与现有 AIGC 工具链融合:利用 Stable Video Diffusion 等基础模型,将 AnchorWorld 的锚定视图控制作为条件注入,增强现有视频生成模型的交互一致性。

具体落地用例

  • 电商虚拟试穿:用户上传一段舞蹈或行走动作,输入“切换至秋季森林步道”的文本指令,系统生成第一人称视频展示服装在不同环境下的动态效果。品牌方可以将此嵌入商品页,替代静态模特图。
  • VR 健身应用:用户佩戴 VR 设备进行深蹲或瑜伽时,系统根据锚定视图定制“海边日出”、“雪山顶”等场景,且场景随时间变换光线与气象,保持与用户动作的精准对齐,增强锻炼趣味性与用户留存。

通过这些路径,AnchorWorld 有望成为下一代言视频生成与具身交互的关键组件,帮助厂商低成本构建动态、可控的虚拟世界体验。

局限

  • 依赖3D人体运动与外源视角监督导致训练复杂度升高。AnchorWorld 需高质量3D运动数据及多相机外源标定来提供全身定位监督,数据获取和预处理成本显著增加。当输入运动存在噪声或严重遮挡时,模型易产生生成伪影,鲁棒性受限,难以直接迁移至野外粗粒度运动场景。
  • 锚点视角定制机制对用户专业度要求较高。使用者必须定义统一世界坐标系下的锚点视角并撰写精确的文本演化描述,这要求具备3D空间布局知识与精细语言表达能力。缺少直观的图形交互界面,非专业用户难以快速达成预期时空一致性,限制了工具在实际生产中的可及性与迭代效率。
  • 实验验证侧重于结构化室内场景,开放世界泛化性未充分评估。尽管在基准上取得SOTA,主要评估对象为合成或有限类别环境,未透彻测试真实嘈杂场景、多智能体交互或大幅环境变化等条件。与大规模通用世界模型相比,其在长时序生成多样性与复杂动态适应性方面的上限仍待验证。
论文Yu Li2026-06-05原文

相关内容