论文

Marionette: 预测世界状态、渲染几何、绘制外观

Marionette: 预测世界状态、渲染几何、绘制外观

交互式游戏世界模型通常直接在像素或潜空间自回归地预测视觉观测,导致姿态、几何和遮挡等结构化属性被迫由同一个生成序列隐式维持。在长时程上,这些潜在世界属性的误差会累积,使一致性和可控性变得脆弱。本文显式建模演化的世界状态,将精确的几何计算委托给固定且零参数的渲染器,而神经模型仅负责合成外观。 我们将这一思想实例化为 Marionette——面向具有关节点角色的交互式游戏世界模型。其流程分为三步: 1. 两阶段自回归动力学模型预测显式且可解释的 276 维 3D 世界状态,包含多实体关节点骨架、度量级根轨迹和旋转量。 2. 零参数图形桥接器将预测状态转换为姿态控制视频,以闭式解计算世界空间几何和遮挡。 3. 控制条件视频扩散观测模型从所得结构化控制中合成逼真的 RGB 观测。 实验验证了 Marionette 的两个性质。第一,预测的世界状态可直接控制:强制施加不匹配的动作流,48 个保留片段上的根对齐关节误差改变 31%。第二,长时程行为由状态决定且可在状态层面修复:若不加约束,两个生成角色漂移至 21.2 米距离(录制的会话保持在 5 米附近),且三分之一的帧出现地面穿透。对显式状态施加两条规则——地形碰撞器和分离上限——使穿透减少 66% 并保持角色互动,而无须改动观测模型。经由预测状态路由外观未带来可检测的保真度损失,FVD 为 831,对比录制姿态的 799。

论文精读

TL;DR Marionette 显式预测 276 维 3D 骨架状态,用零参数渲染器处理几何,再用视频扩散合成外观,让游戏世界模型具备直接状态控制和长程一致性修复能力。

问题

问题背景

交互式世界模型正成为生成式游戏环境模拟与通用智能体的研究热点,业界追求长期一致性、可解释控制与高保真渲染三者的平衡。

现有方法局限

当前主流方法在像素空间或潜空间直接自回归生成视觉观测,将姿态、几何、遮挡等结构化属性隐式编码在生成序列中。这带来三个具体局限:

  • 状态不可解释:无法直接读取或修改角色的 3D 姿态、轨迹与空间关系。
  • 长期漂移:潜层属性误差随步数累积,导致角色位置漂移、地面穿透、相互距离异常(实验中自由生成的两角色漂移至 21.2 m,而记录数据仅约 5 m)。
  • 控制弱:外部动作只能通过隐式条件影响生成,难以精确约束结构化行为,如强制角色保持特定区域或避免碰撞。

为什么这个问题难且重要

显式建模世界状态需要设计紧凑、可解释的表示(论文中为 276 维 3D 状态),并解耦状态预测、几何渲染与外观合成。固定零参数渲染器保证几何计算确定性,但要求状态预测足够准确以驱动外观模型。从工程角度看,这种状态-几何-外观分层架构让开发者能像修改仿真器参数一样直接干预世界行为,对构建可交互、可调试的游戏 AI 与通用世界模型至关重要。

行业类比

类似自动驾驶领域从端到端像素预测转向显式中间表示(如 BEV 鸟瞰图),通过可解释的状态层实现更强的可控性与故障修复能力。

核心洞察

  • Marionette 的核心洞察是把世界状态从隐式生成序列中剥离,显式建模为 276 维可解释的 3D 骨架状态,并让固定渲染器处理几何,使长期一致性问题转移到状态层,可在不改变观察模型的情况下通过规则修复。对比 pixel/latent 世界模型,后者必须让生成序列隐式维护姿势、遮挡等结构,长期 rollout 误差累积且难以干预;Marionette 的状态可解释,因此可以在推理时施加地形碰撞器和分离上限等规则,直接减少地面穿透 66% 并保持角色互动,无需重新训练。这种显式状态提供了隐式模型不具备的可调试性与可控性。
  • 两阶段动力学(ActionGPT 决策 + PoseGPT 动画)分离了“做什么”与“怎么动”,使外部动作流能够强制作用于预测状态,验证了控制输入的 authority。实验 Q1 中,强制不匹配的动作流使 root-aligned joint error 改变 31%,说明状态对控制输入高度敏感。这与端到端生成视频模型不同:后者即使接收控制信号,底层状态也未必遵循,难以保证长期一致性。Marionette 的分离设计使模型既能忠实于输入,又能通过改变动作流来引导长期行为,为交互式世界模型提供了清晰的干预接口,而不必依赖修改生成器权重。

方法

输入与动力学阶段

Marionette 的输入包含 动作流(action stream) 和初始条件。两阶段自回归动力学模型先由 ActionGPT 进行高层决策,预测未来动作序列;随后 PoseGPT 将该决策转换为显式可解释的 276 维 3D 世界状态,内容涵盖多实体关节骨架、度量根轨迹和旋转。两个模块自回归 rollout,逐步推进状态。

图形桥接与几何计算

预测的 3D 状态进入 零参数确定性图形桥接器。该桥接器以闭式方法计算世界空间几何、遮挡关系和投影,输出 姿态控制视频帧(例如骨骼渲染或深度表征),不引入可学习参数,保证几何一致性。外部规则(如地形碰撞、距离约束)可在这一层注入,用于后续长程行为修复。

观测合成

最后,控制条件视频扩散模型 以图形桥接产生的结构化控制为条件,逐帧合成逼真的 RGB 观测。训练时使用记录视频作为监督,推理时从任意动作流生成长期未来画面。

与直接在像素或隐空间隐式编码结构化属性的游戏世界模型不同,Marionette 将状态预测、几何计算与外观生成解耦,神经模型只负责外观,从而避免长时程下姿态与遮挡误差累积。

实验

实验设计

评估分为 状态层(动力学,绝对单位)与 观测层(渲染,共享地面)。在 48 个留出片段上测试动作流干预,强制不匹配动作流观察关节误差变化;长时 rollout 让两角色自由漂移,测量间距与地面穿透;随后施加地形碰撞器与分离上限规则,验证显式状态修复能力;对比 recorded pose 的 FVD 判断外观保真。

关键发现

  • 强制不匹配动作流使 root-aligned joint error 变化 31%,显式 3D 状态具备直接可控性。
  • 自由漂移下两角色距离达 21.2 m,远超记录会话的约 5 m;约 1/3 帧出现地面穿透。
  • 在显式状态层加规则后,穿透减少 66%,角色保持交互,无需改动观测模型。
  • 外观经状态路由的 FVD 为 831,与 recorded pose 的 799 接近,未损失可感知保真度。

与基线对比解读

相比直接像素/潜空间自回归世界模型,Marionette 将结构化属性外置给确定性渲染器,神经模型只负责外观,避免长时累积误差。可控性实验表明,显式状态改变能线性影响观测生成,而非依赖隐式潜变量微调。FVD 差距在可检测阈值内,证明状态-渲染路径无系统性能退化,为模块化设计提供有力支撑。

行业影响

落地场景

Marionette 的核心是将世界状态预测与外观合成解耦,这使其在需要长时一致性和可控性的交互式生成场景中具有直接价值。典型落地包括:

  • 游戏 NPC 与虚拟角色生成:在开放世界或 RPG 中,基于用户输入或剧情脚本预测角色骨架运动,再通过零参数渲染器生成姿态控制视频,用于快速原型或实时驱动。
  • 虚拟人直播 / 数字内容平台:主播输入动作指令,系统实时生成逼真角色画面,且可通过显式状态施加规则(如防穿模、限制移动范围)进行干预。

商业价值

  • 降本:减少动画师手工调节、状态机编程和穿模修复的工作量,加快内容迭代。
  • 增收:支持低延迟、高可控的交互式内容生成,可拓展新的互动娱乐或虚拟陪伴产品形态,提升用户付费意愿。
  • 体验提升:长时一致性(地面穿透减少 66%、距离漂移可控)直接改善沉浸感和可信度。

跟现有产品/工作流的接口

Marionette 可作为结构化控制模块插入现有生成式视频管线。例如:

  1. 将预测的 276 维显式状态转换为骨骼动画,输入 Unity/Unreal 等引擎或 Blender,进行后期渲染。
  2. 作为条件信号接入 diffusion 视频模型(如 Wan2.2-Fun-5B-Control),无需修改观察模型即可施加规则修复。
  3. 在机器人/自动驾驶仿真中,用其生成多智能体轨迹和外观,提供丰富的合成训练数据。

工程启示:将几何计算交给确定性 renderer、神经网络仅负责外观,比纯 latent world model 更稳定,值得在其他结构化生成任务中借鉴。

局限

  • **外观合成受条件信号限制。** Marionette 的外观模块基于控制视频的 diffusion 模型,最终 RGB 输出取决于渲染桥提供的骨架/轨迹控制图。虽然状态层可精确控制,但外观生成仍存在与真值记录的差距:论文报告 FVD 831 对 799,表明生成视频在时序一致性或细节保真上略逊于真实动作。此外,diffusion 模型不直接建模材质、光照等物理属性,当场景出现复杂阴影、反射或运动模糊时,生成外观可能出现失真。这意味着外观多样性受训练数据分布约束,无法保证在分布外状态(如极端姿态)下仍保持真实感。
  • **状态表征与渲染桥的泛化能力有限。** 显式 276 维 3D 状态专为关节型角色设计,假设骨骼拓扑已知且固定。对于不同角色类别(非人形、可变拓扑、衣物/毛发等),需要重新定义状态向量和手写渲染逻辑。零参数渲染器虽然稳定,但只处理几何与遮挡,不承担材质和形变,因此当角色具有复杂表面属性或非刚性部件时,渲染桥无法提供足够的条件信号。这限制了该方法直接迁移到开放世界游戏或多样化虚拟角色。
  • **长期行为修复依赖人工规则。** 论文展示的状态层修复通过手工设计的 terrain collider 和 separation cap 实现,虽能减少地面穿透和保持角色靠近,但这些规则需要针对每个场景人工设计参数,不具学习能力。如果地形复杂或行为目标变化,规则可能失效或需要反复调参。与端到端可微分模型相比,这种硬编码约束降低了系统的灵活性和可扩展性。
论文Zian Meng2026-08-14原文

相关内容