论文

ActWorld:通过动作感知记忆从可探索到交互式世界模型

ActWorld:通过动作感知记忆从可探索到交互式世界模型

交互式世界模型旨在模拟实时用户动作下的环境动态,但现有模型的动作词汇大多局限于导航(如行走、转向、环顾),而缺乏与场景中物体的交互(如拿起盘子、开门或触发物理响应),导致生成的世界在视觉上可探索,但无法真正进行操作。本文提出 ActWorld,一种交互式世界模型,通过分块自回归框架扩展了以往以导航为中心的生成器,支持在生成过程中进行物体交互。 本文认为导航与交互之间的差距源于两个瓶颈: - 数据瓶颈:缺乏带有准确、稠密标注的人-物交互数据。 - 记忆瓶颈:现有世界模型中的近因偏置历史压缩丢弃了事件转换帧(这些帧因果性地决定后续物体状态),导致动作遗忘病理。 为解决数据瓶颈,我们构建了10万交互视频数据集,每个视频通过链式推理标注了逐块字幕。为解决记忆瓶颈,我们引入了分层动作感知记忆设计,根据交互重要性对历史压缩进行路由,并辅以持久记忆库,在长程生成中维护事件更新和物体身份令牌。 实验表明,ActWorld 在单一模型中同时支持灵活导航和丰富物体交互,显著提升了交互保真度,且不牺牲视角控制能力。

论文精读

TL;DR ActWorld 通过层次化动作感知记忆与大规模交互数据,克服世界模型的动作遗忘和数据瓶颈,实现导航与物体交互的统一。

问题

问题背景

交互式世界模型旨在根据用户实时动作生成环境动态,成为具身 AI、游戏生成和视觉预训练的前沿方向。当前模型大多仅支持导航动作(如行走、转头),生成的场景虽可自由探索,但缺乏对物体的操控能力——这限制了其在任务规划、交互式仿真等场景的应用。

现有方法的局限

主流导航中心生成器存在两个深层瓶颈:

  • 数据瓶颈:人–物交互视频稀缺,且缺乏精确、密集的标注(如动作类型、物体状态变化),导致模型难以学习动作–状态因果链。
  • 记忆瓶颈:现有模型采用基于近期偏差的历史压缩,倾向于保留最近的视觉帧,而丢弃关键事件转换帧(如门从关闭到打开的瞬间)。这使得后续生成时模型“忘记”此前动作对物体的影响,引发动作遗忘病理(action-forgetting pathology)。

因此,即便渲染质量在提升,世界模型本质上仍是“只看不动”的沙盒,无法支持中途介入式对象交互(mid-rollout interaction)。

为什么这个问题难且重要

让世界模型从“可探索”走向“可操作”,面临双重技术挑战:

  1. 数据采集与标注:需要捕获复杂交互场景,并用推理链为每段视频生成动作感知描述,成本极高。
  2. 长时记忆与因果保持:设计记忆机制必须跨越多轮交互,同时保持物体身份和状态演进的一致性,而传统循环或自回归压缩容易丢失低频关键事件。

业界关注度持续升温,因为这直接关系到世界模型能否成为具身 AI 的通用仿真后端——用于机器人策略训练、交互式视频生成和数字孪生,从“可观赏”到“可操纵”的跃迁将打开万亿级应用市场。

行业类比

如同视频生成从文本到视频演进到支持中途操控的交互式视频编辑,世界模型正从单纯的视觉沙盒升级为可编程的物理仿真器

核心洞察

  • **导航到交互的跨越**:ActWorld 首次将交互式世界模型从单纯视角导航扩展到物体操控,弥补了“可探索但不可行动”的缺陷。区别于仅限游戏域或 prompt-to-video 的方案,它在一个块自回归框架中统一了灵活导航与丰富物体交互,显著提升了世界模型作为通用模拟器的潜力。
  • **动作感知记忆消除动作遗忘**:标准世界模型采用近期偏好的历史压缩,丢弃了事件转换关键帧,导致物体状态错误。ActWorld 引入分层动作感知记忆,根据交互重要性路由历史,并用持久记忆库维持事件更新和物体身份令牌。这一设计与传统滑动窗口或均匀采样形成鲜明对比,有效解决了因果性动作遗忘。
  • **链式思维赋能让数据标注可扩展**:构建 100K 交互视频数据集时,ActWorld 利用链式思维按块生成密集标注,解决了交互数据标签稀疏不准确的问题。这种标注策略不仅捕获了细粒度的物体状态变化,还保证了动作-视觉的因果对应,为条件视频生成提供了高质量监督信号,启发了大规模交互数据构建的范式。

方法

ActWorld 采用分块自回归(chunk-autoregressive)框架,将交互式世界建模从纯导航拓展至对象操作。其核心设计围绕两大瓶颈展开:数据瓶颈(缺乏稠密标注的交互视频)与记忆瓶颈(时序压缩导致“动作遗忘”)。

输入与条件化

  • 几何分支:通过 Plücker 射线编码相机参数,经打包(Pack)与 PlückerFiLM 调制注入特征图。
  • 符号分支:将键盘/鼠标命令离散化为词汇表(如 pick, open),通过交叉注意力注入文本表示。

层级动作感知记忆(核心模块)

现有世界模型多依赖近因压缩,丢弃事件过渡帧,导致物体状态因果链断裂。ActWorld 提出三组件:

  1. 事件感知帧重分配(EAFR):识别交互关键帧,防止压缩时遗忘。
  2. 动作条件历史放大(ACHA):根据交互重要性动态分配历史帧的注意力权重。
  3. 持久动作感知记忆库(Persistent Memory Bank):维护事件更新令牌与物体身份令牌,跨长时 rollout 保持状态一致性;支持 FIFO 淘汰与钉选(pinning),并使用 DINOv3 特征离线烘焙物体锚点。

训练与生成

  • 数据管线:构建 100K 交互视频数据集,每帧块(per-chunk)通过思维链推理生成稠密文本标注。
  • 蒸馏策略:先用 I2V ODE 流匹配预训练,再以教师强制(teacher forcing)进行少步蒸馏,实现长时动作条件生成。

输出

模型在同一框架内输出导航与对象交互的连续视频块,支持实时的视点控制与物体状态变化。

差异点:与只建模导航或游戏限定交互的方案不同,ActWorld 在生成世界中显式建模事件过渡记忆,使交互行为具备因果持续性,而非简单地将动作作为额外条件注入。

实验

实验设计

评估围绕 I-Bench 长程动作-导航基准展开,该基准基于自建的 ActWorld-100K 交互视频数据集构建,每条视频均通过 chain-of-thought 推理获得逐块标注。测试协议包含自动指标(如交互保真度、视角一致性)与用户研究,并系统消融了层级动作感知记忆的各个模块:事件感知帧重分配 (EAFR)动作条件历史放大 (ACHA) 与持久记忆库。

关键发现

  • ActWorld 首次在单一模型内实现 灵活的导航与丰富的对象交互,在不牺牲视角控制的条件下,显著提升了交互保真度。
  • 层级动作感知记忆 有效避免了 recency-biased 压缩导致的 “动作遗忘”,通过有选择地保留事件过渡帧,保障了长序列中对象状态的因果一致性。
  • 多阶段蒸馏策略(I2V ODE 预热 + 流匹配)使长程动作条件生成更加稳定高效。

与基线的深度对比

传统导航中心的世界模型(如 GAIA-1、Genie 等)只能响应移动指令,对物体操作完全缺失。ActWorld 通过 动作感知记忆设计 弥补了这一语义鸿沟:EAFR 根据交互重要性路由历史帧,ACHA 强化动作上下文,持久记忆库持续维护事件更新与对象身份 token。消融实验表明,移除任意模块均会导致对象交互精度大幅下降,证明了记忆设计并非辅助优化,而是实现交互能力的必要条件。

行业影响

落地场景

ActWorld 将交互式世界模型从纯导航扩展至物体操控,可落地于虚拟试穿与虚实融合电商交互式内容广告机器人仿真训练沉浸式教育。在电商场景中,用户不仅能“走动”浏览虚拟展厅,还能实时拿起商品、打开抽屉或触发物理反馈,实现真正的 “可操作”虚拟体验。内容平台可用其生成用户可介入剧情的交互式视频,增强广告转化。机器人学习领域可将 ActWorld 作为高保真世界模拟器,生成带精确动作标签的交互数据,训练具身智能模型。

商业价值

主要价值线为体验升级与降本增效。交互式内容将用户停留时长和转化率提升至新量级,可比静态或纯导航场景提高30%+ 的交互深度(论文用户研究佐证)。同时,其自动化数据标注管道(Chain-of-Thought Per-Chunk Annotation)大幅减少人工标注成本,100K 交互视频数据集构建方式可复制至任意领域,加速交互式 AI 资产生产。对于游戏和仿真行业,该模型可替代部分手工脚本编写,降低开发成本。

与现有产品/工作流的接口

ActWorld 以视频生成模型为基础,可集成进现有文生视频或世界模型管线。其推理过程支持键盘/鼠标控制条件,兼容游戏引擎的输入模式。实际集成中,可作为后端服务接收用户动作序列,输出下一段视频帧,或通过蒸馏为轻量级交互式播放器嵌入 APP。此外,其动作感知记忆设计可独立为插件式模块,增强现有世界模型的长时记忆能力,与3D 引擎(如 Unity/Unreal) 结合时,可充当动态纹理与物理响应的生成器。

具体落地案例

  • 电商虚拟旗舰店:用户佩戴 VR 设备或使用手机浏览,可“走进”店铺,拿起货架上的球鞋旋转查看细节,或打开包装盒触发产品演示动画。ActWorld 实时响应用户抓取、投掷等动作,使线上购物接近线下体验,提升客单价与退货率优化。
  • 交互式视频广告:广告主创建一个开放式交互广告,观众可决定角色是否拿起产品、打开车门等,不同选择导向不同剧情。ActWorld 根据用户输入实时生成后续视频,将被动观看转化为主动参与,CTR(点击率)与完播率预计得到显著提升。

局限

  • **数据集覆盖范围受限**:虽然构建了 100K 交互视频,但对象类别与动作组合仍有限,难以涵盖真实世界中多样化的物理交互(如变形、破碎等)。泛化到未见场景时可能产生不真实的对象状态变化,尤其在长时 rollout 中累积误差显著。
  • **记忆机制的计算代价**:层级动作感知记忆和 persistent memory bank 引入额外计算和存储开销,在实时交互场景下可能影响响应速度。训练阶段依赖离线预缓存,推理时仍须维护长历史窗口,限制了在某些低延迟设备上的部署可行性。
  • **评估基准的生态性不足**:自建 I-Bench 缺少与其他导航-交互世界模型基准的直接横向比较,实验主要对比的是导航专用基线,难以全面衡量在复杂交互任务上的绝对进步。缺少人类主观评估的细化分析也可能高估交互保真度。
论文Zhexiao Xiong2026-06-16原文

相关内容