论文

Infinite Worlds with Versatile Interactions

Infinite Worlds with Versatile Interactions

本文介绍 LingBot-World 2.0(亦称 LingBot-World-Infinity),是 LingBot-World 的升级版本,带来四项关键改进。 1. 无限交互时长:通过精心设计的 causal pretraining paradigm,模型在保持输出质量一致的前提下实现了无限交互视野。 2. 实时性能:从基础模型蒸馏出 实时变体,确保快速响应,足以驱动 720p 视频流以 60 fps 运行。 3. 多样化交互:相比前代,引入更广泛的交互元素,包括攻击、射箭、施法、射击等动作,以及丰富的文本驱动事件。 4. 多智能体控制:首次在世界建模中集成 agentic harness,其中 pilot agent 负责计划与执行角色行为,director agent 负责随场景推进合成新环境元素。此外,开发了多人共享接口,允许多玩家同时沉浸于这一生动世界模拟器中。我们提供主力 14B 模型和轻量级 1.3B 模型搭配,后者可轻松部署在单 GPU 上。

论文精读

TL;DR LingBot-World 2.0 利用因果预训练实现无限时长稳定交互,蒸馏出轻量实时变体(1.3B),创新性地引入双智能体协同(pilot/director agent)与丰富文本驱动事件,构建多用户共享的互动世界模拟器。

问题

领域现状

交互式世界模型旨在根据动作序列逐帧生成可交互虚拟环境,正成为游戏生成和具身仿真的前沿方向。

现有方法的局限

  • 时域有限与质量衰减:先前模型(如 Genie3、GameGen-X)通常在短时域内保持稳定,但随交互步数增加,画面一致性下降,动作-画面因果链条断裂。
  • 实时性不足:多数世界模型推理延迟较高,难以支持 720p 60fps 这类消费级流畅体验,限制实际部署。
  • 交互元素单一:动作空间受限,缺乏攻击、射箭、施法等多样化操作;事件由单一文本驱动,难以产生丰富的环境变化。
  • 缺乏智能体协作:现有系统多为单一角色交互,无法支持多玩家共存的动态世界,更缺少对世界内容主动干预的导演智能体。

挑战与重要性

长时域因果建模要求模型在自回归生成中维持长期一致性,避免误差累积,这是视频生成与 RL 交互的交叉难题。实时响应需在模型容量与推理速度间取得平衡,通常需要知识蒸馏或高效推理优化。引入多智能体操控(如 pilot agent 规划角色行为、director agent 合成新环境元素)更增加了系统架构的复杂性。业界对此高度关注,因为开放域虚拟世界生成对游戏开发、数字孪生、AI 训练环境均有巨大价值,但落地仍受限于上述瓶颈。

类比启示

如同自动驾驶仿真依赖高保真、实时交互的虚拟环境来训练感知与决策模型,新一代世界模型若能突破实时性与长时域稳定性,将推动游戏生成、影视预演和具身智能训练的范式变革。

核心洞察

  • 因果预训练范式实现了无限交互时长下输出质量的稳定一致性。与以往自回归世界模型在长序列生成时出现的画面漂移、语义崩塌不同,LingBot-World-Infinity 通过精心设计的因果预训练,从海量交互数据中习得了环境动态的根本因果关系,而非表面的帧间映射。这使得模型即使在无界时间范围内也能维持物理规律、物体恒常性和视觉质量,为需要持久化虚拟世界的游戏生成、具身仿真等场景提供了更可靠的基座,避免了以往需借助外部记忆或高频微调的工程补丁。
  • pilot agent 和 director agent 的多智能体协同架构将行为规划与环境生成彻底解耦,开创了模块化、可干预的世界建模新范式。传统方法将动作到画面的生成视为黑盒整体,缺乏对角色意图与场景变迁的显式建模。该工作首次在生成式世界模型中引入智能体框架:pilot agent 负责规划与执行角色行为序列,director agent 则响应文本指令动态合成新环境元素。这种分离不仅让世界演化更可控、更易于编辑,还使得人类创作者能以自然语言直接干预世界的设定与发展,为构建开放、协作的虚拟世界提供了清晰的工程蓝图和更高的扩展灵活性。

方法

整体流程:从动作驱动到世界生成

LingBot-World 2.0 的核心方法以 因果世界模型(Causal World Model)为基础,将交互式环境生成形式化为一个自回归视频预测问题:根据历史帧和用户/代理动作序列,逐帧合成下一帧。输入为多模态动作(攻击、射箭、施法等)或文本驱动事件,输出为连贯的游戏画面。

关键模块设计

  1. 数据准备与标注:通过多维度视频标注管道,对原始游戏视频提取多轨事件级标签,为模型提供精细的行为-画面对齐信号,降低噪声干扰。
  2. 因果预训练:以 14B 参数基座模型进行大规模因果预训练,使模型学习到长期一致的物理规律与交互逻辑,从而突破交互步数限制,在无限长序列上保持画面质量稳定。
  3. 少步蒸馏:为满足实时需求,从预训练模型蒸馏出轻量级 1.3B 实时变体,在单 GPU 上即可驱动 720p@60fps 视频流,同时保持生成质量。
  4. 代理协作框架(Agentic Harness):首次在 world model 中引入双代理协同——Pilot Agent 负责规划并执行角色行为,Director Agent 动态合成新环境元素(如地形变化、NPC 出现),实现可控且丰富的情节展开。
  5. 视觉增强与部署优化:采用 时空细化器(Spatio-temporal Refiner)提高输出平滑度,结合 动态 KV 缓存管理 降低推理延迟,并设计多玩家接口支持共享体验。

作者声明:“Our model achieves an unbounded interaction horizon while maintaining consistent output quality.”

与同类工作相比,LingBot-World 2.0 的差异在于将 代理式干预 与因果预训练深度融合,使得环境演化不再依赖预设脚本,而是由智能体实时决策驱动,兼顾了长时稳定性和交互多样性。

实验

实验设计

本工作围绕 LingBot-World 2.0 的四大升级展开验证:(1) 通过因果预训练范式实现无界交互时域下的质量稳定性;(2) 从基座模型蒸馏实时变体以支撑 720p 60fps 视频流;(3) 扩展交互元素的多样性(攻击、射箭、施法等动作及文本驱动事件);(4) 引入 agentic harness,由 pilot agent 规划角色行为、director agent 合成动态场景元素。同时构建多玩家共享界面以测试协同沉浸体验。系统匹配 14B 主模型与 1.3B 轻量模型,后者用于单 GPU 部署验证。

关键发现

  • 长时稳定性:因果蒸馏模型在无界交互中保持了与短时生成一致的输出质量,未出现漂移或退化。
  • 实时响应:蒸馏变体实现 60fps@720p 的帧率,满足实时交互需求。
  • 交互广度:新增的动作和文本事件使世界交互更加丰富,不再局限于简单移动。
  • 多智能体协同:pilot-director 双智能体架构有效解耦了角色行为与场景演化,提升了可控性与叙事性。
  • 多玩家共享:通过统一接口支持多玩家同时交互,验证了世界模型的扩展性。

与基线对比解读

相较于前代 LingBot-World,2.0 版本在交互时域上从有限步长提升至无界,这得益于因果预训练而非简单的条件扩展。蒸馏策略在保持生成质量的前提下大幅降低延迟,使实时应用成为可能。在交互多样性上,从基础移动扩展至复杂战斗和魔法系统,体现了更强的游戏生成能力。与同类世界模型(如 GameGen-XGenie 等)相比,本工作首次将双智能体控制(pilot + director)融入世界建模,使场景不再是被动响应,而是主动演化,为未来的交互式内容生成提供了新范式。多玩家共享的验证也表明模型在一致性与并发性上优于单用户方案。

行业影响

核心落地场景

LingBot-World 2.0 的实时交互式世界生成能力,直指三个高价值方向:

  • 游戏与互动娱乐:作为游戏引擎的生成式后端,支持开放世界、Roguelike 等品类中动态关卡与事件的无限生成,玩家行为实时改变环境,极大延长内容生命周期。
  • 具身智能与自动驾驶仿真:通过 pilot agentdirector agent 联合生成多样化交互场景与边缘案例,为机器人或自动驾驶策略训练提供低成本、高覆盖的虚拟环境。
  • 虚拟协作与教育:多人共享的沉浸式模拟器可用于远程团队协作、应急演练或历史场景重现,文字驱动的环境变化使非技术用户也能参与内容创作。

商业价值

  • 降本增效:将 14B 模型的知识蒸馏至 1.3B 实时变体,单 GPU 即可驱动 720p@60fps 视频流,省去传统游戏开发中大量人工关卡设计与 3D 资产制作成本,开发周期可从数月缩短至数天。
  • 增收与体验升级:无限交互时长与稳定质量,结合攻击、法术、射击等丰富动作及文本驱动事件,可打造高沉浸感、高重玩度的游戏产品,提升用户付费转化与留存。
  • 新变现模式:通过开放 director agent 的干预接口,允许玩家/开发者自定义世界规则,催生 UGC 生态与创作者经济。

与现有产品/工作流的集成

  • 游戏引擎侧:可作为 Unreal Engine / Unity 插件,通过 HTTP/gRPC 将角色动作与文本指令传入模型,并将生成的视频帧渲染到纹理,替换传统预烘焙场景。
  • 云游戏平台:1.3B 模型的轻量化使其易于容器化部署,与 NVIDIA CloudXR 等流式传输方案结合,直接向终端推送实时世界画面,降低客户端硬件门槛。
  • 仿真与训练框架:可对接 NVIDIA Isaac SimCARLA,作为动态环境生成器,为强化学习 agent 提供无限多样的训练场景,并利用 pilot agent 控制 NPC 行为以制造交互挑战。

具体应用案例

  1. 独立游戏工作室:使用 LingBot-World 2.0 快速搭建具有无限分支剧情的动作 RPG。开发者仅需定义基础世界观,系统即可自动生成包含战斗、解谜、对话的连续世界,并通过 pilot agent 控制敌人与 NPC,实现自适应难度与叙事。
  2. 自动驾驶边缘场景库:利用系统生成罕见但至关重要的交互事件(如突然穿出的行人、掉落货物),大幅补充真实路采数据的不足。director agent 可根据文本描述动态布置道路元素,测试感知模型的鲁棒性。

以上整合点均通过标准 API 实现,无需重构现有管线,显著降低采纳门槛。

局限

  • **长时交互稳定性依赖数据分布**:论文通过因果预训练实现无界交互,但实验主要在有限的动作和事件集上评估。在开放域自由交互下,模型可能积累误差,导致场景逐渐偏离合理状态。没有提供严格的分布外测试或长期退化量化指标,难以判断其在实际非受控环境中的鲁棒性。
  • **实时模型的质量折中**:1.3B 实时变体通过蒸馏获得,以保证 720p 60fps 推理。但蒸馏过程可能损失细节保真度和复杂事件建模能力,影响视觉质量与交互一致性。论文未充分对比蒸馏前后的长序列保真度指标(如 FVD、IS 等),使实际可用性存疑。
  • **Agentic Harness 的局限性**:首创的 pilot/director 双智能体架构增强了世界干预,但行为规划和环境生成仍依赖预定义模板或有限动作空间。面对未见过的新目标或抽象指令时,能否泛化缺乏验证。此外,多玩家共享界面的并发处理与同步机制未深入探讨,可能成为真实部署的瓶颈。
论文Zelin Gao2026-07-08原文

相关内容