论文

WorldGuide: 面向程序化任务执行的目标导向视频世界模型

WorldGuide: 面向程序化任务执行的目标导向视频世界模型

视频生成器与基于视频的世界模型能合成看似合理的视觉轨迹,但长时程程序化任务 要求生成过程根据实际已产生的结果自适应调整:模型必须从自身生成的状态判断下一步动作、执行该动作,并识别任务何时完成。开环生成无法适应执行结果,而现有闭环系统多依赖预训练执行器或间接验证,在「决定动作」与「成功实现动作」之间留下鸿沟。 作者将程序化视频生成形式化为视觉世界空间 中的闭环任务执行,并提出 WorldGuide。仅给定初始图像与任务目标,WorldGuide 预测一个原子动作、生成对应视频片段,并利用生成结果选择下一动作或终止。Planner 与 Executor 在同一份步骤级程序化演示上训练:Planner 从视觉进展中预测下一原子动作或任务完成,Executor 则被直接训练以实现预测的动作。层次化视觉记忆 在有界历史 token 开销下维持长时程执行的状态。 由于缺乏用于规划器-执行器联合训练的步骤级动作-视频监督,作者提出 WorldGuide Bench:约 59K 条带步骤标注的视频,覆盖 245 个任务与 27 个程序化类别。 实验显示,WorldGuide 在 WorldGuide-Bench 上取得 33.33% 的 Task Success,高于近期强视频模型 MiniMax-H3 的 29.90%(后者还额外接收了参考动作计划);在仅给定目标的条件下,VideoCraft-Bench 上达到 47.69%,而 MiniMax-H3 为 32.73%。这表明,将规划与可学习的执行相耦合,对目标导向的程序化视频生成至关重要。

论文精读

TL;DR WorldGuide 将程序性视频生成建模为闭环任务执行:预测动作→生成视频→视觉反馈驱动下一步,联合训练 Planner 与 Executor,在步骤级标注 WorldGuide-Bench 上成功率超越 MiniMax-H3,证明耦合规划与执行是关键。

问题

问题背景

视频生成模型在合成逼真视觉序列方面进展显著,研究者将它们作为世界模型用于模拟环境动态。但面向长期过程性任务(如烹饪、组装、维修),生成必须与实际执行结果形成闭环。

现有方法局限

  • 开放环生成一次性输出整个动作序列,无法根据中间执行结果修正路径,导致误差累积。
  • 已有闭环系统通常依赖预训练执行器(如机器人策略)或间接验证模块来落实动作,但规划与执行之间缺乏端到端联合优化。
  • 训练数据缺少逐步动作-视频对齐监督,模型难以从自身生成结果中学习下一步决策。

为什么这个问题难且重要

长期任务中状态空间大、动作依赖强,单步生成误差会沿时间轴放大;模型必须同时具备视觉状态理解、动作预测、执行生成和任务完成判断四种能力,任何一环薄弱都会导致整体失败。工程上,这直接决定视频世界模型能否从“演示生成”走向“任务规划与执行模拟”,是当前具身智能与视频生成交叉领域的关键瓶颈。

行业类比

类似 LLM agent 在工具调用中需要根据工具返回结果动态调整后续调用,而不是基于初始指令一次性输出全部调用;视频世界模型也需要通过生成结果形成闭环反馈,才能可靠执行过程性任务。

核心洞察

  • 闭环规划-执行联合训练是 WorldGuide 的核心机制。与依赖预训练执行器或间接验证的现有闭环系统不同,WorldGuide 将 Planner 和 Executor 在同一批步骤级程序演示上联合训练,使 Planner 能基于 Executor 实际生成的视频片段决定下一步动作或终止,而 Executor 被直接训练来精确实现 Planner 预测的动作。这种端到端的闭环耦合解决了开环生成无法适应执行偏差、以及闭环中规划与执行脱节的问题,显著提升了长时程程序任务的任务成功率。
  • 分层视觉记忆以有界 token 成本维持长时程执行状态。针对长序列程序任务中上下文长度爆炸的工程瓶颈,WorldGuide 设计多尺度视觉嵌入与压缩注入机制,将历史视觉信息分层存储并在固定 token 预算内注入模型,而非像常见做法那样直接拼接全部历史帧。这使得模型在跨越多步的任务中仍能保留关键视觉进展信息,同时控制计算和内存开销,为实际部署中的长时程世界模型提供了可扩展的记忆方案。
  • WorldGuide Bench 填补了步骤级动作-视频监督的空白。现有程序视频数据集往往缺少细粒度动作标注或无法直接支撑规划器-执行器联合训练,WorldGuide Bench 通过收集和过滤约 59K 步骤注释视频,覆盖 245 个任务和 27 个程序类别,为模型提供原子动作与对应视频片段的成对监督。这使得 WorldGuide 能够学习精确的动作-视觉对应关系,并在目标条件甚至参考计划条件下超越强基线 MiniMax-H3,证明了高质量步骤级监督对闭环程序视频生成的关键作用。

方法

核心流程

输入:仅提供初始图像 I0 和任务目标(例如“制作一杯咖啡”)。

关键模块:

  1. ContextPlanner:基于当前视觉状态和任务目标,预测下一步原子动作 a_t 或终止信号。它通过分层视觉记忆获取长程上下文,使历史 token 成本有界。
  2. Executor:接收 Planner 输出的动作,直接生成实现该动作的视频剪辑(例如“拿起杯子”)。Executor 的训练目标与 Planner 一致,均来自相同的步骤级程序演示,确保动作语义与视觉执行对齐。
  3. 分层记忆压缩:将历史生成帧压缩为多尺度嵌入,注入到当前决策中,避免长任务中的上下文爆炸。

输出:闭环执行序列。每步生成视频剪辑后,将结果作为视觉反馈送入 Planner,用于决定下一步动作或终止。整个过程持续到 Planner 输出完成信号。

训练采用顺序策略:先训练 Executor 学习动作到视频的映射,再训练 Planner 基于生成结果进行规划,以缓解联合训练的不稳定。

与同类方法的差异:现有闭环系统常依赖预训练执行器或外部验证器,WorldGuide 则是首次将规划与执行在同一过程数据上端到端学习,使动作决策与视觉实现相互耦合。

实验

实验设计

WorldGuide 在 WorldGuide-Bench 与 VideoCraft-Bench 两个基准上评测。WorldGuide-Bench 含约 59K 条步骤标注视频、245 个任务、27 个程序类别;VideoCraft-Bench 仅提供目标条件。主要对比基线为 MiniMax-H3,在 WorldGuide-Bench 上 MiniMax-H3 额外获得参考动作计划。

关键发现

在 WorldGuide-Bench 上,WorldGuide 的 Task Success 达到 33.33%,超过 MiniMax-H3 的 29.90%,且后者具备参考动作计划。在 VideoCraft-Bench 的 goal-only 条件下,WorldGuide 取得 47.69%,显著高于 MiniMax-H3 的 32.73%。这表明闭环节点选择与生成执行能够提升长程程序任务完成率。

基线对比解读

MiniMax-H3 作为强视频模型,即便获得参考动作计划,仍受限于开环生成与规划解耦。WorldGuide 的 Planner-Executor 联合训练与层级视觉记忆,使动作决策基于实际生成的视觉状态,从而缩小“决定动作”与“成功实现”之间的差距。尤其在 goal-only 场景下优势扩大,证明从生成反馈中重规划的必要性。

行业影响

落地场景

WorldGuide 的闭环视频生成能力可落地于电商产品演示、企业培训、AR 辅助维修、机器人仿真等场景。例如,电商平台可自动生成商品安装或使用步骤视频;内容平台可批量产出烹饪、DIY、设备维护等程序性教程。其核心价值在于生成过程能根据已生成的画面状态动态调整下一步动作,而非一次性开环生成,适用于需要任务完成保证的应用。

商业价值

  • 降本:替代人工编写分步脚本和后期剪辑,减少程序性视频制作的人力投入。
  • 增收:电商场景中可提供更可靠、可验证的商品演示,降低用户理解成本,提高转化率。
  • 体验提升:闭环执行减少视频中动作错乱或步骤遗漏,提升用户对生成内容的信任度,尤其适合教育培训和远程协助产品。

与现有产品/工作流的接口

WorldGuide 可作为规划-执行模块嵌入现有视频生成 pipeline,接收初始帧和语言目标,输出原子动作序列及对应视频片段。其层级记忆机制将历史 token 成本控制在一定范围内,适合长时任务集成。可以通过 API 与现有视频生成模型、VLM 判断器组合,实现闭环质量控制。与 MiniMax-H3 等仅开环生成的模型相比,WorldGuide 不需要预训练执行器,直接通过同一训练数据联合学习规划和执行,降低了系统集成复杂度。

具体落地 use case

  1. 电商产品安装视频:输入产品初始图和“组装完成”目标,WorldGuide 逐步生成安装动作视频,每步检查生成状态,决定下一步或终止。该能力可直接嵌入商品详情页的自动视频生成模块,减少因安装错误导致的退货。
  2. 企业设备维护培训:针对标准操作流程自动生成跟随实际执行状态的指导视频,当操作偏离时自动规划纠正步骤,适用于 AR 辅助维修或工业操作指导,提高培训效率。

局限

  • 数据规模与任务多样性仍受限。WorldGuide-Bench 约 59K 视频、245 任务、27 类别,虽比以往 step 标注数据丰富,但相对通用视频模型的海量预训练数据仍属小样本,且动作空间可能偏向特定 procedural 领域,难以泛化到未覆盖的任务类型。模型对长尾任务、细粒度操作或开放域目标的理解可能不足,仍需要更大规模、多模态的标注与训练策略。
  • 方法依赖预训练视频生成模型作为 Executor 基座,训练成本高且会继承基座模型固有偏差;Planner 与 Executor 分阶段训练可能造成误差累积,缺乏端到端梯度回传。层次化记忆压缩在降低 token 成本的同时可能丢失关键空间细节,影响长时任务的状态追踪精度,这些因素都限制模型在更复杂任务上的稳定性。
  • 实验对比相对有限,仅与 MiniMax-H3 一个强基座模型比较,缺少与其他 closed-loop 规划-执行框架、不同 Executor 选型以及不依赖参考计划方法的充分对照。此外,Task Success 等指标依赖自动 judge,其可靠性尚未经过大规模人工验证;当前绝对成功率仅 33.33%,离实用仍有显著差距,需进一步分析失败模式并优化。
论文Ankan Deria2026-10-08原文

相关内容