论文

World Model Self-Distillation: Training World Models to Solve General Tasks

World Model Self-Distillation: Training World Models to Solve General Tasks

预训练的视频生成器作为有前景的视觉世界模型,展现出涌现的任务求解能力,但依赖详细文本描述限制了其在规划与决策中的直接使用。现有方法要么将推理外包给语言或视觉-语言模型,要么依赖配对的任务执行视频进行监督微调,但数据收集成本高且难以扩展。 我们提出了一种可扩展框架,通过结合自蒸馏与强化学习来激发此类模型的任务求解能力。给定未标注的场景图像,视觉-语言模型生成候选任务及详细的逐步解决方案,该方案作为条件输入预训练的视频扩散模型(Demonstrator);我们将其行为蒸馏到一个仅以图像和简短任务提示为条件的Executor中,从而将执行知识从字幕引导生成迁移至指令条件任务求解,无需策划任务-视频监督。进一步地,我们利用 VLM 反馈的强化学习优化 Executor,利用判断采样视频是否满足任务与生成解决方案之间的不对称性。 在提出的 WorldTasks-Benchmark 和 DreamGen 机器人基准上的实验表明,在基于 VLM 的评估协议下,Executor 超越了 Demonstrator,并且能迁移到机器人任务上。

论文精读

TL;DR 通过自我蒸馏与强化学习,从视觉语言模型中提取任务解决能力并注入视频扩散世界模型,使其仅凭场景图像和简短指令即可生成任务执行视频,性能超越教学模型,且无需标注任务视频。

问题

问题背景

视频生成模型作为视觉世界模型,展现了涌现的任务解决能力,但现有方法普遍依赖详细的文本描述来引导生成,这限制了它们在规划与决策任务中的直接应用。

现有方法局限

  • 依赖逐步文本描述:如视频扩散模型需要精确的逐步骤说明,而真实任务往往只提供简短的高层指令(如“拾起红色方块”),二者存在鸿沟。
  • 外包推理:将推理过程交给外部语言或视觉语言模型(VLM),先产生描述再生成视频,增加了推理延迟和系统复杂度,且未能内化生成模型自身的决策能力。
  • 监督微调成本高昂:直接使用配对的任务执行视频进行监督学习,需要大量人工演示,数据采集成规模困难,难以泛化到多样化的场景。

为什么这个问题难且重要

  • 技术挑战:需要将VLM从无标注图像中生成的详细方案蒸馏到视频扩散模型中,使后者仅凭图像和简短任务提示就能生成正确的执行视频。这要求模型理解物理动态和任务约束,而非简单模仿。训练过程缺乏成对的真值视频,只能依赖VLM反馈作为奖励信号进行强化学习,极易陷入模式崩溃或产生低质量生成。
  • 业界关注度:在具身智能、机器人操作、自动驾驶等应用领域,世界模型是规划的关键组件。可扩展的无监督或弱监督训练方法能大幅降低构建任务驱动世界模型的成本,是迈向通用智能体的重要一步。

行业类比

类似指令微调(instruction tuning)让大语言模型从文本续写转向遵循用户指令,本文方法旨在让视频生成模型从“根据详细描述生成视频”转向“根据视觉场景和简短任务指令直接生成执行视频”,是视频生成领域的“指令遵循”能力拓展。

核心洞察

  • 利用 VLM 同时作为任务提案者和评判者,构建自蒸馏奖励闭环:VLM 从无标签场景图生成候选任务和详细解决方案,以此条件 Demonstrator 生成示范视频,随后用于蒸馏 Executor。这种范式无需人工标注的任务-视频对,将技能迁移完全纳入模型生成的数据循环,扫清了可扩展性的关键障碍。
  • 离线蒸馏与在线 RL 的组合让 Executor 超越教师模型:首先通过分布匹配自蒸馏,将 Demonstrator 的生成能力从详细描述迁移至仅用简短指令的 Executor;其次借助 VLM 反馈进行 RL 微调,利用“评判是否完成任务”比“生成完整方案”更简单的不对称性,使 Executor 在任务完成度上反超 Demonstrator,为提升世界模型的任务求解能力提供了新路径。
  • 将预训练视频扩散模型定位为通用视觉世界模型,并用语言指令直接控制其行为:不同于外包推理至语言模型或依赖监督微调,本框架通过自蒸馏和 RL 让模型学会理解高层任务提示并执行,在提出的 WorldTasks-Benchmark 和机器人任务中展现出竞争力,为构建通用具身智能提供了简洁有效的方案。

方法

输入

  • 一张无任何标注的场景图像(如桌面、机械臂操作场景)。

关键模块

  1. 任务与方案生成(Vision-Language Model)
    VLM 对输入图像生成一个候选任务(例如“将积木按颜色堆叠”)及详细的逐步执行方案。该方案作为文本条件,指导后续视频生成。

  2. 视频生成 Demonstrator(预训练视频扩散模型)
    Demonstrator 接收场景图像和 VLM 生成的详细方案,生成一段展示完整任务执行的视频。它扮演“专家”角色,提供高质量、但依赖冗长描述的执行轨迹。

  3. 自我蒸馏(Distribution-Matching Self-Distillation)
    将 Demonstrator 的知识蒸馏到一个 Executor(另一个视频扩散模型),使其仅凭图像和简短任务提示(如“堆叠积木”)就能生成任务视频。蒸馏过程最小化 Executor 输出与 Demonstrator 生成分布的差异,分为两种策略:

    • Off-policy 蒸馏:直接用 VLM 生成的条件收集图像-视频对,训练 Executor。
    • On-policy 蒸馏:让 Demonstrator 基于 Executor 当前采样结果生成校正视频,使 Executor 逐步靠近自身分布,缓解分布偏移。
  4. 强化学习优化(RL from VLM Feedback)
    将同一 VLM 用作评判者,评估 Executor 生成的视频是否完成指定任务,并将评判结果作为奖励信号。采用 FlowGRPO(一种在线组相对策略优化算法)更新 Executor,利用“评判易、生成难”的非对称性,在不引入人工标注的前提下显著提升任务成功率。

输出

一个通用的任务条件世界模型(Executor),可直接根据图像和简短指令生成可信的任务执行视频,用于规划、决策或机器人策略学习。

与同类方法的差异

传统方法要么依赖昂贵的配对任务-视频监督信号,要么完全外包给语言模型进行规划;本工作首次通过自我蒸馏与 VLM 反馈强化学习的组合,从无配对视频数据中启发视频生成模型的任务求解能力,具备更高的数据效率和可扩展性。

实验

实验设计

本文构建了 WorldTasks-Benchmark,从无标签场景图出发,由 VLM 自动生成任务描述与分步解决方案文本,构成评估集。实验核心流程分为两步:

  1. 无策略蒸馏(Off-policy distillation):用 VLM 的详细文本控制预训练视频扩散模型(Demonstrator)生成执行视频,再将其行为蒸馏至仅依赖图像+简短任务指令的 Executor,避免标注视频对。
  2. 基于 VLM 反馈的强化学习(RL):利用“判断视频是否完成任务”比“生成执行方案”更易自动化的不对称性,以 VLM 作为一致性奖励,进一步优化 Executor。 此外,在 DreamGen 机器人操纵基准上验证跨域泛化。

关键发现

  • 无监督蒸馏有效:Executor 在 VLM 评价体系下 超越 Demonstrator,证明从描述驱动生成到指令驱动执行的迁移可行,且无需任务-视频对监督。
  • RL 提升解决能力:引入 RL 后,Executor 的视频生成更贴合任务约束,在 VLM 评估中取得 0.40–0.50+ 分数,显著优于纯蒸馏模型。
  • 跨域迁移:在机器人任务中,Executor 竞争力强,表明方法可扩展至具身智能场景。

与基线对比解读

传统方法将规划外包给语言/视觉语言模型(如 UniPi),或因配对视频监督成本过高而受限。本工作直接蒸馏世界模型的内部知识,避免昂贵标注,同时保持端到端视频生成能力。与纯蒸馏版本相比,加入 FlowGRPO 强化学习后,Executor 平均任务得分提升约 0.1–0.15,验证了不对称奖励信号的有效性。相比依赖详细文本作为输入的 Demonstrator,Executor 仅需简洁指令,更贴近实际部署条件,且性能不降反升,体现出 self-distillation 框架的实用价值。

行业影响

落地场景

该框架可将视觉世界模型转化为能够根据简单指令生成任务执行轨迹的Executor 模型,直接嵌入需要视频预测或动作规划的产品线:

  • 机器人仿真与遥操作:在物流分拣、装配等场景中,用Executor 根据初始图像+任务描述生成可行轨迹视频,替代昂贵的人类遥操作数据采集。
  • 视频内容创作工具:内容平台或短视频生产工具中,用户仅需上传一张场景图并输入“将桌子收拾整齐”等指令,模型即可生成连贯的任务完成视频,提升创意效率。
  • 自动驾驶与虚拟测试:生成 corner case 的场景演化视频,辅助感知-规划闭环测试,减少实车路测成本。

商业价值

核心价值在于大幅降低获取任务执行数据的成本,同时提升模型的任务理解与泛化能力:

  • 降本:传统监督微调需要成对的任务执行视频,标注昂贵且难以规模化。本方法仅用未标注场景图像与VLM自动生成任务和解法,训练成本显著下降。
  • 增收:将视频生成模型的能力从“文本到视频”拓展到“指令到任务视频”,可直接作为新的API产品售卖,比如为客户提供“场景理解+动作规划”的视频生成服务。
  • 体验提升:Executor 在WorldTasks-Benchmark上超过了Demonstrator,且在DreamGen机器人基准上具有竞争力,说明VLM反馈强化学习有效提升了执行质量,可能带来更精确、更符合任务约束的生成结果。

与现有产品/工作流的接口

该框架可与现有视频生成和VLM生态紧密集成:

  • 作为现有视频扩散模型的增强模块:Executor 可基于预训练视频扩散模型(如I2VGen-XL、VideoCrafter)初始化,蒸馏和RL训练仅需少量附加参数,可无缝嵌入已有视频生成API。
  • 结合VLM作为评判器:利用已有VLM(如GPT-4V、Qwen-VL)提供一致性/任务违反奖励,无需重新训练奖励模型,与现有云AI服务栈兼容。
  • 数据生成管线:可以离线运行Demonstrator和Executor蒸馏流程,生成海量任务执行视频,为下游规划模型或具身智能模型提供仿真数据,类似于用生成式数据扩增具身学习。

具体落地用例

  1. 电商商品展示自动化:某电商平台需要为家居类商品生成“组装/使用”演示视频。传统做法需雇佣真人拍摄或做3D动画。利用该框架,输入商品背景图和任务指令“组装这个书架”,Executor直接生成逼真的组装过程视频,可显著缩短制作周期并降低成本。
  2. 云端机器人技能训练:机器人公司借助仿真环境训练抓取、放置等技能时,通常需要人工设计大量场景。将Executor作为仿真数据生成器,可根据目标物体图像和“拾起并放入篮子”等任务,快速生成多样化的执行视频,再通过逆动力学模型转换为机器人动作数据,加速策略学习。

局限

  • **VLM 生成的任务与方案质量**:方法完全依赖 VLM 从静态场景图像产生候选任务和逐步解决方案,而 VLM 的幻觉或物理不合理性会直接注入蒸馏过程,导致 Executor 学到错误的执行模式。虽然 RL 阶段引入 VLM 反馈作为奖励,但奖励信号的可靠性同样受限于 VLM 判断的准确性和一致性,且缺乏真实环境交互反馈,使得方法在真实世界任务中的可靠性存疑。
  • **预训练视频模型与计算开销**:自蒸馏建立在预训练视频扩散模型之上,其输出分辨率(最高 512×512)和帧数(16 帧)限制了 Executor 处理长时间、高精度控制任务的能力。此外,离线/在线策略交替训练需要大量采样与 RL 迭代,计算成本高昂,可能阻碍向更复杂场景和大规模数据集的快速扩展。
  • **评估基准与泛化性**:实验主要在合成的 WorldTasks-Benchmark 与仿真机器人环境 DreamGen 上进行,采用 VLM 自动判分,该评估方式与人类偏好的对齐度未经充分验证。同时,Executor 仅在静态场景图像输入条件下训练,面对动态环境或需要多步交互、长期推理的任务,其泛化能力和鲁棒性尚不明确,在真实硬件上的部署可行性需要更多验证。
论文Sebastian Stapf2026-06-10原文

相关内容