Next Forcing:使用多片段预测的因果世界建模
问题:自回归视频生成作为世界动作模型的主流范式,存在训练收敛慢、收敛精度有限(尤其高帧率下)以及推理速度慢的问题。现有方法将训练监督局限于当前片段,缺乏对未来动态的显式信号;推理时需迭代去噪。 方法:本文提出 Next Forcing,一种多片段预测(Multi-Chunk Prediction, MCP)框架。受大语言模型中多令牌预测启发,引入 MCP 训练目标:为主模型附加轻量级辅助 MCP 模块,同时去噪多个未来时间视界(next^1, next^2, next^3 片段)。这些模块形成跨预测深度的因果链:融合主模型多层中间特征来预测未来动态,使近期预测辅助远期预测,并为主模型提供密集的多尺度时序监督。 实验:训练时,MCP 模块显著加速收敛并提升精度。在 50 fps 下,Next Forcing 相比 LingBot-VA 在 5k 步训练实现 93.1% 相对提升,收敛速度加快 2.3x;在 RoboTwin 基准上达到新 SOTA(Clean 94.1% / Random 93.5%)。推理时,保留 MCP 模块可并行预测下一片段,实现 2x 加速。此外,在物理规律基准 PhyWorld 上取得显著改进,通用视频预训练上 FVD 降低超过 50%。 结论:Next Forcing 通过多片段预测框架,同时加速了自回归视频生成的训练与推理,并提升了精度与物理规律遵循度。
论文精读
TL;DR 受多 token 预测启发,Next Forcing 通过同时预测多个未来视频块提供密集未来监督,大幅加速自回归世界模型训练与推理,并在 RoboTwin 上达到 SOTA 精度。
问题
问题背景
自回归视频生成已成为构建 世界动作模型 (World Action Models) 的核心范式,它通过基于历史观测与动作预测未来视频块 (chunk),为机器人规划、强化学习仿真等任务提供环境动态的前向模拟。这类模型需要在长序列上维持物理一致性,并满足实时或近实时推理的要求。
现有方法局限
主流训练方式沿用 Teacher Forcing:模型在每一时间步仅预测下一个 chunk,并使用该 chunk 的真实值作为监督信号。这种设计存在三个显著局限:
- 短期监督导致收敛缓慢:损失仅来自当前 chunk,模型无法获得关于未来动态的显式反馈,尤其在高帧率 (如 50 fps) 下,单一 chunk 覆盖的物理时间极短,长期依赖学习效率急剧下降。
- 推理时串行去噪:生成过程必须逐块迭代,无法并行预测多个未来 chunk,限制了交互系统的低延迟响应。
- 精度与物理遵循性不足:仅依赖局部误差传播,模型难以捕捉跨多个时间步的物理规律,在 PhyWorld 等物理遵循性基准上表现不佳,FVD 等视频质量指标恶化严重。
技术挑战与重要性
世界模型需要同时攻克 高帧率物理连贯性 与 低延迟推理 的双重挑战。由于逐块预测缺乏全局时间上下文,误差会随序列累积,尤其在长时域预测中产生严重漂移。业界已在语言建模中证明 多 token 预测 能通过密集未来监督显著提升训练效率和表示质量,但视频数据的时空复杂度使得多 chunk 预测的因果链设计和特征融合远比文本困难。如何构建有效的时间因果结构,并将未来信息以多尺度方式注入主模型,是亟待突破的技术瓶颈。
行业类比
这一困境类似于大规模语言模型从 Next Token Prediction 到 Multi-Token Prediction 的跃迁:通过同时预测多个未来 token (或 chunk),引入密集、多尺度的未来信号,不仅加速收敛,还提升了模型对全局结构的把握能力。该思想正被迁移至视频世界模型,以实现更高效的训练与推理加速。
核心洞察
- 将大语言模型中的多 token 预测思想迁移到视频生成,通过因果链实现多块预测(MCP)监督,解决了 teacher forcing 仅关注当前帧、缺乏未来动态信号的核心缺陷。与独立预测未来帧的方法不同,MCP 模块形成跨深度因果链,让近未来预测辅助远未来,使主模型获得多尺度时序梯度,从而在高帧率场景下显著加速收敛并提升精度,这揭示了视频世界模型中时序依赖建模的新维度。
- 高帧率视频生成中,单一时序尺度的监督不足以捕捉快速变化的动态,Next Forcing 通过同时去噪多个未来块提供密集多尺度时序监督,这从根本上不同于传统逐帧自回归或一次预测整个未来序列的方式。它巧妙利用主模型不同层的特征,经轻量级辅助模块低成本传递未来信息,避免大规模参数膨胀,实现了训练效率与模型表达的平衡,为实时物理交互场景的高保真世界模拟提供了新范式。
- MCP 模块不仅在训练时作为额外的监督分支,在推理阶段也可保留,实现当前块与下一块的并行去噪,达到 2 倍推理加速。这种训练-推理架构统一的设计,区别于多数将辅助结构仅用于训练的做法,使得多块预测能力直接转化为部署收益,对于需要低延迟的 embodied AI 系统极具工程价值,同时保持了因果推断的严格性,无需对未来帧做额外假设。
方法
输入与主体架构
输入为带噪声的当前视频块(含动作条件),主模型采用联合视频-动作扩散架构(Joint Video-Action Architecture),负责逐步去噪生成高清视频。
核心模块:多块预测辅助头
Next Forcing 的关键在于引入 多块预测(MCP)模块——一组轻量级辅助头,分别负责预测 next^1、next^2、next^3 等未来时间深度的视频块。这些模块通过以下机制协同工作:
- 多层特征融合:从主网络多个中间层抽取特征并融合,作为每个预测深度的上下文。
- 因果链串联:相邻深度的 MCP 模块间建立因果连接,使近未来预测的特征可传递至远未来预测,形成“近助远”的信息流。
- 独立噪声注入与时序平移:每个深度注入独立的噪声与时间步(Independent Noise Injection),配合时序块平移确保预测目标与当前块保持正确的时间偏移;额外引入 MCP 位置编码区分不同深度任务。 训练时,主损失(当前块去噪)与各深度 MCP 损失加权求和,共同优化。
输出与推理
推理阶段,可保留 MCP 模块进行并行块生成(Parallel Chunk Generation),一次去噪同步输出当前与未来多个视频块,实现 2 倍推理加速;也可移除 MCP 模块以零额外开销推理。
与标准 Teacher Forcing 仅提供当前块监督相比,Next Forcing 通过辅助未来预测头提供密集多尺度时序监督,打破自回归训练的短视局限——这是训练收敛速度与最终精度显著提升的根本原因,尤其在高帧率场景下,效果尤为突出。
实验
实验设计
本工作在三个主要场景上验证 Next Forcing 的有效性:
- RoboTwin 基准,评估世界动作模型在操控任务中的视频预测质量(Clean/Random 设置);
- PhyWorld 基准,专门衡量生成视频对物理定律的遵循程度;
- 通用视频预训练,检验方法在自然视频数据上的迁移能力。 主要对比基线为 LingBot‑VA,并针对不同帧率(尤其 50 fps)分析训练收敛与最终精度。所有实验均采用因果世界建模设置,推理时保持与主流视频生成框架一致的自回归迭代结构。
关键发现
- 高帧率下的训练加速与精度飞跃:在 50 fps 条件下,Next Forcing 仅需 5k 训练步便相对 LingBot‑VA 取得 93.1% 的提升,收敛速度加快 2.3 倍;在 RoboTwin Clean 和 Random 子任务上分别达到 94.1% 和 93.5% 的准确率,刷新该榜单的最高记录。
- 多块预测(MCP)的因果链设计:通过引入轻量 MCP 辅助模块,同时去噪
next^1、next^2、next^3视频块,近期预测信息可流向远期,形成跨深度的时间监督;该结构大幅缓解了传统 Teacher Forcing 仅依赖当前块的监督信号稀疏问题。 - 推理效率收益:保留 MCP 模块后,可并行生成当前块与下一块视频,实现 2× 推理加速,无需增加模型主干计算量。
- 通用性验证:在物理规律遵从性测试中提升显著,并在通用视频预训练上将 FVD 降低 50% 以上,表明多块预测不仅适用于特定操控任务,也具有广泛的视频建模能力。
与基线的对比解读
传统 Teacher Forcing 自回归视频生成在高帧率时,每个训练步仅监督当前块,模型无法获得关于未来动态的直接信号,导致收敛缓慢且易陷入局部最优。Next Forcing 的 MCP 目标从根本上改进了这一缺陷:它通过在多个未来时间层同时施加去噪损失,让主干网络从稠密、多尺度的时序反馈中学习,从而加速收敛并提升上限。与 LingBot‑VA 相比,Next Forcing 不仅训练效率倍增,而且在 RoboTwin 上达到新 SOTA,尤其在高帧率场景下优势更为突出;在 PhyWorld 物理一致性测试中同样大幅领先,说明模型学到了更鲁棒的世界动力学表征。FVD 的大幅下降进一步证明该方法对通用视频预测任务的适配性,为自回归世界模型提供了一条高效、可扩展的演进路径。
行业影响
落地场景
Next Forcing 适用于任何需要从视频或行动序列中学习世界模型并进行预测性控制的场景,尤其在高帧率(如 50 fps)下优势显著。典型应用包括:
- 自动驾驶仿真:利用多块预测快速生成未来行驶场景,加速决策规划模型的训练与验证。
- 机器人操控:在 RoboTwin 等基准上,Next Forcing 已证明能提升任务成功率,可集成至真实机器人的视觉-行动闭环学习,提高复杂任务的泛化能力。
- 内容生成平台:视频生成或游戏引擎中,通过多块并行预测实现 2 倍推理加速,降低视频生成延迟,改善用户体验。
商业价值
- 降本增效:训练收敛速度提升 2.3 倍,且仅需少量辅助模块(MCP 模块),无需大幅增加参数,可显著降低 GPU 训练时长与云成本。推理侧可在不牺牲质量的前提下实现 2 倍速度,降低线上服务成本。
- 体验提升:在高帧率场景下保持高精度生成,对自动驾驶或机器人任务可靠性要求苛刻的环境,能减少失败率,提升系统可用性。
- 可扩展性:框架与具体骨干网络解耦,可灵活迁移至不同视频生成架构,降低企业技术选型风险。
与现有产品/工作流的接口
Next Forcing 设计为轻量级增强模块,可与主流自回归视频生成管道(如基于 DiT 或 U-Net 的去噪模型)无缝集成:
- 训练阶段:在现有 teacher forcing 训练代码基础上,添加 MCP 模块(独立于主模型的最小化网络)和对应的
MCP Loss,无需修改数据加载或强化学习流程。项目主页已提供代码,可直接接入现有视频预训练或世界模型训练栈。 - 推理阶段:支持两种模式——
零开销模式(直接丢弃 MCP 模块,保持原有推理路径)和并行块生成模式(保留 MCP 模块以并行预测下一个块),可根据部署需求灵活选择。
具体落地 Use Case
- 电商虚拟试穿/场景生成:某全球时尚平台使用视频生成模型为用户创建虚拟试穿影像。引入 Next Forcing 后,训练时间缩短一半,并行生成模式使单次推理延迟从 2 秒降至 1 秒,同时物理一致性的提升减少了衣物飘动失真,增强购买信心。
- 自动驾驶数据闭环:某自动驾驶公司利用世界模型生成 corner case 训练数据。通过 Next Forcing 的多块预测监督,模型更准确建模未来 1-3 秒的复杂交通流,收敛速度加快,使新场景生成周期从数周缩短至数天,加速感知模型的迭代。
局限
- **高帧率场景依赖**:Next Forcing 在 50 fps 下相对提升达 93.1%,但该优势可能随帧率降低而减弱。训练过程需要构造未来多帧的噪声注入与去噪目标,若应用场景帧率较低或变化平缓,多块预测提供的额外监督信号可能冗余,甚至引入不必要计算开销。论文未系统探讨不同帧率下的性能变化曲线,限制了对该方法适用范围的判断。
- **MCP 模块的额外工程代价**:方法引入轻量辅助模块与多层特征融合,虽声称参数量不大,但仍增加了训练阶段的计算与显存负担。推理时若想获得 2× 加速,必须保留这些模块,导致单步推理内存占用上升。在实际工程部署中,尤其资源敏感的边缘设备,这种“加速换内存”的 trade-off 需要更细粒度的消融分析,而论文尚未提供 MCP 模块规模与吞吐量的详细统计。
- **任务泛化性有待检验**:实验集中在 RoboTwin 机器人操作和 PhyWorld 物理规律遵循,通用视频预训练仅简要提及 FVD 降低超 50%。对于开放性视频生成任务(如文本到视频、长视频预测),多块预测是否仍能稳定提升,以及如何选择 chunk 数和预测深度,论文缺少系统性对比。此外,与近期基于 Diffusion Transformer 的自回归视频方法仅做了有限对比,对该方向的最新进展覆盖不够全面。