ActionSplice:面向交互式世界模型的飞行中动作编辑
Chunk-autoregressive 视频世界模型通常让每个生成的 chunk 以单个动作为条件。因此在采样过程中收到的新动作,要么必须等待下一个 chunk,要么让未来的 solver 评估以旧动作下产生的状态为条件,要么触发回滚并重做已完成的评估。 我们提出 ActionSplice,一个把该问题形式化为 Counterfactual State Transport (CST) 的推理框架。一个轻量级 corrector 将被打断的 backbone-native representation 在同一 solver step 上,输运到由修正动作所诱导的匹配状态。世界模型与 sampler 保持冻结,采样无需重放已完成的评估即可继续。 - 重定向变体 CSTR 更新整个活跃 chunk; - 时序拼接变体 CSTT 保留时间前缀,仅更新后缀。 在 minWM-Wan Action2V 与 HY-WM1.5 上,CSTR 相对直接条件替换将 rollback-relative LPIPS 分别降低 61.5% 与 75.9%;CSTT 将后缀 LPIPS 分别降低 56.1% 与 77.5%,同时相对等待策略带来 2.73 倍与 1.69 倍的 pixel-ready 加速。在 HY-WorldPlay 协议下,CSTR 相对原始 rollout 取得 25.66 dB 的 PSNR、0.6902 的 SSIM 与 0.1337 的 LPIPS。
论文精读
TL;DR ActionSplice 通过反事实状态传输,在不回滚重算的情况下,将采样中途收到的新动作即时拼接到 chunk-autoregressive 视频世界模型,LPIPS 最高降低 77.5%,像素就绪速度最高提升 2.73 倍。
问题
问题背景
交互式视频世界模型正从离线生成转向实时、动作条件的视觉模拟,核心诉求是低延迟响应与流式生成质量。近期 diffusion 世界模型已支持动作条件生成与实时推流,但动作变化带来的中途干预仍是开放问题。
现有方法局限
当前 chunk-autoregressive 架构下,每个生成 chunk 固定条件于一个动作。若在采样过程中收到新动作,系统只能三选一:
- 等待当前 chunk 结束,将新动作推迟到下一 chunk,导致响应延迟;
- 用旧动作产生的隐状态继续后续求解器评估,造成条件不一致与画面漂移;
- 触发 rollback,丢弃已完成求解步骤并重新执行,带来重复算力开销。 这些问题本质上是动作条件与已生成中间表示之间的错误对齐,且直接替换动作条件向量会破坏 backbone 的时序连续性。
技术难点与重要性
对已生成表示做反事实修正,需要在不重放求解器、不修改冻结模型的前提下,把当前隐状态“传输”到新动作对应的反事实状态。难点在于:
- 状态匹配:新动作产生的理想状态与已生成状态存在分布差异,需要轻量 corrector 学习跨动作的映射;
- 时序一致:若只改当前 chunk 末尾,必须保留已生成的时间前缀,避免视觉跳变;
- 实时性:任何修正都不能引入额外 denoising 步骤或长程重算。 业界对可交互世界模型的关注度极高,游戏仿真、具身智能、视频控制等场景都需要中途修改动作但输出不中断的能力。
行业类比
类似自动驾驶仿真中,驾驶员突然转向时,仿真环境需在不重置整个场景的情况下快速修正当前帧并继续渲染。ActionSplice 正瞄准这一“途中改指令但不重启”的需求。
核心洞察
- Counterfactual State Transport 的核心是将飞行中动作编辑视为同一 solver step 下反事实状态的匹配问题。该方法与已有方案的关键差异在于:不修改 chunk-autoregressive 生成内核、不重放已完成评估,而是冻结世界模型和采样器,仅训练轻量 corrector 在 backbone-native 表示上完成状态搬运。这避免了 rollback 的重复计算开销,也避免了条件交换造成的状态不一致,推理时能以极低延迟响应新动作。
- CST_T 的 prefix-preserving 编辑利用时间局部性,只更新当前 chunk 的后缀,从而在保真度和像素就绪速度之间取得平衡。相比 CST_R 更新整个 active chunk 或等待下一 chunk 重算,CST_T 保留已生成且未受动作变化影响的前缀,只在受扰动的后缀上执行状态修正。实验显示 suffix LPIPS 降低 56.1% 和 77.5%,同时提供 2.73× 和 1.69× 的 pixel-ready 加速,说明局部编辑比全量更新更高效。
- Matched counterfactual supervision 提供了一种无需真实反事实标注的高效训练范式。通过构造同一 solver step 下不同动作诱导的匹配状态对,corrector 学习的是动作扰动引起的表示偏移,而非整体状态重建。该监督信号与模型架构解耦,可泛化到不同 backbone(minWM-Wan Action2V 和 HY-WM1.5),且计算量小,适合作为交互式世界模型的通用推理加速插件。
方法
输入与问题定义
ActionSplice 针对 chunk-autoregressive video world model 的推理阶段,这类模型一次生成一个 chunk,每个 chunk 以单个 action 为条件。当新 action 在采样过程中到达时,已有三种避让策略存在缺陷:等待下一个 chunk 会延迟响应;将新 action 用于未来 solver 评估但保留旧 action 产生的中间状态会导致条件不一致;直接 rollback 则重复已完成的计算。
关键模块:Counterfactual State Transport (CST)
方法将上述问题形式化为 反事实状态传输。在中断点,模型已产生一个 backbone-native representation(如 latent state)。训练一个轻量 corrector,将该表示映射到一个虚拟状态:这个虚拟状态应当与“从一开始就使用修订 action 并在相同 solver step 得到的状态”相匹配。corrector 只作用于当前中断的 chunk,不修改冻结的 world model 和 sampler。
变体:
- CST_R (retargeting):更新整个活动 chunk,使后续生成完全对齐修订 action。
- CST_T (temporal-splicing):保留一个时间前缀不变,仅更新后缀,用于 action 在 chunk 内部发生切换的场景。
训练与输出
训练采用 matched counterfactual supervision:对同一初始状态和 solver step,分别用原始 action 和修订 action 生成两个匹配状态,corrector 的目标是让传输后的状态与修订 action 的状态一致。推理时,在中断点应用 corrector,然后直接从修正后的状态恢复采样,无需重放已完成的 solver 评估。输出为连续的视频帧,保持时间一致性。
与直接 condition swapping 或回滚重放相比,ActionSplice 在不牺牲响应速度的前提下提升了动作切换后的视觉保真度,且对 backbone 零侵入。
实验
实验设计
论文在 minWM-Wan Action2V 与 HY-WM1.5 两个 chunk-autoregressive 视频世界模型上评估 ActionSplice。方法冻结世界模型与 sampler,仅训练轻量 corrector 进行反事实状态传输(CST)。对比基线包括直接条件交换(direct condition swapping)、等待下一块(waiting)以及回滚(rollback)。评估指标选用 LPIPS、PSNR、SSIM 以及 pixel-ready 加速比。HY-WorldPlay 协议下用原始 rollout 作为视觉保真度参考。
关键发现
- CST_R 将 rollback-relative LPIPS 降低 61.5% 和 75.9%(相对直接条件交换),显著提升动作修正后的视觉一致性。
- CST_T 将 suffix LPIPS 降低 56.1% 和 77.5%,同时提供 2.73x 和 1.69x 的 pixel-ready 加速(相对等待)。
- 在 HY-WorldPlay 协议下,CST_R 取得 25.66 dB PSNR、0.6902 SSIM、0.1337 LPIPS,高度接近原始 rollout,表明动作拼接几乎不损伤生成质量。
与基线的对比解读
直接条件交换会在同一 solver step 引入状态不匹配,产生明显的视觉伪影;等待策略则牺牲响应速度。ActionSplice 通过轻量 corrector 将中断的 backbone-native 表示向修订动作对应的反事实状态运输,既避免了回滚的重复计算,又保持了状态一致性。冻结主干与 sampler 的设计使部署成本极低,适合实时交互场景。相比已有 revisable denoising 方法,CST 不修改去噪过程,仅作用于中间状态,工程上更易集成。
行业影响
落地场景
交互式视频世界模型已用于实时内容生成、自动驾驶仿真、数字人直播。ActionSplice 让模型在采样中途收到新动作时能即时拼接,无需等待 chunk 结束或 rollback。可用场景:
- 电商虚拟试穿:用户切换视角/姿势,模型低延迟更新画面。
- 自动驾驶仿真:闭环训练中控制命令变化时,避免重复评估,加速数据生成。
商业价值
- 降本:CST_R 降低 rollback-relative LPIPS 61.5%–75.9%;CST_T 提供 2.73×/1.69× pixel-ready 加速,减少 GPU 重复计算。
- 体验提升:低延迟动作响应改善互动内容留存,适用于直播电商、云游戏 demo。
- 集成成本低:世界模型和采样器冻结,只需轻量 corrector。
与现有工作流接口
作为推理框架部署在 chunk-autoregressive video world model 的 serving 层:
- 在 pipeline 中插入 state transport 模块,拦截动作更新事件。
- 用 corrector 编辑当前状态后继续采样。
- 按需选择 CST_T(保留前缀)或 CST_R(全量重定向)。
具体用例:虚拟主播直播时用户发送“转身”指令,系统 100ms 内返回新帧;自动驾驶仿真频繁改变控制命令,避免 rollback,训练数据生成速度提升近 2 倍。
局限
- - **可移植性与骨干适配成本**:ActionSplice 需要针对不同世界模型骨干设计特定的状态传输和恢复模块(附录 A.1),corrector 的输入输出必须匹配骨干原生表示,这要求对新架构进行定制化修改和训练。虽然世界模型和采样器保持冻结,但 corrector 本身需要额外数据集和训练过程,在资源受限或模型快速迭代的场景中,迁移成本可能较高,限制了即插即用性。
- - **依赖配对反事实监督**:训练 corrector 需要获得同一 solver 步在不同动作下的匹配状态,这通常要求完整仿真或离线生成多条动作轨迹,数据构造和存储开销较大,尤其对于高分辨率长序列。论文未充分讨论数据效率与监督信号的可扩展性,可能在大规模生产环境中成为瓶颈。
- - **评估范围有限**:实验仅在 minWM-Wan Action2V 和 HY-WM1.5 两个模型上进行,指标侧重 LPIPS、PSNR、SSIM 等重建质量,未系统评估长期稳定性、复杂动作组合或与真实回滚策略的公平对比。另外,CST_T 保留时间前缀可能引入前后不一致的边界伪影,论文未深入分析该风险及其对下游任务的影响。