先想象再预测:交错潜在视觉推理用于视频事件预测
视频事件预测(VEP)要求模型从局部视频证据推断未观测的未来状态。现有视频多模态大语言模型(MLLM)通常将中间未来推理过程在文本空间中进行语言化:一旦视觉证据被转述为文字,细粒度的运动、几何和交互线索可能丢失,导致看似合理但缺乏视觉依据的幻觉。 本文提出 Future-L1,一种交错潜在视觉推理框架,在自回归解码过程中让 MLLM 在语言令牌与连续潜在视觉跨度(latent visual spans)之间交替。为训练该能力,我们构建 Future-L1-50K 数据集:选取未来视觉提示有助于预测的样本,将潜在状态对齐到未来帧嵌入,并通过 LA-DAPO(一种潜在感知强化学习目标,包含结果对比奖励和时序多样性奖励)进一步优化采样到的潜在轨迹。 在 FutureBench 基准上,Future-L1 将 Qwen3-VL-8B 从 61.0 提升至 85.4,超越此前最佳模型 Video-CoE 达 10.4 点;在 TwiFF-Bench 上,平均得分从 2.44 提升至 3.04。 结果表明:面向未来的视频推理受益于在潜在空间保留中间视觉语义,而非将每一步推理都翻译为文本。
论文精读
TL;DR Future-L1 通过在自回归解码中交替融合潜在视觉片段与语言 token,保留中间视觉语义,避免文本化推理导致的幻觉,在视频事件预测基准 FutureBench 和 TwiFF-Bench 上大幅超越先前最优模型。
问题
问题背景
视频事件预测 (Video Event Prediction, VEP) 要求模型从部分视频片段中推断未发生的未来状态,是视频理解的关键前沿。
现有方法局限
主流视频多模态大语言模型 (MLLM) 通常将中间推理过程完全文本化:先将视觉证据转换为离散语言描述,再在文字空间进行逻辑推演。这一范式存在根本性缺陷:
- 细粒度视觉线索丢失:运动轨迹、几何形变、物体交互等连续信息在文字化过程中被严重压缩,难以还原。
- 幻觉风险高:模型基于文本生成“看似合理”的未来描述,却可能完全偏离原始视频的物理约束,产生 视觉无根据 (visually ungrounded) 的预测。
- 推理与视觉脱节:语言空间的推理无法直接存取隐含的视觉语义,导致对复杂时空动态的建模能力不足。
为什么这个问题难且重要
VEP 的核心挑战在于让模型同时掌握物理世界常识、因果推理和时空演变模式,这是向通用智能迈进的关键一步。其难度体现在:
- 连续语义与离散符号的鸿沟:语言只能有限表征视觉世界,而未来预测天然需要连续空间中的“想象”(如物体运动轨迹)。
- 潜在推理的可训练性:若让 MLLM 在 潜在视觉空间 内插入连续 spans 进行推理,需要设计全新的训练范式,确保生成轨迹与未来真实帧对齐。
- 评估基准缺失:直到 FutureBench 和 TwiFF-Bench 等专门基准出现,VEP 的系统化评测才成为可能,但多数模型表现不佳。
业界对该方向高度关注,因其直接赋能自动驾驶、机器人规划、视频异常检测等高风险场景。
行业类比
类似自动驾驶系统预测周边车辆意图——不能仅靠文字描述“车辆可能左转”,而必须在连续坐标空间中生成精准的未来轨迹,该需求与 VEP 中保留视觉语义的潜在推理一脉相承。
核心洞察
- 视觉推理的核心瓶颈在于文本化转换导致的信息丢失:现有视频 MLLM 将中间推理步骤全部在文本空间展开,但一旦视觉证据被 verbalize,细粒度运动、几何与交互线索便易丢失,产生看似合理却视觉失真的幻觉。Future-L1 提出在自回归解码过程中交错插入连续潜在视觉跨度,使模型在 latent space 中保留未来帧的视觉语义,而非强制每一步都转成 token,这从根本上改变了推理的信息表示形式,相比完全文本或完全潜在的方法,更接近人类“先想象再预测”的认知机制。
- 面向未来预测的潜在状态对齐与优化策略具有鲜明独创性:通过构建 Future-L1-50K 数据集,仅选取那些未来视觉提示对预测真正有帮助的样本,将潜在状态与未来帧嵌入对齐,并用 LA-DAPO 这一潜在感知的 RL 目标同时优化结果对比奖励(鼓励正确预测)与时间多样性奖励(防止潜在表示退化),使得模型不仅学会了何时插入潜在视觉跨度,还学会了生成多样化且与未来高度相关的视觉想象。这种数据驱动与强化学习结合的范式,为视频预测任务中的隐式视觉 reasoning 提供了可训练的端到端方案,与纯监督微调或经验性插入潜在 token 的做法形成差异。
方法
输入与任务定义
Future-L1 处理 视频事件预测(VEP) 任务:给定部分观测视频帧,要求模型推断未发生的未来状态(如动作、交互、场景变化)。输入为一系列连续的视觉帧和自然语言问题,模型需输出对未来的描述或选择。
核心模块:交错潜在视觉推理
传统视频 MLLM 倾向于将所有中间推理转换为文本,导致运动、几何等细粒度视觉线索丢失,易产生“合理但视觉无根”的幻觉。Future-L1 提出 交错式潜在视觉推理:在自回归解码过程中,模型交替生成 语言 tokens 和 连续潜在视觉跨度 (latent visual spans)。潜在跨度直接保留视觉语义,避免文本化损耗,使模型能“在脑海中想象”未来帧。
- 动态潜在预算:推理时模型自适应决定何时插入潜在跨度及跨度数量,避免冗余,提升效率。
训练策略:SFT + 潜在感知 RL
为赋予 MLLM 这种能力,团队构建了 Future-L1-50K 数据集:
- 视觉增益筛选:仅保留那些提供未来视觉提示能显著提升预测准确率的样本,确保数据蕴含“对潜在推理的真实需求”。
- SFT 目标:将生成的潜在状态与对应未来帧的视觉编码(例如 DINOv2/SigLIP 特征)进行对齐,使潜在空间具备未来表征能力。
随后用 LA-DAPO (Latent-Aware Direct Alignment from Preference Optimization) 进行强化学习优化:
- 结果对比潜在奖励:对比正确预测与错误预测对应的潜在轨迹,鼓励整体预测一致性。
- 时间多样性奖励:惩罚各潜在跨度间过于相似的表示,防止模型陷入静态想象,保证时序演化多样性。
输出与应用
模型直接输出文本预测,但中间潜在状态参与解码过程,提升对复杂动态和交互细节的把控。在 FutureBench 和 TwiFF-Bench 上大幅超越先前最佳方法。
与同类工作的核心差异:不同于 Video-CoE 等仍将视觉信息完全文本化的方案,Future-L1 首次实现在潜在空间保留并迭代视觉推理,相当于为 VLM 增加了一个隐式“视觉工作记忆”,显著降低高动态场景下的幻觉率。
实验
实验设计
- 模型:基于 Qwen3-VL-8B,插入潜在视觉 token,实现语言与潜在视觉跨模态交替自回归解码。
- 训练:SFT 阶段使用 Future-L1-50K 数据集(筛选 visual-gain 样本,对齐潜在状态与未来帧嵌入);RL 阶段采用 LA-DAPO 目标(outcome-contrastive 奖励 + temporal-diversity 奖励)。
- 评估:FutureBench(选择题、开放式问题等)和 TwiFF-Bench(细粒度未来预测),指标为准确率和平均分。
关键发现
- FutureBench 上绝对提升 +24.4 点(61.0→85.4),超越之前最佳 Video-CoE 10.4 点。
- TwiFF-Bench 平均分 +0.60(2.44→3.04),验证了潜在视觉推理的泛化性。
- 消融:RL 奖励组合(outcome+temporal)比单一奖励更优;自适应潜在预算有效平衡效率与精度。
与基线深度对比
相比于 Video-CoE 等以文本为中间推理链的方法,Future-L1 在潜在空间保留动态视觉语义,避免文本化导致的运动与几何信息损失,因而预测更 grounded、幻觉更少。RL 阶段对潜在轨迹的直接优化(对比式学习 + 时间多样性)进一步强化了时序一致性,超越了单纯 SFT 的效果。这表明未来导向的视频推理更适合在连续潜在空间中进行“想象”,而非强制逐步骤文本转译,为视频预测类任务提供了新的架构范式。
行业影响
落地场景
Future-L1 的交错潜在视觉推理适用于所有需要从部分视频证据推断未来状态的场景。直接受益的产品包括:自动驾驶系统中的行为预测模块(预测行人、车辆轨迹);安防监控里的异常事件预警(在事件发生前几秒触发);视频编辑工具的下一帧生成或智能剪辑建议;人机交互中的动作预测(协作机器人预判人类意图);以及短视频平台的内容理解与推荐(提前判断视频走向,提升标签准确率)。
商业价值
核心价值在于降低幻觉、提升预测可靠度,进而直接转化为:
- 降本:在监控、质检等场景中减少人工复核,降低误报带来的运营成本;
- 增收:更精准的视频推荐与广告插入(如提前预测视频高潮点)可提升点击率与转化;
- 体验提升:自动驾驶中更早、更平滑的轨迹预测带来更自然的乘坐体验,视频工具中更智能的剪辑建议缩短创作时间。
论文报告在 FutureBench 上将基座模型从 61.0 提升至 85.4,超越先前最佳模型 10.4 点,这种精度飞跃可直接转化为上述业务指标。
与现有产品的接口
Future-L1 可作为即插即用的优化模块集成进现有视频 MLLM pipeline。训练时,通过构造的 Future-L1-50K 数据集进行 SFT,再用 LA-DAPO(潜在感知 RL)微调。推理时,仅需在自回归生成中动态插入连续潜在向量,不改变原有输入输出接口,可与 Qwen-VL、Video-LLaMA 等主流架构兼容。对已有视频理解产品,可在模型服务层增加一个推理适配器,无需重构数据流。
具体用例
- 自动驾驶感知-预测联合模型:现有方案通常将检测、跟踪、预测分步进行,中间抽帧编码为文本可能丢失精细运动信息。Future-L1 的交错潜在视觉跨度允许模型在预测目标未来位置时保留原始视觉特征,直接输出更稳定的轨迹分布,可用于 L4 自动驾驶的长尾场景挖掘。
- 视频电商的动态商品推荐:在直播带货中,根据正在展示的商品片段预测未来可能出现的搭配,提前加载推荐面板。传统纯文本推理容易误判相似款式,Future-L1 在潜在空间保留细粒度几何与纹理信息,可提升搭配推荐的视觉一致性,从而提高加购率。
集成方式:在现有直播理解服务中,用 Future-L1 替换预测分支的 LLM,输入为实时视频流片段,输出为未来帧的潜在表示及文本描述,再对接推荐引擎。
局限
- **潜在状态可解释性不足**:Future-L1 引入的连续潜在视觉片段虽能保留细粒度运动与几何信息,但其内部表征缺乏类似文本符号的可读性。在错误预测或幻觉发生时,难以直观定位是哪个潜在步骤出错,这给调试、安全审核及模型行为理解带来阻碍,尤其对于高风险应用场景可能成为采纳障碍。
- **训练数据构建依赖启发式筛选**:Future-L1-50K 通过“视觉增益”元规则挑选有利于潜在推理的样本,但该筛选过程可能引入分布偏差。模型在非筛选分布下的泛化能力未充分验证,且数据构建成本较高,难以快速扩展到新的视频领域或任务。
- **推理效率与动态预算调优成本**:虽引入动态潜在预算以控制推理计算量,但该预算本身需要针对不同复杂度视频进行自适应调整,实际部署时可能增加调参负担。此外,交错解码机制会延长自回归序列长度,在长视频上可能带来不可忽略的延迟,论文未与仅文本推理方案进行系统性的延迟对比分析。