超越 Visual CoT:Internalized Visual Thinking 用于主动视频推理
多模态大语言模型 越来越多地使用 Visual CoT 来推理空间、时间和具身环境。通过生成中间推理图像,Visual CoT 为视觉预判提供了直观机制,但带来了大量推理开销,这对主动视频推理尤其不利。我们提出一个关键问题:模型能否在训练期间学会视觉思考,而在推理时直接进行推理? 为此,我们引入 Internalized Visual Thinking (IVT),一种训练后框架,联合优化文本预测和针对未标注视频的 next-embedding prediction。给定部分观测视频,IVT 预测未来帧的潜在表示及目标文本答案,促使模型捕获运动、物体转换、交互和潜在意图。推理时,IVT 直接生成答案,无需合成或重新编码未来帧。我们针对目标表示、解码器设计、预测范围、数据混合、训练课程和预测目标进行了受控研究。 实验结果表明,IVT 在所有六种评估设置上均优于直接答案微调,同时保持相同的推理路径。与显式 Visual CoT 相比,IVT 实现了相当或更好的性能,并将平均端到端延迟降低 5 倍以上。我们的研究共同表明,推理时的显式像素空间生成(如视觉思维链中所用)可能并非有效主动视频推理所必需。预测性世界建模可以在训练中内化,从而产生更准确且明显更高效的多模态推理器。
论文精读
TL;DR IVT 在训练时预测未来帧嵌入来内化视觉推理,推理时直接输出答案,无需生成中间图像,延迟降低 5 倍以上且性能不降。
问题
问题背景
多模态大语言模型(MLLM)在视频理解、具身智能等任务中,越来越多地引入视觉思维链(Visual CoT),通过生成中间推理图像来辅助空间、时序和意图推理。
现有方法局限
Visual CoT 需要显式生成未来帧或中间可视化,这带来显著推理开销:
- 每步生成需调用图像解码器,增加端到端延迟,尤其对主动视频推理(实时问答、行动预测)不可接受。
- 自回归像素生成的计算成本随预测时域线性增长,难以在低延迟场景部署。
- 训练目标偏向图像重建质量,而非任务相关的隐式状态表示,可能引入冗余信息,削弱对关键动态的建模。
为什么这个问题难/重要
核心挑战在于:如何将预测性世界模型在训练阶段内化到模型参数中,使推理时无需合成或重编码未来帧,同时保留对未来状态的隐式理解。这涉及目标表示选择、解码器架构、预测时域、数据配比等多个设计维度,且需要防止在联合优化文本预测与下一嵌入预测时出现任务干扰。
业界对低延迟、高吞吐的 MLLM 部署需求迫切,尤其实时交互、机器人、自动驾驶等场景,显式生成中间图像的成本往往难以承受。
行业类比
类似在端侧视频助手中,模型不能每次回答前先渲染未来画面,而应像人类一样“在脑中想象”后直接给出结论——这正是 IVT 尝试实现的内部化视觉思维。
核心洞察
- Internalized Visual Thinking (IVT) 将视觉思维从推理时的显式像素生成迁移到训练时的隐式 next-embedding prediction,使模型在不增加推理开销的前提下获得预测性世界建模能力。与 Visual CoT 在推理阶段合成中间图像相比,IVT 在训练中联合优化文本预测与未来帧 embedding 回归,推理时直接输出答案,平均端到端延迟降低超过 5 倍而性能相当或更好。这一设计实现了对现有推理管线零侵入的部署路径,对实际工程具有直接价值。
- 论文对 IVT 的设计空间进行了系统消融,涵盖目标表示、解码器结构、预测步长、数据混合、训练课程和预测目标。关键发现是预测未来帧的 latent representation 比预测像素或低层特征更有效,且通过合适的课程学习与数据配比可以进一步提升。此外,模型仅需未标注视频即可进行 post-training,无需未来帧的文本描述,显著降低了数据获取成本。这为在大规模视频数据上构建高效主动推理模型提供了可复用的工程配方。
方法
输入与训练目标
IVT 接收部分观测视频帧与对应的目标文本答案。在训练阶段,视频被截断,模型仅看到前若干帧,需要同时预测未来帧的潜在表示和文本答案。关键设计在于:不是预测像素级未来图像,而是预测某种未来帧表征(如预训练视觉编码器的嵌入),避免生成高维像素。
关键模块:联合优化
核心是双任务损失:
- 文本预测分支:标准的自回归语言建模损失,让模型生成最终答案。
- 未来嵌入预测分支:模型需要输出与真实未来帧嵌入相近的向量,采用对比学习或回归目标。这个分支鼓励模型捕获运动、物体转移、交互与潜在意图。
实验中研究了多个设计选择:
- 目标表征:使用了从 ViT 等视觉编码器提取的嵌入,并比较了不同层的特征。
- 解码器设计:未来嵌入可以由模型直接回归,也可以通过附加的轻量投影头生成。
- 预测视野:预测未来 1 帧或多帧,控制预测距离。
- 数据混合:将监督视频数据与无标签视频数据按比例混合,辅助预测任务可以利用未标注视频。
- 训练课程:先进行纯文本微调再引入预测任务,或两者交替,影响最终性能。
- 预测目标:对比学习(InfoNCE)与直接回归(MSE)的比较。
推理路径
推理时,模型仅接收部分观测视频和文本提示,直接生成答案,无需合成或重新编码未来帧。因此推理路径与标准直接答案微调完全一致,但性能因训练期间内化预测监督而提升。
与同类方法的差异点
与显式 Visual CoT 相比,IVT 把“视觉思考”过程压缩到训练阶段,推理时不产生任何中间图像,从而在保留预测能力的同时将端到端延迟降低超过 5 倍;与单纯文本答案微调相比,IVT 增加了未来帧嵌入预测的辅助监督,使模型学会主动推理,而不是只做反应式映射。
实验
实验设计
本文提出 Internalized Visual Thinking (IVT),在 post-training 阶段对未标注视频联合优化文本预测与下一帧嵌入预测。给定部分观测视频,模型同时预测未来帧的潜在表示与目标答案,以捕获运动、物体转移、交互和潜在意图。控制实验覆盖六类设计选择:目标表示、解码器架构、预测视野、数据混合、训练课程、预测目标。评估基于六个设定,对比直接答案微调与显式 Visual CoT。
关键发现
IVT 在所有六个评估设定上均优于直接答案微调,且推理路径不变。与显式 Visual CoT 相比,IVT 达到相当或更好性能,并将平均端到端延迟减少超过 5 倍。这表明推理时像素空间生成并非必要,预测世界模型可在训练阶段内化,实现更高效的多模态推理。
基线对比解读
与 Visual CoT 的核心差异在于推理时是否生成中间图像。Visual CoT 提供视觉前瞻但引入显著推理开销,尤其不利于需要实时响应的主动视频推理。IVT 通过训练时的预测目标内部化视觉思维,消除了推理时的像素重建成本,同时保持对动态场景的建模能力。对工程实践的启示是:可在训练中引入预测性监督提升推理能力,而不牺牲部署效率,为低延迟视频推理提供了可行替代。
行业影响
落地场景
IVT 主要适用于需要 proactive video reasoning 的产品:
- 自动驾驶 / 机器人: 对部分观测视频预测未来帧嵌入,用于轨迹预测、碰撞预警,避免生成中间像素,可部署于边缘设备。
- 电商 / 直播平台: 实时视频问答与用户意图预测,例如判断用户下一步是否点击商品、是否离开直播间。
- 智能监控 / 企业服务: 工业质检中的异常时序预警、安防场景的行为预测,无需生成中间图像,推理响应大幅加快。
商业价值
- 降本: 推理延迟降低 5 倍以上,减少 GPU 占用与每次请求成本,适合大规模视频分析服务。
- 体验提升: 低延迟使交互式视频问答、实时预测成为可能,用户等待时间从秒级降至亚秒级。
- 增收: 打开需要实时多模态推理的新场景,例如直播电商的动态推荐、自动驾驶的实时决策辅助。
与现有工作流集成
- 推理阶段保持标准 LLM 文本生成接口,无需改变部署架构;只需在 后训练阶段 添加
next-embedding prediction损失,可复用现有视频数据集与训练 pipeline。 - 直接替换显式 Visual CoT 模块,省去中间图像合成与再编码步骤,切换成本低。
具体 use case: 在直播电商中,IVT 模型直接接收部分视频帧并预测未来嵌入,实时判断用户是否可能点击商品,用于动态调整商品卡片排序;在自动驾驶中,IVT 预测未来帧潜在表示,提前识别行人横穿风险,辅助控制决策。
局限
- 方法高度依赖未标注视频数据进行 **next-embedding prediction**,而预测目标是特定视觉编码器的 latent representation;当更换视觉 backbone 或数据分布发生显著变化时,**训练-推理一致性** 可能下降。此外,联合优化文本预测与 embedding 预测会引入额外的训练开销与超参(如预测头设计、损失权重)调节成本,论文虽做了消融,但未讨论训练稳定性与收敛难度。
- 内部化预测在推理时**不生成显式未来帧**,虽然降低了延迟,但可能牺牲对细粒度视觉细节(如小物体运动、精确空间关系)的推理能力;论文报告的整体指标提升可能掩盖了某些需要高精度视觉信息的子任务上的退化。同时,预测 horizon 与 curriculum 的选择对长时程依赖的视频理解可能仍有局限,未验证在超长视频流中的表现。
- 实验主要基于 proactive video reasoning 的特定基准(如 Ego4D 系列任务),离域迁移仅测试了 Charades,覆盖面较窄;与显式 **Visual CoT** 的对比未涉及所有生成式推理场景,也未讨论与统一多模态生成模型(如统一理解和生成架构)的潜在协同或冲突,**实际部署时的鲁棒性** 有待进一步验证。