论文

InternVideo3: 使用多模态上下文推理智能体化基础模型

InternVideo3: 使用多模态上下文推理智能体化基础模型

近期基础模型研究倾向于具备多步推理和工具使用的智能体行为,但开源工作主要聚焦文本,长程多模态任务(如视频理解)仍待探索。本文提出 InternVideo3,通过 多模态上下文推理(MCR) 增强该能力。MCR 将理解视为闭环过程,共享演化上下文含观测、指令、推理、工具动作和记忆,将长视频理解建模为证据积累与验证。 为提升效率,引入 多模态多头潜在注意力(M^2LA),一种保留 token 的重参数化方法,压缩 KV-cache 状态的同时保留完整 token 流。训练采用分阶段策略:继续预训练、短到长监督微调、基于规则的强化学习以及策略蒸馏。 实验表明,InternVideo3 在 Video-MME、MLVU 和 EgoSchema 等基准上取得强劲性能。进一步将其实例化为带检索工具的视频智能体,展现出可靠的证据驱动行为。 结果表明,高效上下文处理与闭环推理对于将开放多模态模型适配长程视觉智能体至关重要。

论文精读

TL;DR InternVideo3 通过多模态上下文推理与高效注意力压缩,将通用模型转化为能闭环验证证据的长视频代理,在多个基准上性能领先。

问题

问题背景

多模态基础模型正从单步预测转向具备工具调用、记忆与自我修正的 Agent 化行为,尤其在长程视觉理解任务(如小时级视频分析)中需求迫切。

现有方法局限

当前开源方案多聚焦纯文本场景,多模态长任务仍以一次性前向推理为主,缺乏对持续观测、指令、工具执行和记忆的闭环上下文建模。具体表现:

  • 时间维度线性扫描:视频模型常将长序列均匀采样后直接编码,忽略关键帧间的因果关联与证据累积,难以定位短时事件或进行跨段比对。
  • KV-cache 膨胀:长视频帧数增加导致推理时显存和延迟指数增长,现有稀疏/压缩方法丢弃大量 token,损害细粒度时空信息。
  • 无交互验证:模型无法像人类一样“回看-假设-验证”,输出唯一且无工具辅助纠错,面对复杂多问或特定期证据要求时易出现幻觉。

为什么这个问题难/重要

长视频理解本质是证据积累与验证的迭代过程,要求模型在保留完整 token 流的前提下动态整合跨片段信息,并对上下文进行读写编辑。技术挑战在于:

  • 效率与完整性的冲突:既要避免 KV-cache 过大,又不能丢失潜在关键帧,需重新设计注意力机制的压缩策略。
  • Agent 化闭环的训练复杂性:需构建从短到长、从模仿到探索的多阶段训练管线,并设计规则奖励以对齐多步工具调用行为。 工业界对视频 Agent 的需求日益增长(如监控回溯、视频问答助手),但长程多模态推理的性能和成本仍是落地瓶颈。

行业类比

如同自动驾驶系统需要持续融合多传感器流、构建场景记忆并在线规划与验证,长视频 Agent 也必须以闭环上下文为核心,而非仅做单帧检测。

核心洞察

  • **闭环证据积累范式**:InternVideo3 将长视频理解定义为在共享上下文中持续滚动的闭环过程,整合观察、指令、推理、工具动作与记忆,通过多步交互积累和验证证据。这不同于常规视频 QA 的单次前向预测,也不同于文本主导的智能体,它首次在开源多模态模型中实现了视觉长程任务的推理闭环,使模型能像 agent 一样主动检索、回溯和矫正。
  • **M²LA 的 token 保留重参数化**:Multimodal Multi-head Latent Attention 通过 RoPE 感知的位置聚合、低秩潜在分解和模态自适应,压缩 KV 缓存状态而不丢弃完整 token 流。相比直接截断或量化缓存的方法,它保留了细粒度时空信息,同时大幅降低长序列推理的显存与计算开销,为在资源受限环境下处理超长视频提供了工程高效的注意力方案。

方法

InternVideo3 将长视频理解构建为一个闭环证据累积过程,核心是两种机制:Multimodal Contextual Reasoning (MCR)Multimodal Multi-head Latent Attention (M²LA)

输入 → 视频帧序列与文本指令。

MCR:闭环多模态推理

MCR 将理解视为在一个共享的、不断演进的上下文中进行的闭环操作。上下文包含观测(视频片段)、指令、推理步、工具动作及记忆。模型在每一轮中可调用工具(如检索器),并将返回的信息作为新证据积累;最终决策基于更新的上下文。长视频推理等价于多轮证据收集与验证

M²LA:高效长上下文注意力

为支持长序列且不丢弃 token 流,引入 token 保留重参数化

  • RoPE 感知位置聚合:将具有相似位置的 token 压缩为低维潜在状态,保持旋转位置编码的连续性。
  • 低秩内容通道因子分解:对注意力内容进行低秩分解,压缩 KV 缓存大小。
  • 模态感知潜在适配:为不同模态(文本、视觉)学习专属的压缩投影。
  • 动态潜在预算:按层或头的重要性分配压缩率,实现自适应的精度–效率平衡。
  • head-wise QK-Norm 兼容:引入归一化与线性近似,解决共享聚合与独立 QK-Norm 的冲突。

输出仍为标准自回归 token 序列,但推理时 KV 缓存显著减小,支撑数十万帧长视频。

分阶段训练流程

  1. 继续预训练:在 M²LA 转换后,用大规模视频–文本数据恢复模型能力。
  2. 短→长监督微调:先短视频问答,再扩展至长视频,采用分层叙事标注加强时间理解。
  3. 基于规则的 RL:为工具调用、回答格式等设计奖励,优化代理行为。
  4. On-policy 蒸馏:将 RL 策略蒸馏回模型,稳定性能并提升泛化。

视频代理实例化

基于上述模块,构建可执行工具的视频 Agent

  • 层次化记忆:短期(当前对话)、长期(外部检索库)记忆。
  • 问题路由:根据查询类型调度到不同工具或记忆。
  • 递归验证:自我检查并修正答案,形成内反馈。

与同类方法的差异:区别于纯文本代理或仅靠注意力扩展的长视频模型,InternVideo3 首次将闭环推理、工具使用与高效压缩注意力协同,以开源范式实现了面向长程视觉任务的动态证据驱动代理。

实验

实验设计

InternVideo3 的实验围绕 长视频理解短视频理解时空智能推理效率视频代理能力 五项核心维度展开。

  • 模型基于 InternVL2 架构,通过 多模态上下文推理(MCR)高效注意力(M²LA) 改造。
  • 训练分为四个阶段:
    1. M²LA 转换后的继续预训练,
    2. 短到长的监督微调(SFT),
    3. 基于规则的强化学习(RL)调优推理与工具使用,
    4. 在策略蒸馏(on-policy distillation)提升稳定性。
  • 评估协议覆盖多个公开基准,包括长视频数据集 Video-MMEMLVUEgoSchema,以及短视频和时空推理基准。
  • 代理能力通过层次化记忆和检索工具实例化,在交互式视频探索任务中验证。

关键发现

  • 长视频理解性能强大:在 Video-MME、MLVU、EgoSchema 上均取得领先成绩,表明 MCR 的闭环证据积累机制有效处理了长时程时间依赖。
  • 效率显著提升:M²LA 将 KV 缓存状态压缩为少量 latent tokens,在保持全 token 流的情况下大幅降低推理显存和时间,使长上下文推理更可行。
  • 代理行为稳健:集成检索工具后,模型能进行多步证据收集和递归验证,输出更具事实基础,幻觉现象减少。
  • 训练策略有效:分阶段短到长 SFT 和 RL 训练逐步注入任务复杂度,避免了直接长视频微调的不稳定。
  • 消融实验表明,移除 MCR 闭环或工具接口后,代理任务准确率明显下降,验证了各模块的贡献。

与基线对比的解读

虽然论文未提供精确数值对比,但定性地看,InternVideo3 与现有开源多模态模型(如 InternVideo2、Video-LLaMA、Chat-UniVi 等)相比,核心优势在于 端到端的闭环推理高效的上下文处理

  • 传统视频模型多采用单步前向预测,难以应对需要持续观察、检索和验证的长视频理解任务;InternVideo3 通过 MCR 将理解转化为多轮交互过程,更贴近真实世界的智能体决策。
  • 在效率上,M²LA 的 token 保留重参数化避免了其他压缩方法(如 token 合并或修剪)造成的信息不可逆损失,在性能与速度间取得更优平衡。
  • 代理能力基准的消融进一步揭示,单纯增大模型或注入更多视频数据无法自然产生证据锚定行为,闭环推理框架 + 工具集成 是迈向视觉世界智能体的关键路径。

行业影响

落地场景

InternVideo3 的长视频上下文推理视频代理能力可直接嵌入需处理半小时以上视频流的产品,如:

  • 内容平台:长视频高光剪辑、违规检测、多语言摘要
  • 企业服务:会议录屏的知识库构建与问答
  • 自动驾驶:行车记录仪数据的长期场景回溯与事故分析
  • 安防监控:跨摄像头目标跟踪与事件关联

商业价值

降低成本:替代人工对长视频进行事件标注和逻辑梳理,尤其适用于法律取证、保险理赔等需证据链的场景。
提升体验:在视频搜索和推荐中,通过封闭环推理 (closed-loop reasoning) 积累证据,提供更准确的片段定位和解释,增强用户信任。
增收:赋能 UGC 平台对创作者长视频的自动化运营(章节划分、广告位推荐),提高内容变现效率。

与现有工作流的接口

模型可包装为多模态 API,接收视频流与用户指令,输出结构化推理结果。集成方式:

  • 插件式代理:在已有的 RAG 或 Agent 框架(如 LangChain)中注册为视频工具,通过检索器调用外部知识库
  • 微调适配:采用其分阶段训练策略(持续预训练 → 短/长上下文 SFT → RL → 蒸馏),在垂直域数据上快速迁移
  • 推理优化M^2LA 压缩 KV 缓存,降低长视频推理的显存和延迟,适合部署在边缘节点或云端服务

典型用例

用例 1:视频内容平台审核与运营
一条 2 小时的直播回放,InternVideo3 代理可分段检索关键帧,结合弹幕和评论(工具调用),生成“违规行为出现时段 + 证据截图”的报告,并自动打上标签。相比逐帧人工审核,耗时减少 80% 以上。

用例 2:自动驾驶事故分析
整合多摄像头长视频与传感器日志,模型在多个时间步内验证“变道时是否开启转向灯”“前车制动灯亮起时刻”等细节,通过证据累积 (evidence accumulation) 输出事故责任判定依据。可用于保险理赔自动化,缩短定损周期。

局限

  • - **工具依赖与系统脆弱性**: 论文承认当前实例化的视频代理严重依赖预定义工具集(如检索模块),一旦工具不可用或反馈质量差,代理的推理回路可能中断。从工程部署角度看,这要求为每个新领域定制工具并持续维护,增加了落地成本和不确定性,且工具调用的延迟会拖慢实时交互系统。
  • - **隐式世界模型而非显式预测**: MCR 通过上下文积累证据构建隐式环境理解,而非学习显式的视频预测世界模型。这可能导致在需要反事实推理或物理常识的任务中,模型缺乏深度因果理解,仅停留在统计关联层面。与某些同时建模生成和理解的视频世界模型相比,InternVideo3 的对物理世界的内部表征更弱。
  • - **评测范围与泛化性局限**: 尽管在现有长视频理解基准上表现出色,但这些基准可能无法覆盖真实开放域中的复杂、多模态、长时程任务。效率优化(M^2LA)的收益高度依赖预训练注意力的性质,迁移到其他异构模型架构时可能需要重新调参或失效。此外,论文未充分探讨跨语言、跨文化视频场景的泛化性。
论文Ziang Yan2026-06-10原文

相关内容