论文

VideoChat3: 完全开放的视频 MLLM,用于高效和通用的视频理解

VideoChat3: 完全开放的视频 MLLM,用于高效和通用的视频理解

近年来,视频理解领域在运动、长视频和流式交互等方面取得了进展,正推动该领域向实际应用发展。然而,当前的开源模型仍存在若干局限:它们难以泛化到多样的视频类型,仅在特定领域有效;高计算需求限制了效率和可扩展性;多数模型仅部分开放,训练代码、策略或数据集缺失,阻碍了可复现性和社区发展。 为解决这些问题,我们提出 VideoChat3,一款完全开放、高效且通用的视频中心 MLLM。VideoChat3 通过两个互补设计推进视频理解: - 效率方面:引入 Inflated 3D Vision Transformer (I3D-ViT) 和 Adaptive Frame Resolution for Streaming Video Perception,实现高效时空表示,降低训练和推理时的视频处理成本。 - 有效性方面:开发可扩展的视频数据合成流程,构建三个多样化高质量训练集:VideoChat3-Academic2M、VideoChat3-LV116K 和 VideoChat3-OL617K,覆盖通用、长视频和流式场景,提升跨域泛化能力。 集成这些设计后,VideoChat3 在广泛泛化与计算效率之间实现了稀有平衡。在通用、长视频和流式基准上的实验表明,仅 4B 参数的 VideoChat3 超越此前同等或更大参数量的开源模型,且效率更高。

论文精读

TL;DR VideoChat3 是一个完全开源的通用视频 MLLM,通过 I3D-ViT 高效时空编码与合成数据,在 4B 参数下实现跨场景效率与性能均衡,超越更大模型。

问题

领域关注点

视频多模态大模型 (Video MLLM) 正从运动理解、长视频分析到流式交互快速发展,其核心矛盾已从“能否处理视频”转向“能否在多样场景下高效、通用地部署”。

现有方法局限

  • 泛化能力不足:多数开源模型仅针对特定视频类型(如短视频动作识别)优化,在长视频、流式视频等不同时空结构下性能急剧下降,无法作为一个通用视觉助手直接使用。
  • 计算效率低下:普遍采用逐帧密集编码的高分辨率 Vision Transformer (ViT),导致训练和推理的时空开销巨大,使资源受限的从业者难以复现或扩展。
  • 开源完整性缺失:关键组件(训练代码、数据合成策略、标注管线)常闭源,迫使工程团队重新摸索,无法在社区已有成果上快速迭代,严重拖慢从研究到产品的进程。

技术挑战与重要性

实现高效通用视频理解需同时解决三个耦合难题:

  1. 时空冗余的压缩:既要保留细粒度动作和长程依赖,又要大幅降低 token 数量,对 tokenizer 设计提出极高要求。
  2. 流式感知的状态一致性:流式视频要求模型能随时间推进动态更新理解,并在连续对话中保持状态连贯,这对架构和训练策略(尤其是状态转换学习)构成挑战。
  3. 全栈可复现的数据工程:高质量视频指令数据的获取远比静态图文难,涉及噪声过滤、证据锚定、边界感知等复杂步骤,缺乏全开放的高质量数据合成方案直接制约模型上限。

业界对全栈开放、即插即用的视频 AI 基座需求迫切,因为只有彻底透明的模型才能让工程团队进行可信的性能评估、成本规划及二次开发。

行业类比

这类似大规模语言模型 (LLM) 在文本领域从“部分开源 demo”到“全开放社区构建”的转折点——视频 MLLM 同样需要从预训练到微调再到数据的完整开放链,才能真正激活工程创新与垂直场景适配。

核心洞察

  • 全流程开源与可复现性:VideoChat3 不仅公开模型权重,还完整公开训练代码、策略与数据集,打破了当前视频 MLLM 领域关键组件闭源的限制,为社区驱动的迭代与公平对比提供了基础。
  • 高效视觉编码与自适应流式感知的协同设计:通过 I3D-ViT 膨胀 3D 视觉 Transformer 和自适应帧分辨率动态调整计算图,VideoChat3 在仅 4B 参数下超越更大规模开源模型,同时显著降低训练推理成本,实现了效率与泛化的稀缺平衡。

方法

VideoChat3 整体遵循 高效视频 tokenization → 多阶段对齐与指令微调 的范式,兼顾通用、长视频与流式场景。

  • 输入:原始视频帧序列,支持任意长度与流式到达。
  • 关键模块
    • I3D-ViT(Inflated 3D Vision Transformer):将 2D ViT 膨胀为 3D 卷积初层,结合时空注意力,生成紧凑的时空 token,大幅降低 token 数量与计算开销。
    • 自适应帧分辨率流式感知:对流式视频,根据动态内容自适应调整处理帧率与分辨率,保持实时性的同时不损失关键信息。
    • 可扩展数据合成管道:通过学术视频重标注、长视频边界感知分割与流式 QA 构造,产出 VideoChat3-Academic2M(通用)、VideoChat3-LV116K(长视频)、VideoChat3-OL617K(流式)三个数据集,确保训练覆盖域多样。
  • 训练策略:分四阶段——
    1. Stage-0:视频 tokenizer 预训练,对齐视觉与语言特征空间;
    2. Stage-1:视频-语言对齐,使用大规模图文/视频对;
    3. Stage-2:通用视频指令微调,注入对话能力;
    4. Stage-3:长视频与流式指令微调,引入 监督掩码 学习状态转换,强化时间一致性。
  • 输出:基于 LLM 的视频理解文本回复,支持问答、描述、推理等任务。

与同类开源模型相比,VideoChat3,仅 4B 参数,即在全开放(代码、数据集、训练策略)的条件下,以更高效率在多个基准上超越更大参数的模型。

实验

实验设计

VideoChat3 在三个维度上系统评估:通用视频理解(如 MSVD‑QA、MSRVTT‑QA)、长视频理解(如 EgoSchema、MovieChat‑1K)和流式视频理解(自建流式 QA 基准)。效率分析包括推理延迟、GPU 显存占用与吞吐量。消融实验覆盖 I3D‑ViT 编码器、自适应帧分辨率动态流、流式视频的监督掩模以及三个数据合成管道。所有实验均基于 4B 参数模型,确保对比公平。

关键发现

  • 泛化性强:仅用 4B 参数,在通用、长视频与流式视频基准上均超越同等或更大规模的开源模型,展现跨域通用能力。
  • 效率突出:I3D‑ViT 结合自适应帧分辨率,使推理延迟和显存占用大幅下降,长视频处理和实时流交互可在低算力设备上运行。
  • 数据贡献显著:VideoChat3‑Academic2M 的证据增强标注、LV116K 的边界感知分段和 OL617K 的视觉线索验证,均带来独立增益;流式视频中引入的状态转换学习(state transition learning)有效提升了持续交互任务的稳定性。

与基线对比

相较于之前部分开源或领域专用的方案,VideoChat3 实现了全开源(代码、数据、训练策略),同时保持最优性能。其核心优势在于效率与泛化的平衡:相同参数规模下,推理速度与显存需求优于多数基线;且单一架构无需改造即可覆盖三种视频类型,而基线往往只能胜任其一。部分模型虽在特定任务上指标更高,但泛化不足且计算开销更大。这验证了“高效时空 tokenization 配合高质量合成数据”路线的实用价值。

行业影响

落地场景

VideoChat3 作为 完全开源 的通用视频理解模型,可在多个垂直领域快速集成:

  • 内容平台:对短视频、长视频进行自动化分类、标签、字幕及精彩片段提取,支撑推荐与搜索。
  • 流式直播互动:实时理解直播画面与弹幕,生成上下文感知的问答或商品讲解,适用于电商直播、在线展会等场景。
  • 在线教育:分析课堂录像,自动生成知识点摘要、师生互动热点,甚至提供实时答疑辅助。
  • 自动驾驶与安防:高效处理多路视频流,进行事件检测、行为分析,兼顾推理延迟与精度。

商业价值

  • 降本增效:4B 参数模型性能超越同等或更大参数的开源模型,配合 I3D-ViT自适应帧分辨率 设计,显著降低训练与推理的算力成本,使中小团队也能部署高性能视频理解服务。
  • 加速迭代:全套代码、数据集与训练策略开放,企业可基于此快速定制垂直领域模型,减少数据标注和架构试错的开支。
  • 体验升级:流式视频理解能力使得实时交互类应用成为可能,提升用户参与度与转化率(如直播带货中的智能问答)。

与现有产品 / 工作流的接口

  • 模型可封装为 模型即服务 (MaaS) 的推理微服务,提供 HTTP/gRPC API,无缝接入现有视频处理管线。
  • 与主流 MLLM 框架(如 LLaMA-Factory、vLLM)兼容,支持 LoRA 高效微调,便于结合企业内部知识库进行定制。
  • 支持 离线批处理在线流式推理 两种模式:离线模式可对接数据湖、Hadoop/Spark 集群;在线模式可通过 WebSocket 实现低延迟交互。

具体落地用例

  1. 电商直播智能助播
    在直播过程中,VideoChat3 实时解析主播展示的商品、观众提问及画面变化,自动生成准确的商品卖点回答或优惠信息,无需人工后台支持,降低人力成本并提高响应速度。

  2. 企业知识库视频检索
    对海量会议录像、培训视频构建语义索引:用户可通过自然语言提问(如“上周项目复盘中讨论了哪些风险点?”),系统直接定位到相关片段并返回摘要,替代传统的逐帧查看,提升知识管理效率。

局限

  • - **数据合成管线的高计算依赖**:虽然 VideoChat3 强调全开放,但其核心数据集 VideoChat3-Academic2M、VideoChat3-LV116K 和 VideoChat3-OL617K 均依赖大规模合成管线(如基于证据增强的标注、边界感知分割和在线 QA 构建),这些管线本身需要消耗显著的计算与人工校验成本。复现完整数据生产流程对中小实验室而言存在隐形门槛,即使代码开源,实际执行仍受限于资源,削弱了“完全复现”的实效性。 - **域外泛化验证不足**:训练数据主要来自学术来源和内部合成,缺乏对真实世界极端条件(如强运动模糊、低光照、非典型视角或严重遮挡)的覆盖。尽管实验在多个学术基准上取得领先,但对开放域流媒体或边缘场景的鲁棒性缺少系统性评估,这可能高估了模型的实用泛化能力。 - **实时流媒体延迟未明确对标**:论文提出了 Adaptive Frame Resolution 以优化流媒体感知,但在实际实时场景中,端到端推理延迟(包括 tokenization、LLM 解码)可能仍远高于专用流模型(如基于 CNN 或轻量 ViT 的检测器)。文中缺乏与低延迟专用流媒体系统的详细延迟对比,难以判断其是否能满足自动驾驶、机器人等对毫秒级响应的要求。
论文Xinhao Li2026-07-16原文

相关内容