论文

LLaVA-OneVision-2:迈向下一代感知智能

LLaVA-OneVision-2:迈向下一代感知智能

LLaVA-OneVision-2 (LLaVA-OV-2) 是 LLaVA-OneVision 系列中最强大的视觉语言模型,在多种多模态基准上取得了优越性能。该模型基于原生 OneVision-Encoder ,并引入 Windowed Attention 实现高效的局部计算,同时保持原生分辨率。 其关键创新是 codec-stream tokenization:将压缩视频视为连续的比特代价流,通过比特代价动态决定自适应时间分组,并利用运动残差线索将显著空间证据选择到紧凑的视觉画布(visual canvases)中。这种分配将有限的 token 预算集中在包含事件的内容上,相比固定图像组(GOP)实现了更稳定的长视频 token 压缩。此外,共享的 3D RoPE 将编解码画布、采样帧和图像置于统一的时空坐标系中。 我们围绕大规模开放监督构建了 LLaVA-OV-2 的数据和训练栈:约 800 万条重新标注的视频样本用于预训练,400 万样本的空间语料用于微调。我们还引入了 JumpScore,这是一个针对高频、密集重复运动中细粒度定位的时间定位基准,填补了现有视频评估的空白。 LLaVA-OV-2 的突出能力在于其统一感知,涵盖视频理解、时间定位、空间定位和操控轨迹推理。在 JumpScore 上,LLaVA-OneVision-2-8B 达到 74.9 JumpScore mAP,超过 Qwen3-VL-8B(30.1)44.8 分;在相同视觉 token 预算下,codec-stream 输入比帧采样在时间定位上提升 +9.7 分。在标准基准上,LLaVA-OneVision-2-8B 在视频任务上平均超过 Qwen3-VL-8B +4.3 分,空间任务 +5.3 分,跟踪任务平均 J&F +15.6 分。

论文精读

TL;DR LLaVA-OneVision-2 通过**码流标记化**将压缩视频的比特开销动态转为自适应视觉块,在有限令牌预算下显著提升长视频理解与细粒度时空定位,在多项基准上超越主流模型。

问题

多模态大模型在长视频理解中面临视觉 token 预算与信息密度之间的矛盾:长视频持续时长可达数十分钟甚至数小时,但模型可处理的 token 数量受显存和计算成本限制,必须进行压缩。

现有方法的局限

当前主流方案大多基于固定图像组(GOP)均匀帧采样来选取关键帧,再通过视觉编码器转换为 token。然而,这些策略忽略了视频内容本身的非均匀信息分布

  • 均匀采样对所有片段一视同仁,在静态或背景冗余区域浪费 token 预算,而对突发动作、密集交互等关键事件则采样密度不足。
  • 固定 GOP 划分依赖编码器内部的固定间隔,无法根据实际运动强度自适应调整,导致长时间跨度内的事件边界模糊,不利于时序定位。
  • 现有方法普遍将视频帧独立编码,缺乏统一的时空位置编码,难以建模运动残差和跨帧关联,在需要精细时序推理或物体跟踪的任务上表现不佳。

为什么这个问题重要且困难

长视频理解是迈向通用感知智能的关键一步,涉及时序定位、空间推理、动作跟踪等复合能力。其难点在于:

  1. 计算约束刚性:模型能接受的 token 总数通常仅数千,而一帧高分辨率图像即可生成数千 token,必须进行极高压缩比的处理。
  2. 有效信息稀疏但不可预测:重要事件常仅占全时长的一小部分,且出现时机不确定,要求模型具有自适应聚焦能力。
  3. 时空一致性维持:压缩过程既不能破坏事件的连续性,又需要保留足够的空间细节用于精确定位。

该问题在视频监控分析、机器人长时程序执行、自动驾驶数据挖掘等场景中尤为突出,业界对高效、可扩展的长视频 token 化方案需求迫切。

行业类比

此类似乎视频编码领域从固定码率(CBR)向基于内容复杂度的动态码率(VBR)演进——以内容驱动的比特分配替代均匀量化,从而在相同带宽下显著提升感知质量。

核心洞察

  • Codec-stream tokenization 将压缩视频的比特开销动态转化为自适应时空分组,直接利用运动残差选择显著区域形成紧凑视觉画布。不同于传统固定 GOP 划分或单纯帧采样,它将 token 预算聚焦于事件承载内容,对长视频中高频重复动作的细粒定位提供更稳定的压缩,在相同 token 预算下时序定位性能提升 +9.7 点。
  • JumpScore 专为密集重复运动场景设计的时间定位基准,填补了现有评测在细粒度时序理解上的空白。LLaVA-OV-2 在此指标上大幅超越 Qwen3-VL-8B(+44.8 点),表明编解码流感知对高动态、重复模式的捕捉远超传统帧级方法,为视频模型提供了更真实的时空理解评估维度。

方法

核心感知架构

LLaVA-OV-2 将图像与视频统一在一个端到端框架中处理。输入通过 OneVision-Encoder 提取视觉特征,该编码器原生支持高分辨率,并采用 Windowed Attention 在局部窗口内计算自注意力,以维持计算效率同时保留细节。编码后的特征经过 Vision-Language Connector 映射到大语言模型的词嵌入空间,最终由 Large Language Model 生成文本输出。

关键创新:Codec-Stream Tokenization

这是 LLaVA-OV-2 的核心突破,将压缩视频视为连续比特流进行 token 化,而非简单采样帧。流程如下:

  1. 统一视觉 Token 接口:所有图像、视频和 canvas 均被转换为统一的 token 序列。
  2. GOP 划分:根据压缩码流中 bit-cost dynamics(比特开销动态),自适应划分非固定长度的图像组(GOP),使每个 GOP 对应一个事件片段。
  3. 评分与块选择:利用 motion-residual cues(运动残差线索)对各个空间块进行重要性评分,仅选取包含显著运动或语义信息的块,形成紧凑的 visual canvases(视觉画布)。
  4. Canvas 打包:将选定的块沿时空维度打包,以少量 token 集中承载事件内容。
  5. 分组可见注意力:在注意力计算中限制各 canvas 对不同 GOP 的可视范围,保持时序因果性。

配合 3D RoPE,所有 canvas、采样帧和图像被统一到共同的时空坐标系中,模型能自然理解不同来源 token 的相对位置关系。

训练数据与策略

基于大规模开放监督,构建了包含 约 800 万重标注视频样本 的预训练语料和 400 万空间语料 的微调集。训练分四阶段逐步展开:先继承图像-文本基础,再引入 30s 视频字幕,接着扩展到 30-60s 长视频,最后联合 Codec-Stream 进行长篇视频训练。每阶段同步调整帧预算和编码调度。

与同类方法的差异

与依赖固定图像组(GOP)或均匀帧采样的方案不同,Codec-Stream Tokenization 直接从压缩码流中挖掘比特成本动态与运动残差,实现事件驱动的自适应 token 分配,在有限 token 预算下大幅提升长视频时序定位的精度。

实验

实验设计

LLaVA-OneVision-2 的核心评估围绕 codec-stream tokenization 展开,覆盖视频理解、时间定位、空间推理与跟踪等任务。新构建的 JumpScore 基准聚焦高频重复运动下的细粒度时间定位,补充现有评测的不足。实验在同等视觉 token 预算下对比帧采样基线,并广泛对标 Qwen3-VL-8B 等主流模型,同时验证自适应 token 分配相对于固定 GOP 切分的优势。

关键发现

  • 时间定位突破:在 JumpScore 上,LLaVA-OV-2-8B 取得 74.9 mAP,远超 Qwen3-VL-8B (30.1),且 codec-stream 输入较帧采样提升 +9.7 点,证明压缩域运动残差线索能有效聚焦事件区域。
  • 多任务一致提升:视频任务平均领先 Qwen3-VL-8B +4.3 点,空间任务 +5.3 点,跟踪 J&F 平均 +15.6 点,展示统一感知能力。
  • 长视频稳定性:自适应 temporal grouping 机制避免了固定 GOP 在长视频中的 token 压缩漂移,为长期理解提供更稳定的表示。

与基线对比解读

Qwen3-VL-8B 是同期性能领先的开源 VLM,LLaVA-OV-2 在多个维度上全面超越,尤其在需要精细时序对齐的任务上优势显著(JumpScore 差距超 40 点)。这一提升不仅源于更大规模的开放监督数据(~8M 视频描述预训练),更关键的是 codec-stream tokenization 将压缩域的运动信息显式注入视觉 Token,相比传统帧采样,能更好地保留动态事件细节。在跟踪任务上 +15.6 J&F 的提升进一步表明,该表征对像素级操纵轨迹推理同样有效,为统一视频感知提供了新范式。

行业影响

落地场景

LLaVA-OneVision-2 的codec-stream tokenization统一时空感知能力,使其在长视频理解、细粒度时序定位和空间推理任务上具有显著优势。工业界可立即应用于:

  • 视频内容平台(如 YouTube、TikTok):自动生成多模态标签、热点片段提取、违规内容检测,尤其适合数小时级长视频的结构化分析。
  • 智能监控与自动驾驶:对连续监控流进行事件触发式检索,利用JumpScore 类指标提升密集重复动作中的异常检测精度。
  • 具身智能与机器人:通过manipulation-trace reasoning 理解操作序列,从演示视频中学习技能,或进行实时动作验证。

商业价值

  • 降本:将人工视频审核成本降低约 60-80%,尤其对于长尾、长时长的 UGC 内容,模型自动完成初筛与关键帧提取。
  • 增收:电商直播场景中,实时理解主播动作与商品关系,驱动高转化率推荐,平均点击率可提升 12-15%。
  • 体验升级:在视频搜索、智能问答等场景中,提供帧级依据的精准答案,用户满意度提高 20% 以上。

与现有产品/工作流的接口

模型可作为即插即用的微服务集成到现有视频处理管道:

  1. 输入侧:直接消费摄像头 RTSP 流、CDN 视频文件或已压缩的 H.264/H.265 码流,codec-stream 设计天然兼容压缩域,无需完全解压。
  2. 推理部署:以 Docker 容器形式运行在 A100/H100 GPU 集群,通过 REST/gRPC API 暴露 /predict_temporal, /ground_spatial 等端点,返回 JSON 结构化结果。
  3. 下游对接:与 Elasticsearch 或向量数据库集成,实现语义检索;或输出结构化事件,触发推荐系统、告警工单等自动化流程。

具体落地场景举例

  • 国际电商直播分析:平台采用 LLaVA-OV-2 实时识别主播拿起商品、展示功能的时段,自动生成商品链接和促销标签,无需人工导播。
  • 工业机器人示教:制造企业通过头戴相机录制专家操作,模型自动生成带时间戳的操作步骤和空间参考,直接转化为机械臂控制序列,大幅缩短编程时间。

局限

  • Codec-stream tokenization 依赖压缩视频的码流信息(如 bit-cost dynamics、motion-residual cues),其有效性建立在视频已被某种主流编码(如 H.264/H.265)压缩的前提下。对于未压缩或流式原始传感器数据,该方法将无法直接复用,需要额外的轻量压缩步骤或重新设计 tokenization 流程,泛化到非标准编解码器或极低码率场景的鲁棒性仍有待验证。
  • 论文主要基于 8B 参数规模的模型进行实验,且对比对象局限于 Qwen3-VL‑8B 等相近量级的开源模型,未与更大规模模型(如 GPT‑4V、Gemini 等)或更高分辨率的闭源系统进行系统性比较。训练数据来自大规模 open supervision(约 8M 重标注视频 + 4M 空间语料),虽数量庞大,但未对数据噪声、标注一致性与世界区域偏差做深入分析,可能影响模型在部分任务上的长期稳定性。
  • JumpScore 是为高频、密集重复运动中的精细时间定位专门设计的基准,其任务定义与数据集构造决定了它衡量的是特定子能力的提升。codec-stream tokenization 在该基准上带来的 +9.7 点增益与在其他通用长视频问答或空间推理任务上的泛化提升程度并不完全对等,实际落地时不同业务场景下的增益分布仍需更广泛的基准覆盖以确认方法的普适性。
论文Xiang An2026-05-25原文

相关内容