论文

选择、压缩、再投资:长视频多模态大模型中视觉令牌分配的受控研究

选择、压缩、再投资:长视频多模态大模型中视觉令牌分配的受控研究

长视频语言模型无法逐帧查看全部内容:以每秒一帧采样一小时视频会产生 3,600 张图像,而系统只保留其中一小部分固定切片。哪些帧能留在这个切片里,通常被视为预处理细节;本文研究这一看法是否正确。已发表的筛选器往往同时更改帧评分器、提示边界、分辨率策略和回答模型,导致比较难以公平。因此,本研究固定上述所有因素,每次只改变一个决策:帧选择、空间压缩 和释放令牌的再投资,并跨越六种无需训练的筛选规则、三个长视频基准(LongVideoBench 等)及两个回答模型展开实验。 实验发现,帧选择 是影响最大的单一杠杆:在 LongVideoBench 的一小时时长区间上,8 个查询选中的帧比 16 个均匀分布的帧高出 6.9 分;而未经修改的经典稀疏逼近算法 正交匹配追踪 (OMP) 在所有三个基准上,与每一种专为帧选择构建的算法相比,都能持平或仅差 1 分以内。空间压缩 几乎是无损的:在固定时间戳下将每帧的空间预算减半,代价至多为 0.44 分。再投资 才是将压缩节省的令牌转化为精度的关键——用释放的令牌处理双倍数量的压缩帧,在不超过原始 8 帧的测量成本下,还能再提升 2 到 3 分;压缩只有这样做才值得。 此外,研究还揭示了两点方法论教训:自身基线(AKS)中的一个实现错误,以及两个测试平台在同一预算下运行相同已发布规则时出现 0.07 到 3.74 分的差距。这进一步说明,此类比较必须在同一个受控测试平台内进行,而非跨论文直接对比。

论文精读

TL;DR 受控实验证明:长视频多模态模型中,帧选择是最大精度杠杆,空间压缩几乎无损但必须将节省 token 重新投资于更多帧,且经典 OMP 算法可媲美专用选择器。

问题

问题背景

长视频理解是多模态大模型(MLLM)的核心场景之一,但视频帧数量巨大(例如 1 小时按 1 秒采样有 3600 张图像),受限于上下文长度与计算预算,系统只能保留其中很小一部分帧输入模型。如何从海量帧池中分配有限的视觉 token 预算,直接决定模型的回答质量。

现有方法局限

现有工作通常将帧选择、空间压缩、token 再投资分开研究,但每个工作都同时改动多个变量:帧打分器、提示边界、分辨率策略和回答模型。例如某个 selector 的论文可能换了打分模型又改了分辨率,导致无法判断性能提升来自哪个决策。此外,跨论文比较还受到实现差异影响——本文发现同一个已发表规则在两个 harness 上运行同预算时得分差距可达 0.07 到 3.74 分,而作者自己复现的 AKS baseline 甚至发现了一个静默复现 top-k 的 bug。这些混杂因素使已有结论的可靠性存疑。

为什么这个问题难 / 重要

三个决策——选哪些帧、每帧用多少像素、节省的 token 是否重新投入更多帧——之间存在复杂的耦合关系。单独优化某一项可能被其他因素的噪声淹没。业界对长视频 MLLM 的效率与准确率平衡高度关注,但缺乏统一的控制变量基准来公平评估每个杠杆的独立贡献。本文通过固定所有其他变量,逐个改变单一决策,发现选择是最大杠杆(8 帧 query-selected 超过 16 帧均匀采样 6.9 分),压缩几乎无损(减半空间预算损失 ≤0.44 分),而再投资才能让压缩省下的 token 转化为 2-3 分的额外收益。这种解耦分析为工程实践提供了明确的优化优先级。

行业类比

类似视频流媒体服务在带宽限制下,需要决定传输哪些关键帧、用多高分辨率,以及是否用节省的带宽加载更多片段;如果只压缩不重新分配,画质提升会十分有限。

核心洞察

  • 帧选择是长视频视觉 token 分配中最大的性能杠杆。在 LongVideoBench 的一小时 bin 上,八帧查询相关选择比十六帧均匀采样高 6.9 分,说明盲目堆帧数远不如精选关键帧。这一发现挑战了以往将选择视为预处理细节的做法,提示算法工程师应把帧选择器作为一等公民来设计,而不是仅仅增加采样密度或分辨率。
  • 空间压缩本身几乎无损,但只有当节省的 token 被再投资到更多帧时才真正获益。论文通过受控实验表明,固定时间戳下将每帧空间预算减半最多只损失 0.44 分,而把这些 token 用于翻倍帧数能额外获得 2-3 分提升。这打破了压缩与选择相互独立的认知,揭示了一种新的联合优化范式:先压缩、再选择、最后再投资,三步协同才能最大化预算效率。
  • 未修改的经典算法 Orthogonal Matching Pursuit (OMP) 在三个基准上匹配或接近所有专用选择器,说明长视频帧选择问题可能不需要复杂学习模型。OMP 作为几十年前的稀疏逼近方法,在无需训练、零额外计算开销的情况下达到专用系统的水平,为实际部署提供了极低成本的替代方案。这提示从业者在追求花哨选择器之前,应该先测试简单基线,避免过度工程化。

方法

输入与总体设计

  • 输入:长视频(按固定频率采样得到帧池,例如每秒 1 帧)、自然语言问题、回答模型(两个 MLLM)。
  • 为隔离变量,构建统一实验单元(experimental unit):固定帧评分器、提示边界、分辨率策略、回答模型等,仅单独改变一个干预维度。

关键模块:三个受控干预

  1. 选择(Selection)
    在固定 token 预算下,比较六种训练无关的选择规则:均匀采样(16 帧)、基于查询相似度的 top-k 选择(8 帧)、正交匹配追踪(OMP)(一种经典稀疏逼近算法)等。所有规则共用同一评分器(如 CLIP 相似度),确保公平对比。
  2. 压缩(Compression)
    在固定时间戳下,将每帧空间分辨率减半(降低视觉 token 数),保持帧数不变,评估精度损失。
  3. 再投资(Reinvestment)
    将空间压缩节省的 token 预算用于选择更多压缩后的帧(例如从 8 帧增加到 16 帧),观察精度回补。

输出与指标

  • 在三个长视频基准(如 LongVideoBench 的 hour-long bin)上测量问答准确率,比较不同干预的效果。
  • 关键发现:选择是最大杠杆;压缩几乎无成本(最多损失 0.44 分);再投资能带来 2-3 分提升;OMP 与专用选择器性能相当。

与同类方法的差异

  • 以往工作常同时改变多个组件(评分器、提示边界、分辨率等),难以归因;本文通过单一变量控制,在同一 harness 内公平比较各选择器,并揭示经典算法 OMP 的竞争力。

实验

实验设计

研究通过受控实验,固定帧评分器、提示边界、分辨率策略和回答模型,单独变化 选择规则、空间压缩 和 节省预算的再投资。在 LongVideoBench 等三个长视频基准上,比较六种无训练选择规则,使用两个回答模型。评估指标为问答准确率,选择规则包括均匀采样、查询相关选择、Orthogonal Matching Pursuit (OMP) 等。

关键发现

选择是最大杠杆:8 个查询选择的帧胜过 16 个均匀帧,提升 6.9 分。空间压缩几乎无成本:固定时间戳下减半每个帧的空间预算,损失最多 0.44 分。将节省的 token 再投资到两倍压缩帧,可获得额外 2-3 分。OMP 作为经典稀疏近似算法,与专用选择器表现相当或差 1 分以内。

基线对比解读

两个 harness 运行相同规则和预算,结果差异 0.07 到 3.74 点,说明跨论文比较不可靠;必须统一 harness 才能公平对比。选择规则替代简单均匀采样或增加帧数是更有效的预算分配策略,压缩只有在节省被再投资时才转化为准确率收益。

行业影响

落地场景

长视频理解是核心应用:视频平台的内容审核与自动标签、视频会议/录播摘要、电商直播录像分析(商品提及识别、关键片段定位)、自动驾驶数据标注工具、手术视频关键帧提取等。这些场景中,系统无法逐帧处理一小时 3600 张图像,必须选择有限帧输入多模态 LLM。

商业价值

降本与提效并重。通过更优帧选择(如 Orthogonal Matching Pursuit 算法)替换均匀采样,可直接减少输入 token 数 50% 以上,同时提升准确率(论文中 8 个查询选择帧胜过 16 个均匀帧 6.9 点)。空间压缩几乎无损(仅 0.44 点代价),将节省的 token 重新投资到更多帧可再获得 2-3 点提升,实现同等成本下更高精度。对企业意味着 API 调用成本或 GPU 推理成本下降,或同等成本下提供更准确的视频问答,支撑付费增值服务。

接口集成

无需改动现有 MLLM 架构,作为预处理阶段的选择器替换 uniform sampling 或随机采样。OMP 是训练无关、可解释的稀疏近似算法,几行代码即可接入现有 pipeline。可以与现有 token 预算分配系统结合,动态决定帧数和每帧分辨率,形成联合分配策略。论文强调应在一个统一 harness 内比较选择器,因此企业应建立标准化的视觉 token 预算测试框架,避免跨论文对比的误导。

具体 use case

  • 视频平台自动章节生成:对长视频流使用 OMP 选择关键帧,送入现有多模态 LLM 生成章节标题与摘要,token 成本降低约 2-3 倍,定位精度不降。
  • 在线教育平台课程问答:学生提问“第 30 分钟讲了什么”,系统通过查询相关帧选择快速定位,而非均匀采样漏掉重点,提升回答相关性并降低延迟。

局限

  • - **评测范围与复现保真度有限**:论文自认两个选择器是**受控复现**而非完整系统,且等价边际在观察数据后确定,机制证据仅针对所用视觉编码器。实验仅覆盖三个长视频基准和两个回答模型,任务类型与模型架构范围较窄,结论外推到其他数据集(如开放式问答、多跳推理)或不同骨干网络时需要谨慎。
  • - **控制变量策略可能排除交互效应**:所有规则共享同一个帧评分器和提示边界,虽然利于公平比较,但也屏蔽了评分器、提示格式与选择策略之间的协同作用。已发布选择器的优势可能部分来自这些联合设计,固定它们可能低估专用选择器的真实改进潜力。此外,方法仅考察**训练无关**选择规则,未涉及可学习选择模块或端到端微调,结论未必适用于可训练场景。
  • - **未考虑实际部署成本与时间维压缩**:论文聚焦空间压缩和帧选择,未测量计算开销、GPU 内存峰值或推理延迟,难以指导真实系统中的 token 预算权衡。“压缩 nearly free”的结论仅基于空间分辨率减半,未探索时间采样率调整或时空联合压缩。与近期基于学习的选择方法相比,OMP 等经典算法缺乏在线适应能力,在分布漂移的长视频流中可能退化。
论文Prakhar Khatri2026-09-03原文

相关内容