论文

Audio-Visual Flamingo: 面向长而复杂视频的开放视听智能

Audio-Visual Flamingo: 面向长而复杂视频的开放视听智能

现有视听大语言模型(AV-LLM)主要针对短视频片段,难以处理长而复杂的真实世界视频。为此,我们提出 Audio-Visual Flamingo (AV-Flamingo),一个完全开放的最先进视听大语言模型,能够联合理解和推理音频、图像及长视频。 模型的关键贡献包括三方面: 1. Audio-Visual-Skills:大规模真实世界视频数据集,包含约700万条文本描述和问答对,着重强调时序、组合及跨模态视听推理。 2. 三阶段课程学习:从短程感知逐步过渡到长程多事件推理,提升模型对复杂时序结构的建模能力。 3. Temporal Audio-Visual Interleaved Chain-of-Thought (TAV-I-CoT):一种推理框架,将中间推理步骤显式定位到长视听流中的具体时间戳,增强时间对齐与可解释性。 在15余项音频-视觉、全模态、纯音频及视觉基准测试中,AV-Flamingo 显著优于同规模开源模型,并在长而复杂的真实世界视听理解与推理任务上,与更大规模的开源及闭源模型相比仍具竞争力,甚至超越部分模型。此外,模型展现出强大的泛化能力与真实场景实用性。

论文精读

TL;DR AV-Flamingo 是一个开源音视频大语言模型,专攻长时复杂视频的时序推理,通过大规模训练数据与阶段式课程,在多项长视频基准上超越更大模型。

问题

问题背景

当前音频-视觉大模型(AV-LLM)主要面向短视频片段(通常数秒到几分钟)的感知与问答,但现实世界中绝大多数视频是长时、多事件的连续流,要求模型具备跨越长时间窗口的推理能力。

现有方法的局限

现有 AV-LLM 普遍存在三类关键瓶颈:

  • 时间视野受限:受限于 Transformer 的二次复杂度,多数模型仅能处理数秒至数十秒的视频,面对数十分钟甚至小时级的长视频时,无法捕捉远距离事件间的因果或时序关系。
  • 跨模态推理浅层化:音频与视觉的融合常停留在帧级对齐,缺乏对“某时刻听到的爆炸声与几秒后出现的烟雾”这类跨时间、跨事件的组合推理支持。
  • 训练数据与任务偏差:主流数据集(如 AudioSet、VGG-Sound)以短时标注为主,缺乏强调时序关联、组合推理的多样化长视频数据,导致模型在长视频理解任务上泛化不足。

技术挑战与重要性

长视频理解之所以困难,是因为它要求模型同时处理三个维度:

  1. 长程时序依赖:事件可能分散在数分钟的视频中,需要显式的时间 grounding 与记忆机制。
  2. 高密度多模态交互:音频、语音、画面、文本随时长不断交织,单纯靠增加输入长度无法解决信息过载,必须设计高效的跨模态压缩与检索。
  3. 可解释的推理链:长视频问答往往需多步推理,且中间结果需与时间戳对齐,现有端到端黑盒模型无法提供这种粒度。 业界对长视频理解需求迫切,覆盖媒体分析、自动驾驶、智能监控等场景,但现有模型要么仅处理单模态视频,要么无法扩展至长序列,亟需新的训练范式与数据支撑。

行业类比

类似智能座舱系统需持续融合数分钟的多传感器流以做出安全决策,AV-Flamingo 的目标是为长视频构建一条可解释、跨时间的多模态推理流水线。

核心洞察

  • **时序音视频交错思维链 (Temporal AV-Interleaved CoT)** 将中间推理步骤显式锚定到视频流中的具体时间戳,这从根本上不同于现有 AV-LLM 对时序关系的隐式建模。多数模型仅将视频片段整体编码,缺乏事件级的时间粒度,导致长视频中因果顺序和多事件关联的理解薄弱。AV-Flamingo 的 CoT 策略迫使模型产出可解释、可定位的推理链,不仅提升了复杂场景的时间对齐准确率,也为可审计的 AI 决策提供了基础。
  • **从短距离感知到长时多事件推理的三阶段课程** 通过渐进式训练解决了长视频建模中长程依赖的收敛难题。现有工作往往直接在短视频数据上训练后零样本应用于长视频,或采用简单的均匀帧采样,无法捕捉稀疏事件间的时间结构。AV-Flamingo 的课程先从本地片段理解起,逐步扩展到跨多分钟的事件关联,这种增量学习使得模型在长视频基准上能以同等参数量超越更大的模型,并为其他需要长序列建模的领域提供了可借鉴的训练范式。

方法

AV-Flamingo 采用 多模态 LLM 架构,输入为长视频的音频流、视觉帧与文本指令,输出为时间对齐的文本推理结果。

模型架构与输入处理

  • 视觉编码器:从视频中均匀或自适应采样图像帧,通过预训练视觉 backbone(如 CLIP ViT)提取帧级特征。
  • 音频编码器:处理原始音频波形或对数梅尔谱,提取固定维度的音频特征序列,捕捉语音、环境声等线索。
  • 跨模态连接器:通过可学习的感知器(Perceiver)或 Q-Former 将视觉与音频特征映射到 LLM 的 token 空间,实现模态对齐。
  • LLM 骨干:基于预训练的大语言模型,接收跨模态 token 序列与文本提示,自回归生成回复。

训练数据与课程策略

核心训练数据为 Audio-Visual-Skills,包含约 7M 条视频-描述/问答对,强化时序、组合式与跨模态推理。训练分为三阶段:

  1. 短程感知:模型先在短片段(<30s)上学习基础视听关联与事件理解。
  2. 长程多事件推理:逐步增加视频长度与事件密度,训练模型追踪跨时间的事件因果与叙事逻辑。
  3. 复杂指令微调:使用多样化问答与任务格式,提升指令遵循与零样本泛化。

推理:时间锚定视觉-语言思维链

提出 Temporal Audio-Visual Interleaved Chain-of-Thought (TAVICoT),在生成最终答案前,模型显式输出带时间戳的中间推理步骤(如 [00:12] 基于音效判断开门;[01:35] 观察人物表情)。这些步骤与音频、视觉帧交错输入 LLM,强化时间对齐与可解释性,尤其适合长视频中的多事件理解。

与同类方法的差异

相比多数 AV-LLM 仅处理短片段(<1min)且缺乏时间显式建模,AV-Flamingo 通过长视频课程训练与时间锚定的思维链,实现了对长时、复杂视听内容的可靠推理,并保持开源,允许社区复现与拓展。

实验

实验设计

AV-Flamingo 在 15 个以上 视听、全模态、音频、视觉基准上进行了全面评估,包括长视频理解、多模态推理、跨模态对齐等任务。实验对比了同规模开源模型(如 Video-LLaMA、VideoChat 等)以及更大规模的开源与闭源模型(如 GPT-4o)。训练采用三阶段课程:从短期感知任务开始,逐渐过渡到长视野多事件推理,并引入 时序视听交错链式思维 (Temporal AV Interleaved CoT) 增强推理的时序定位能力。

关键发现

  • AV-Flamingo 在同尺寸模型中取得明显优势,尤其在长且复杂的真实世界视听理解任务上性能突出。
  • 与更大模型相比,仍具竞争力,在部分长视频推理任务上甚至超越闭源和更大开源模型。
  • 在基准之外,模型展现出对未见任务的良好迁移能力和现实世界实用性。

基线对比解读

与仅关注短时片段的前代 AV-LLM 相比,AV-Flamingo 通过专门设计的训练数据和课程策略,有效缓解了长视频中时序信息遗忘和跨模态对齐困难的问题。Temporal AV Interleaved CoT 框架使得中间推理步骤显式关联时间戳,提高了可解释性和时序对齐精度,这是其超越更大模型的关键因素。

该实验设计强调从数据到训练方法的全链路优化,为开放视听智能在长视频落地提供了可行路径。

行业影响

落地场景

Audio-Visual Flamingo (AV-Flamingo) 作为首个专为长视频、复杂多模态理解设计的开源大模型,可服务于需要深度解析视频内容的多个行业:

  • 媒体与内容平台:自动生成带时间戳的多模态摘要、章节分段,支持长视频(如纪录片、讲座、访谈)的智能索引和可解释性搜索。
  • 教育与培训:对教学录像进行知识点定位与答疑,基于音画联合理解评估演讲或操作技能(例如医疗手术录像分析、工业操作合规检测)。
  • 企业会议与合规:长时间会议录音的跨模态总结,将口头讨论与共享文档/画面变化对齐,生成结构化纪要并归因发言人。
  • 自动驾驶与安防:对行车记录或监控视频进行多事件回溯,通过音频(引擎声、语音报警)与视觉事件的同步推理,实现长时域事故原因解析。

商业价值

AV-Flamingo 在 15+ 基准测试中超越同等规模模型,并在部分任务上胜过更大的闭源模型,其商业价值体现在三条线:

  • 降本:开源模型避免 API 调用成本,本地部署可用于海量视频处理,减少人工标注和审核开销。
  • 增收:帮助内容平台提升用户粘性(如自动生成精准时戳看点标签),或为教育、安防等垂直领域提供高附加值分析工具。
  • 体验提升:通过 Temporal Audio-Visual Interleaved Chain-of-Thought 提供带时间戳的推理过程,增强模型决策的可解释性与用户信任感,尤其适用于需审计轨迹的高风险场景(如医疗、金融合规)。

与现有产品/工作流的集成

  • 模型层:AV-Flamingo 的架构基于 Flamingo/Llama 系列,可直接替换或增强现有视觉-语言模型的音频与长视频处理能力;其 三阶段课程学习 策略可复用于其他多模态预训练流程。
  • 数据层:发布的 Audio-Visual-Skills 数据集(约 7M 训练样本)可作为高质量人工标注替代,用于领域微调。
  • 服务接口:模型输出格式(带时戳的推理步骤)易于与 Elasticsearch、向量数据库等检索系统对接,构建多模态视频问答与语义搜索 API。

具体落地案例

  1. 全球教育平台:利用 AV-Flamingo 对录制课程自动生成分段标题、检索特定实验操作片段,并根据教师讲解语音与板书/屏幕变化的时间对齐,形成可交互的知识图谱。
  2. 跨国企业会议助手:集成到 Teams 或 Zoom 工作流,对长时间会议视频进行音频(多人对话、语气)与视觉(幻灯片切换、白板绘图)联合建模,输出带发言人归属和材料引用的决策追踪日志,显著提升会后执行效率。

局限

  • 尽管 Audio-Visual-Skills 提供了约 7M 训练实例,但其构建仍需大量人工或半自动标注,且视频分布偏向特定领域(如教学、讲座等),模型在完全开放域的长视频上的泛化能力尚未充分验证;同时,训练所用的数据配比和清洗策略可能隐藏额外成本,其可复现性对其他团队构成挑战。
  • 模型能够处理长视频,但实际仍受 LLM 上下文窗口限制(如 1M tokens),对于数小时级视频的密集多事件推理可能仍需截断或下采样,丢失精细的时序细节;此外,三阶段课程虽提升了长程能力,但训练流程复杂,可能增加超参数调优难度,且未讨论对极长视频(如电影)的扩展性。
  • 与 Gemini 1.5 Pro 等巨型闭源模型相比,AV-Flamingo 在需要广泛世界知识或高精度问答的任务上可能仍有差距;论文虽对比了多个开源模型,但未全面覆盖最新的音频-视觉 LLM(如 VideoLLaMA 2、PandaGPT 等),且部分基线可能受限于其自身的训练设置,比较的公平性有待加强。
论文Sreyan Ghosh2026-07-17原文

相关内容