LatentOmni: 通过统一音频-视觉潜在推理重新思考全模态理解
联合音频-视觉推理对于全模态理解至关重要,但当前 多模态大语言模型 (MLLMs) 在需要从两种模态中获取细粒度证据进行推理时仍面临困难。一个核心局限是显式的基于文本的 思维链 (CoT) 将连续音频-视觉信号压缩为离散标记,削弱了时间定位能力,并将中间推理转向语言先验。 我们认为统一的潜在空间是更好的推理媒介,因为它保留了密集的感官信息,同时与自回归生成兼容。基于这一见解,我们提出 LatentOmni ,一个跨模态推理框架,将文本推理与音频-视觉潜在状态交织。LatentOmni 引入特征级监督以对齐潜在推理状态与任务相关感官特征,并使用 全同步位置嵌入 (OSPE) 保持潜在音频和视觉状态之间的时间一致性。我们进一步构建 LatentOmni-Instruct-35K 数据集,这是一个音频-视觉交错推理轨迹数据集,用于监督潜在空间推理。 在多个音频-视觉推理基准上的全面评估表明,LatentOmni 在评估的开源模型中达到最佳性能,并 consistently 优于显式文本思维链基线,支持潜在空间联合推理作为通往更强全模态理解的有前途路径。
论文精读
TL;DR LatentOmni 将音视频联合推理置于统一潜空间,用潜状态交织文本推理,通过特征级监督和时间同步嵌入,超越显式文本 CoT,实现更细粒度的全模态理解。
问题
问题背景
多模态大模型(MLLMs)在图文理解上已取得长足进步,但在需要音视频联合推理的全模态(omni-modal)任务中仍然表现不足,尤其是当推理需同时依赖两模态的细粒度时序证据时。
现有方法局限
当前主流方案采用显式文本链式思考(Text CoT),将连续的音频和视觉信号强制压缩为离散 token 序列。这带来两个关键瓶颈:
- 时序信息丢失:精细的时间结构(如声音的起止、动作的瞬时变化)在离散化过程中被抹除,难以保留准确的跨模态同步关系。
- 语言先验偏差:中间推理被引向文本符号空间,原有的感知特征(如频谱、光流)被弱化,模型容易陷入语言模式的捷径,而非真正融合多模态证据。 类似工作如 ViLaIn 等也观察到纯文本中介推理的局限性,但未能从推理过程的表示层面解决。
为什么这个问题难/重要
音视频信号包含密集的传感信息,其连续性、高维性和时序对齐要求远高于文本。让推理在潜在空间(latent space)进行,既能保留感知丰富度,又与自回归生成兼容,但如何对齐不同模态的潜在状态并维持时序一致性是技术难点。随着虚拟助手、视频分析、具身智能等场景对细粒度多模态理解的需求激增,业界亟需突破文本限制的推理范式。
行业类比
就像高级驾驶辅助系统需要直接在感知层面融合摄像头与激光雷达点云,而非将其转成文字再决策,全模态理解也同样需要绕过显式文本瓶颈,在潜在空间中进行跨模态推理。
核心洞察
- **隐空间状态作为跨模态推理的媒介,比显式文本链式思考(CoT)更能保留细粒度时序证据和感官信息。** 现有 MLLM 将音频和视频信号量化为文本 token,导致连续时序信息被离散化、推理偏向语言先验。LatentOmni 在自回归生成中交织音频-视觉隐状态与文本 token,直接在统一隐空间进行多步推理,维持了原始信号的高保真度,避免了模态压缩带来的信息损失,这一设计是对传统 CoT 仅依赖文本中介的根本性反思。
- **特征级监督(feature-level supervision)将隐推理状态与任务相关的多模态感官特征显式对齐,开创了隐空间推理的新训练范式。** 不同于以往工作仅通过最终文本输出间接约束隐状态,LatentOmni 引入辅助损失让隐状态直接逼近关键音频帧或视频帧特征,迫使模型在隐层就完成跨模态证据融合,而非将推理推迟到文本生成阶段,显著提升了对时间敏感和多步依赖的复杂场景的推理性能。
方法
LatentOmni 以 音视频联合推理 为核心,将连续的感官信号保留在统一潜在空间中,通过交错式推理输出最终答案。
输入与表示
- 输入:一段视频(视觉帧序列)+ 对应音频 + 自然语言问题。
- 编码:视觉与音频分别经各自编码器提取特征,但不做离散化,保留为连续潜在状态,保留时间密度与细节。
关键模块
Omni-Sync Position Embedding (OSPE)
为潜在状态注入可学习的时间位置嵌入,使不同模态的潜在向量在时间轴上对齐,保障跨模态的时间一致性。交错式推理架构
推理过程交替进行:- 生成文本 token(用于显式推理步骤或最终答案);
- 更新潜在状态(在模态内部完成细粒度定位、比较、关联等操作)。
这种交错避免将全部中间推理强行转为离散文本,从而减少信息压缩损失。
特征级监督
训练时对潜在状态施加额外损失,使其向任务相关的感官特征(如物体检测特征、音频事件嵌入)对齐。这让潜在推理步骤具备可解释的语义含义,而非无约束的隐式变换。
训练与数据
- LatentOmni-Instruct-35K 数据集:包含约 35K 条音频-视觉交错推理轨迹,每条轨迹中混合了文本 CoT 片段与潜在状态目标,用于监督混合推理过程。
- 训练目标:自回归方式预测下一个文本 token 或潜在状态(采用合适的回归/对比损失),联合优化文本生成与潜在空间推理能力。
与显式文本 CoT 的差异
传统方案将连续信号压缩为离散单词,丢失时间基础与感官细节,推理易被语言先验主导;LatentOmni 在潜在空间内保留原始信号,使推理更贴近底层感官证据,在需要精准音视频对齐的任务中表现更优。
实验
实验设计
论文在多个音频-视觉联合推理基准上对 LatentOmni 进行评估,包括 MUSIC-AVQA、ActivityNet-QA、AVQA 等,对比对象涵盖近期开源多模态大模型以及基于文本显式链式思维(Explicit Text CoT)的基线方法。实验使用作者构建的 LatentOmni-Instruct-35K 数据集进行训练,评估指标主要为问答准确率。
关键发现
- LatentOmni 在所有参与对比的开源模型中取得最优性能。
- 相比显式文本 CoT,LatentOmni 的隐空间推理一致性地带来显著增益,尤其在需要精细时序证据对齐的任务上优势明显。
- 消融研究验证了特征级监督与 Omni-Sync 位置嵌入 对时序一致性和推理质量的关键作用。
基线对比分析
传统显式文本 CoT 将连续视听信号压缩为离散 token,导致时序定位弱化和语言先验偏移。LatentOmni 直接在统一的隐空间进行跨模态推理,保留密集的感官信息,使模型能够更精确地关联视听片段。实验表明,这一设计在需要联合推理音视频证据的场景中,有效克服了文本瓶颈,验证了隐空间作为全模态理解推理介质的可行性,为后续全模态模型设计提供了新思路。
行业影响
落地场景
LatentOmni 的核心能力在于对音频与视频流进行端到端的跨模态潜在空间推理,这直接适配以下高价值场景:
- 音视频内容审核与安全:平台需要对直播、短视频中的违规行为(如暴力画面配合相关音频)进行细粒度判断,文本 CoT 易遗漏时序线索,而潜在空间推理保留原始信号,可提升召回率与准确率。
- 智能会议/教育录播分析:自动分段、摘要或问答系统需精准理解多说话人音画同步中的关键事件,LatentOmni 的时序一致性嵌入(OSPE)确保跨模态对齐,避免信息错位。
- 交互式语音视觉助手:如智能音箱带屏设备,需实时处理用户讲话与环境视觉输入进行组合推理,潜在状态推理避免了语言先验干扰,可输出更贴合物理世界的行动。
商业价值
核心收益来自 推理质量提升带来的错误率下降与人工审核成本节省:
- 降本:音视频审核、客服质检等劳动密集型环节,通过更可靠的自动推理模型可大幅减少人工复判量;模型本身不依赖大批量文本标注,潜在空间监督可利用特征级信号降低数据制作成本。
- 增收:更精准的内容理解能驱动推荐系统识别出高互动潜力的“梗”素材(如画面与配乐的反差幽默),提升用户时长;在电商直播中,准确捕捉商品与主播介绍的视觉-语音一致性可优化实时购物推荐,提高转化率。
- 体验提升:产品交互中消除误判(如误封禁无害内容)和降低响应延迟,直接改善用户留存与品牌信任。
与现有产品/工作流的接口
LatentOmni 可作为 即插即用的推理后端模块 融入现有 MLLM 栈:
- 模型层:其核心组件(特征级监督、OSPE)以轻量适配器形式接入已有视觉/音频编码器与 LLM 主干,类似 LoRA 式微调,无需推翻现有模型架构。
- 数据层:LatentOmni-Instruct-35K 的数据合成范式(基于 caption 生成带推理轨迹的指令数据)可直接复用,与现有 RLHF 或 SFT 流程兼容。
- 部署层:推理时潜在状态在自回归过程中逐步生成,与现有解码引擎无冲突,只需要在 token 序列中插入特殊的 latent token 占位符,推理框架改动量小。
具体落地 Use Case
- 全球短视频平台内容审核:UGC 出海产品需应对不同文化背景的违规视频。传统审核器对“口型与暴力台词不同步”的伪造视频易漏检,LatentOmni 的联合时序推理可直接在编码阶段对齐唇动和音频特征,发现不一致,有效拦截深度伪造或违规剪辑内容。
- 医疗远程会诊系统:在线问诊平台常集成可穿戴设备传回的生理音(心音、呼吸音)与患者实时视频。当医生需要快速定位异常时段(如心律不齐伴随面部痛苦表情),LatentOmni 可自动标注并生成结构化报告,潜在空间推理直接利用连续信号,比先转为文本再推理更可靠,减少关键症状遗漏。
局限
- **潜空间推理的可解释性局限**:LatentOmni 将中间推理迁移至连续潜空间,虽然保留了感知细节,但推理过程不可直接阅读,难以调试或验证推理逻辑的正确性。这对实际部署中的安全审计、错误追溯提出了挑战,尤其在与显式文本 CoT 可解释性的对比下,黑盒特性可能限制在高风险场景的应用。
- **数据集与任务泛化边界**:论文构建的 **LatentOmni-Instruct-35K** 数据集主要基于合成 QA 和片段级描述,监督信号依赖于自动构造的推理轨迹。尽管在 AVQA 等基准上表现优异,但数据覆盖的复杂现实场景有限,模型在开放域、长视频、存在噪声或模态缺失下的鲁棒性尚未充分验证。此外,训练数据量 35K 相对较小,可能限制了模型在更广泛多模态推理任务上的表现。
- **与端到端多模态模型的竞争**:相较于直接扩展 LLM 处理音视频 token 的端到端方案(如 Video-LLaMA 2、Audio-Flamingo 等),LatentOmni 额外维护了潜状态推理流,增加了训练复杂度和推理计算开销。它虽然在需要细粒度时间对齐的推理上更优,但在简单多模态任务或纯文本推理中可能引入冗余,且未展示在非推理类多模态基准(如 Video-MME)上的优势,实用性边界尚不清晰。