Omni-Streaming Thinking
流式全模态模型 需要根据截至目前观察到的视频片段与同步音频,决定回答什么、何时回答。视觉线索往往在话语或声音事件结束前就已支持某种解释;一旦这种解释作为事实进入记忆,后续推理便可能持续沿用,即使音频已与之矛盾。我们将这一失败称为 过早跨模态承诺(premature cross-modal commitment)。 我们提出 Omni-Streaming Thinking(OST),其生成的结构化输出包含:截至目前观察到的证据、对未来证据的预测,以及基于这些证据的主张。每条主张初始标记为待定,并关联一个未来的验证区间。音频与视觉证据分开存储,OST 在验证区间结束时按指定模态的证据核验主张;检测到矛盾证据时,反驳过程 会削弱该主张及其依赖状态的影响,并依据新证据引导状态更新。答案门控 则判断回答关键主张是否满足给出回应的条件。 在冻结的 Qwen3-Omni-30B-A3B-Instruct 主干上做轻量适配后,OST 在五个流式与音视频基准上平均相对超越最强开源基线 10% 以上。我们还提出 OST-DiagBench:固定视频、编辑音频,用以测试一致、缺失、矛盾、共存与字幕-语音冲突五种情形。OST 取得 d-prime = 2.95,而开源基线最高仅 1.38,同时减少了视觉诱发的听觉幻觉。
论文精读
TL;DR 针对流式全模态模型视觉线索过早主导、音频矛盾被忽略的幻觉问题,OST 提出可延迟验证的声明与矛盾回撤机制,在多个基准上平均提升超 10%。
问题
问题背景
流式全模态推理要求模型在连续到达的视频块与同步音频流上,实时决定“答什么”与“何时答”。核心难点是信息逐步暴露,模型必须在证据不完整时形成可用的中间表示。
现有方法局限
主流流式全模态模型通常将跨模态特征隐式融合进一个持续更新的状态,缺乏显式的跨模态验证与回溯纠错机制。视觉线索往往先于音频语义完整呈现,例如口型或动作已暗示某个词,模型可能过早将这种视觉主导的解释 写入记忆并继续传播。一旦后续音频给出相反证据,系统无法有效撤回已固化的推断,导致 premature cross-modal commitment。现有方案要么完全信任先到模态,要么仅做简单后融合,没有分离存储不同模态证据,也没有定义验证时窗和反驳路径,因此在矛盾场景下会持续输出错误答案或产生视觉诱导的听觉幻觉。
为什么这个问题难/重要
难点在于时序建模与因果追溯:流式场景中模型必须做出暂定承诺以便继续推理,但又要能在新证据出现时消除旧状态的影响,这需要显式的依赖记录与反事实更新。跨模态验证还涉及不同模态的到达时间差与语义冲突,不能简单加权平均。业界对实时多模态助手、视频理解与自动驾驶等场景的关注度极高,错误承诺会直接损害系统可靠性与用户信任;而幻觉在流式交互中会被放大,因为用户无法回看修正过程。因此,设计可验证、可修正的流式思考机制是关键挑战。
行业类比
类似自动驾驶中,摄像头先检测到疑似行人,但激光雷达随后否定该目标;系统必须先保留假设并延迟最终决策,直到多传感器在验证窗口内一致,才能执行制动或避让动作。
核心洞察
- 流式全模态推理的核心瓶颈并非模型容量,而是过早的跨模态承诺:视觉线索常在语音或声音事件完成前就诱导出事实性解释,一旦该解释作为事实写入记忆,后续音频矛盾也难以纠正。OST 将输出重构为证据、预测与待验证声明,每个声明显式绑定未来验证区间,并在该区间内仅依据指定模态的证据进行校验,从而把“何时相信什么”从隐式状态更新变为可审计的时序决策。
- OST 的独特之处在于用因果撤回代替事后纠错:当验证发现矛盾证据时,通过 refutation process 按依赖关系降低声明及其派生状态的影响,再引导状态更新,而不是直接覆盖或追加纠错信息。这避免了记忆中的视觉事实持续被后续推理重新激活,是相对于仅做答案修正或丢弃缓存的方法更根本的机制改进。
- OST-DiagBench 通过固定视频、编辑音频构建五种条件(一致、缺失、矛盾、共存、字幕-语音冲突),暴露了开放基线中视觉偏见引发的听觉幻觉:d-prime 最高仅 1.38,而 OST 达到 2.95,且音频独有识别在视频存在时不再显著丢失。这一诊断框架将模型评估从聚合准确率推进到特定跨模态干扰的可归因测量,为流式全模态模型的鲁棒性研究提供了可复用的工具。
方法
方法核心路径
输入:流式视频块与同步音频,逐步进入模型;模型需在信息不完全时决定回答时机。
1. 未来声明与证据保留
OST 的每一步生成结构化输出,包含三类字段:
observed_evidence:分别存储音频与视觉证据,避免跨模态混淆;forecast:预测未来可能出现的证据;claims:基于当前证据提出的断言,但每个断言初始标记为pending,并绑定一个verification_interval。
2. 验证与因果撤回
到达验证区间末尾时,在对应模态中检查该 claim。若发现矛盾证据,触发 refutation:
- 降低该 claim 及其依赖状态的影响;
- 利用新证据更新状态;
- 以 verdict 为条件继续生成后续内容。
3. 答案门
Answer gate 判断 answer-critical claims 是否满足回答条件,在最早可回答时间输出最终答案,避免过早跨模态承诺。
训练:冻结 Qwen3-Omni-30B-A3B-Instruct 主干,仅做轻量适配,监督目标包括 forecast、verification、gate 等。
差异点:相较普通流式模型直接输出下一个 token,OST 引入显式的声明-验证-撤回机制,将跨模态一致性检查结构化到推理过程中。
实验
实验设计
OST 在五个流式与音视频基准上评估,并使用新提出的 OST-DiagBench 诊断跨模态偏差。该基准固定视频、编辑音频,覆盖一致、缺失、矛盾、共存、字幕-语音冲突五类条件。模型采用 frozen Qwen3-Omni-30B-A3B-Instruct backbone 加轻量适配,输出结构化证据、预测与待验证声明。
关键发现
OST 在五个基准上平均相对提升 >10%。在 OST-DiagBench 上 d-prime = 2.95,而开源基线最高仅 1.38。同时降低由视觉引发的听觉幻觉。消融表明验证与撤回机制对纠正跨模态过早承诺至关重要。
对比解读
相比直接流式生成答案的基线,OST 通过延迟声明、按模态验证、矛盾撤回,显著减少过早跨模态承诺。其 answer gate 让模型在满足条件时才作答,而非固定时间点或盲目等待。对工程实践而言,这种证据-声明分离与到期验证的设计可推广到多模态实时交互系统,尤其适用于需要高可靠性的音频视觉助手。
行业影响
落地场景
OST 适用于需要实时理解音视频流的场景:视频会议助手(实时摘要、行动项提取)、直播电商(主播口播与画面联动,自动回答买家问题)、在线教育(实时答疑、课堂互动)、智能监控(异常事件检测与语音报警)、辅助驾驶(多模态交互确认指令)。这些场景要求模型在流式输入下低延迟、避免误判,OST 的 verification interval 和 refutation 机制能有效减少跨模态误导。
商业价值
- 降低误答成本:减少因视觉误导产生的幻觉,降低人工复核和客服纠纷成本。
- 提升用户体验:更准确的实时响应提高用户留存和信任。
- 加速决策:在监控和驾驶等场景,及时正确的判断可避免事故。
与现有工作流的接口
OST 基于 Qwen3-Omni-30B-A3B-Instruct 冻结主干加轻量适配,可作为现有流式推理服务的插件或后端。可集成到 pipeline 中,接收视频 chunk 和音频流,输出结构化 claims 和答案。与 ASR、VAD 等模块配合,通过 typed due-window verification 和 retraction algebra 实现事后纠错,无需推翻现有架构。
具体落地 use case
- 直播电商实时客服:用户询问“这件衣服什么颜色?”模型结合主播口播和画面,若口播未提及颜色,可先看画面回答;若后续口播更正,模型能撤回并更新,避免错误商品信息。
- 远程医疗问诊辅助:医生与患者视频通话,模型实时生成病历摘要,对不确定的医学术语设置 pending claim,待后续语音确认后再写入,避免误诊。
局限
- 方法基于冻结的 Qwen3-Omni-30B-A3B-Instruct 主干并仅做轻量适配,虽然高效但可能限制了复杂跨模态推理的上限,未能充分发挥大模型的潜力。同时,所有实验仅在 Qwen3-Omni 一种架构上进行,对其它全模态模型(如 Gemini 系列、GPT-4o 等闭源系统或不同参数规模的开源模型)的泛化性尚不明确。
- 引入 verification interval 与 refutation 机制会在流式场景中增加额外推理步骤和决策延迟。论文未详细报告端到端延迟开销,对于实时语音助手这类对响应时间敏感的应用,等待验证窗口结束再回答可能影响用户体验,需要进一步权衡准确率与延迟。
- OST-DiagBench 通过人工编辑音频构造冲突、缺失等条件,其分布与自然场景中的跨模态冲突可能不完全一致。d-prime 指标的提升虽然在诊断集上显著,但真实部署时面对自然发生的视觉诱导听觉幻觉是否同样鲁棒仍有待验证。此外,对比实验主要针对开源基线,未与更强闭源模型进行比较。