论文

Omni-DuplexEval: 评估实时双工全模态交互

Omni-DuplexEval: 评估实时双工全模态交互

现有多模态大语言模型(MLLMs)主要在离线设置下评估,即处理完整视频后才生成响应,无法衡量实时流式交互能力。为填补这一空白,我们提出 Omni-DuplexEval——面向实时双工交互的基准测试,包含两个互补场景: 1. 实时描述:评估模型在持续流式输入下生成时间对齐的连续响应的能力。 2. 主动提醒:评估模型识别关键事件并在适当时刻主动响应的能力。 基准包含 660 个视频,配有细粒度人工标注和精确时间元数据,涵盖 9 个真实场景任务,所有问题均为开放式。我们进一步引入基于 LLM-as-a-Judge 的自动评估框架,通过时间戳感知和顺序推理联合评估响应内容对齐和响应时机,与人工判断高度一致。 实验表明,当前最优双工 MLLM 综合得分仅 39.6%,主动提醒项仅 20.0%。模型面临两大挑战:难以平衡及时响应与连贯内容生成;常无法确定何时响应及生成什么。

论文精读

TL;DR Omni-DuplexEval 首次系统评估 MLLM 的实时双工交互能力,通过 660 段视频与 LLM 自动评判,揭示模型在流式描述与主动提醒上的核心短板。

问题

问题背景

多模态大模型(MLLM)正从静态分析走向实时流式交互,尤其是实时双工全模态交互——模型需在连续流式输入过程中及时生成响应,而非等待完整视频后再回答。当前业界对这类交互的系统评估尚处空白。

现有方法局限

主流视频 MLLM 评测(如 Video-MME、MVBench)均采用离线设置:完整输入视频后一次性生成答案,忽略了真实场景中的时序约束。最近虽有研究尝试构建双工 MLLM,但缺乏统一基准与自动评测框架

  • 没有规范去衡量响应内容的时序对齐(是否在正确的时间点说出正确的事);
  • 缺少对主动提醒能力(能否在关键事件发生时主动干涉)的定量评估;
  • 人工评测成本高且难以复现,现有 LLM-as-a-Judge 方案无法直接处理带时间戳的流式响应。

为什么这个问题难/重要

实时双工交互面临双重挑战:何时回应回应什么。模型必须持续整合流式视听信号,实时判断响应时机,并生成连贯、上下文一致的内容。这两者高度耦合:过早响应可能信息不完整,过晚则失去时效性。从应用看,对话式 AI、实时会议纪要、智能眼镜助手等场景都依赖此类能力,评估体系的缺位直接阻碍了模型迭代。

行业类比

类似自动驾驶需要实时目标检测与决策,实时双工 MLLM 的评估就像给"副驾驶 AI"设计路考——不仅要看最终行驶路线(内容),还要看每一次刹车的时机(时序)。

核心洞察

  • 实时双工交互评估是当前多模态大模型走向真实世界部署的关键缺口,Omni-DuplexEval 首次系统化定义了该场景的评测维度。与主流离线评测(如 Video-MME、MVBench)只关注最终回答质量不同,该基准要求模型在流式输入过程中持续生成时间对齐的响应,并自主判断何时发言,直接衡量模型的“交互主动性”与“时序敏感度”,这更贴近语音助手、自动驾驶等动态场景的实际需求。
  • 当前最先进的双工 MLLM 在 Proactive Reminder 任务上仅得 20.0% 分,暴露出模型缺乏事件驱动的响应时机决策能力。这一结果表明,即使内容生成质量不错,模型仍难以判断“何时该说”——这是从离线 QA 到实时助手跨越的核心瓶颈。该发现为后续工作指明了方向:必须显式建模事件显著性、时间窗口预测或引入强化学习等新范式来训练模型的主动交互意识。
  • 论文提出的 LLM-as-a-Judge 评估框架创新性地将时间戳感知推理和序列化判断相结合,解决了实时交互中“内容一致性”与“时序敏感性”难以联合自动评分的挑战。通过多窗口采样和时序排序打分,该框架与人类判断高度一致,为实时视频理解模型提供了可扩展、低成本的离线评测方法,未来或可推广至更多流式任务自动化评估。

方法

任务设计

Omni-DuplexEval 定义了两类实时双向交互场景:实时描述 (Real-Time Description)主动提醒 (Proactive Reminder)。前者要求模型对持续输入的视频流生成连续、时间对齐的描述,后者则考验模型在关键事件发生时主动给出提示的能力。

基准构建

  • 从 9 个现实场景中收集 660 个视频,每个视频配有细粒度的人工标注与精确时间元数据。
  • 全部问题设计为开放式查询,避免固定选项对模型真实能力的限制。

评估流水线 (以 LLM-as-a-Judge 为核心)

整体框架将模型的流式响应与视频时序标注进行对比,重点评估两个维度:

  • 内容一致性 (Content Consistency):用大语言模型 (LLM) 将模型输出的描述与人工标注的关键点进行语义比对,判断信息是否准确、无遗漏,并依惩罚表打分。
  • 时序敏感性 (Temporal Sensitivity):分四步自动评测——(1) 语义相关性过滤,筛出与查询相关的响应片段;(2) 多窗口采样,在不同时间尺度上检查响应位置;(3) 多模态上下文提取,获取周边视频片段信息;(4) 利用 LLM 结合时间戳进行序列推理,判断响应是否出现在正确的时间点。

对于主动提醒任务,额外引入时间窗口提取和基于 LLM 的判断,综合计算召回与精确度。

与同类方法的差异

不同于仅关注离线视频理解的评测,Omni-DuplexEval 首次系统性地将响应时序内容质量联合纳入自动评估,并融合时间戳感知推理与序列推理,填补了实时双向交互基准的空白。

实验

实验设计

Omni-DuplexEval 是一个专为实时双工交互设计的评测基准,包含 660 个视频,覆盖 9 个真实世界任务,分为两大场景:

  • Real-Time Description:评估模型在连续流式输入下生成时间对齐描述的能力;
  • Proactive Reminder:评估模型主动识别关键事件并在合适时机响应的能力。

评测采用 LLM-as-a-Judge 自动框架,联合评估响应内容一致性(content consistency)与响应时序(response timing),通过时间戳感知推理(timestamp-aware reasoning)和序列推理(sequential reasoning)实现细粒度打分,并与人类判断高度对齐。

关键发现

  • 当前最优的 duplex MLLM 总得分仅 39.6%,在 Proactive Reminder 场景中更是低至 20.0%,表明模型离实用水平仍有巨大差距。
  • 模型普遍难以在 及时响应生成连贯、完整的描述 之间取得平衡;同时,它们既无法准确判断 何时应该响应,也无法决定 响应什么内容

基线对比与分析

虽然论文未列出所有对比模型的具体分数,但“最佳”仅 39.6% 的总体表现强烈暗示,即便当前最先进的多模态大模型在真实流式双工场景下也近乎失效。Proactive Reminder 的超低分更说明,主动发现显著性事件并适时介入的能力是目前技术栈中的明显盲区。LLM-as-a-Judge 自动评估与人工判断的高度一致性,验证了该框架作为标准化评测工具的可靠性,为后续模型迭代和工程优化提供了 low-cost、可复现的度量手段。整体而言,Omni-DuplexEval 揭示了 real-time duplex MLLM 的发展瓶颈,指出了同时优化内容质量与时间敏感性的双重挑战。

行业影响

落地场景

Omni-DuplexEval 面向的实时双工全模态交互能力,可直接赋能智能客服视频监控分析直播互动助手自动驾驶座舱等场景。例如,在电商直播中,AI 需持续理解画面流并生成实时解说,同时自动识别高光时刻(如秒杀开始)主动提醒观众;在工业安全监控中,模型需持续描述生产状态,并在异常事件(如设备故障)发生时立即告警。

商业价值

实时双工能力将 AI 从被动问答升级为主动服务体,显著提升用户体验与流程自动化率。自动评估框架可替代昂贵的人工评测(如人工标注事件时间戳),降低评估成本;精准的响应时序对齐能直接提升交互类产品的用户满意度,如智能座舱中的危险预警可减少事故风险,带来安全价值与保险成本下降。模型在该基准上的明显短板表明,改进此项能力有望形成竞争壁垒,增收潜力来自更高级的订阅服务或解决方案溢价。

与现有工作流的集成

该基准可作为品质门禁集成到 MLLM 开发流水线:在模型训练后的离线评估阶段,自动运行 Omni-DuplexEval 并输出总分与分项指标;其 LLM-as-a-Judge 评估器可封装为 CI/CD 插件,每次提交触发回归测试。数据标注的细粒度时序元数据还可用于微调实时交互模型,直接提升下游产品表现。

具体用例

  • 电商直播平台:实时多模态模型接收商品画面与主播语音,自动生成产品描述文案,并在促销节点(如“前100名下单半价”)自动弹出提示,提升转化率。
  • 高级驾驶辅助系统(ADAS):车内摄像头持续分析驾驶员面部与姿态,实时描述驾驶状态,在检测到疲劳或分心时主动语音提醒,并与车辆控制模块联动。

局限

  • 基准的场景覆盖范围有限:Omni-DuplexEval 主要聚焦于**实时描述**与**主动提醒**这两个场景,包含 660 个视频和 9 个子任务,但对于更广泛的实时交互类型(如多轮对话、指令跟随、交互式问答)支持不足。现实世界中的双工系统往往需要同时处理多种交互模式,当前基准未能反映此类复杂性,可能高估或低估模型在真实部署中的表现。
  • 自动评估框架的潜在偏差:虽然 LLM-as-a-Judge 的评估结果与人类判断高度对齐,但该方法本身仍依赖大语言模型的时序推理能力。在**响应时机**与**内容连贯性**的联合评估中,LLM 可能产生幻觉或对时间戳的细粒度解析不够稳定,尤其是在响应边界模糊的情况下。此外,评估假设模型输出为离散片段,难以直接适配流式生成的中间状态,降低了工业化落地时的可参考性。
  • 实验基线模型的代表性不足:目前仅评估了少数前沿双工 MLLM,且这些模型可能尚未针对实时交互进行专项优化(如缺乏专门的流式解码策略或延迟控制),导致整体得分极低(最优模型总体仅 39.6%,主动提醒任务仅 20.0%)。这给基准本身的难度校准和有效性验证带来不确定性——如果更先进的模型也无法明显提升,则基准的区分度或合理性存疑。
论文Chaoqun He2026-05-17原文

相关内容