论文

OmniVChat: 面向原生音视频对话的合成、基准测试与训练

OmniVChat: 面向原生音视频对话的合成、基准测试与训练

我们将 OmniVChat(Omni Video Chat)定义为用户与 omni 模型之间的原生音视频对话 任务:omni 模型直接、同时接收用户的音频与视频并返回文本,用户的提问内嵌于音视频之中,无需单独的文字问题、外部字幕或语音识别。这种直接输入在保留感知线索的同时,降低了外部延迟与计算开销。 但 OmniVChat 的研究受限于两点:数据可得性 与 评估。人们用自有设备录制的素材十分稀缺;而好的回复往往需要考虑用户所处的环境、面部表情与附近物体,表达方式多样,令关键词匹配难以可靠评估回复质量。 近期 agent 系统与视频生成的进展,使「为理解而生成」成为可行,即用合成对话做训练与评估。我们提出 OmniVChat-Studio,一个合成单轮与多轮音视频对话的多 agent 数据引擎;据此构建 OmniVChat-Bench,一个跨五类能力评测 omni 模型基础对话能力的基准;并提出 OmniVChat-RL,一种联合优化回复正确性、效率与风格 的强化学习奖励设计。 在合成对话上用 OmniVChat-RL 训练 Qwen3-Omni-Instruct,可同时提升其在 OmniVChat-Bench 与人工录制的 OmniVChat-Bench-Human 上的表现,验证了奖励设计并显示其可迁移到真实对话。

论文精读

TL;DR 本文定义原生音视频对话任务 OmniVChat,以多智能体合成对话解决数据与评估难题,并提出 OmniVChat-RL 奖励,使 Qwen3-Omni-Instruct 在合成与真人基准上均显著提升。

问题

问题背景

随着多模态大模型(如 GPT-4o、Gemini)支持语音和视觉输入,业界开始关注原生音视频对话——用户通过摄像头和麦克风直接与模型交互,无需文本输入。这种交互方式能保留语音语调、面部表情、环境上下文等丰富信息,是实现自然交互的关键路径。

现有方法局限

当前方法主要存在三个技术瓶颈:

  1. 级联架构引入延迟与错误:许多模型采用 ASR + VLM 的流水线,先转写语音再理解视觉,导致端到端延迟增加,且 ASR 错误会传播到下游。
  2. 数据稀缺:真实用户自拍的音视频对话数据极为稀缺,难以大规模收集,限制了模型训练。
  3. 评估不可靠:开放式对话回复多样,传统基于关键词匹配或 BLEU 指标无法有效衡量回复质量,尤其当回复需要结合视觉上下文时。

为什么这个问题难/重要

  • 技术挑战:模型需要同时理解音视频流中的动态语义,包括用户表情、手势、环境物体,并生成恰当、高效、风格合适的文本回复,这对多模态融合和推理能力要求极高。
  • 业界关注度:实时多模态交互助手(如 AR 眼镜、智能座舱)正成为竞争焦点,原生音视频对话是此类应用的核心能力,减少外部处理(如 ASR)能降低计算开销和响应时间。

行业类比

类似视频会议场景中的实时 AI 助手,需要直接分析与会者的语音和视频画面来回答问题,而不是等待会议转录文字后再处理。

核心洞察

  • 提出用生成式智能体合成原生音视频对话数据,以解决真实录制数据稀缺与标注困难。传统多模态对话依赖 ASR 转写或外部字幕,会破坏原始感知信息;而 OmniVChat-Studio 通过多智能体模拟真实用户交互,保留音频视觉细节,同时生成训练与评估数据,实现从“生成用于理解”的范式转变。
  • 设计联合正确性、效率与风格的强化学习奖励,以适配原生音视频对话的开放性与实时性。以往多模态 RL 多关注回复与参考答案的相似度或单一正确性,难以应对回复多样性及低延迟需求;OmniVChat-RL 同时优化三个维度,并在人类录制基准上验证迁移,表明该奖励能引导模型学习真实对话中的权衡。

方法

输入与输出

OmniVChat 任务中,输入为同时的原始音频流和视频流,用户查询直接嵌入音视频信号中,不依赖 ASR 转写、外部字幕或独立文本问题。模型接收视听输入后,直接输出文本回复。该设定消除了管道式方案中的转录延迟与信息损失,保留语调、表情、环境等感知线索。

关键模块

方法围绕三个组件展开:

  1. 数据合成引擎 OmniVChat-Studio
    采用多代理架构,模拟用户与模型之间的原生音视频对话,生成单轮与多轮数据。合成对话覆盖用户周边环境、面部表情、物体交互等上下文,且回复具备多样表达,为后续训练与评估提供数据基础。

  2. 基准 OmniVChat-Bench 与人类录制集
    OmniVChat-Bench 基于合成对话构建,从五个能力类别评估模型的基础对话水平;另有 OmniVChat-Bench-Human 收集真实设备录制对话,用于验证合成训练与评估的迁移性。

  3. 强化学习奖励设计 OmniVChat-RL
    奖励函数联合优化三个维度:回复正确性(语义匹配)、效率(信息密度与冗余控制)和风格(自然流畅度)。使用合成对话对 Qwen3-Omni-Instruct 进行强化学习微调,避免人工标注成本。

与同类方法的差异

相比依赖外部 ASR / 字幕的管道式视听对话系统,本工作直接合成原生音视频对话用于训练,并通过多维奖励联合优化,不引入级联误差,且验证了从合成到真实对话的迁移能力。

实验

实验设计

OmniVChat-Studio 多智能体引擎合成单轮 / 多轮音视频对话,用于构建 OmniVChat-Bench(五类基础对话能力)以及训练数据。

OmniVChat-RL 奖励设计联合优化回复正确性、效率与风格,在合成对话上训练 Qwen3-Omni-Instruct。

关键发现

  • 合成对话训练后,模型在 OmniVChat-Bench 与 OmniVChat-Bench-Human(人类录制)上均获得性能提升。
  • 验证了生成式合成数据用于训练与评估的可行性,解决真实音视频对话数据稀缺问题。
  • 奖励设计中的效率与风格目标对回复质量有正向影响。

与基线对比解读

基线为未经 OmniVChat-RL 的 Qwen3-Omni-Instruct。提升表明多智能体生成的数据可以迁移到真实对话,且奖励设计比单纯多任务或指令微调更贴合原生音视频对话需求。未公开具体数值,但实验结果支持合成数据 + RL 的路线。

行业影响

落地场景

原生音视频对话(OmniVChat) 可直接嵌入视频客服、远程协作、在线教育等产品。例如电商直播中,用户用摄像头展示商品瑕疵并口头提问,系统无需先转写语音或抽帧描述,直接返回文本解答,降低链路延迟并保留语气、表情等感知线索。另一场景是智能会议助手:会议参与者分享屏幕和语音讨论,助手实时理解音视频流并输出纪要或决策建议,减少人工记录。

商业价值

  • 降本:替代传统 ASR + OCR + 视觉模型级联,减少推理环节和计算开销,同时缩短响应时间。
  • 体验提升:多模态上下文融合更自然,适合口语化、碎片化交互,提升用户满意度。
  • 增收:在电商直播、在线教育等场景中,更快更准的自动问答可提升转化率和完课率。

与现有工作流集成

OmniVChat 模型可作为实时音视频流处理服务接入现有对话系统。通过 API 接收音频+视频流,输出文本,无需预先运行独立 ASR 或抽帧。工程上可采用 Qwen3-Omni-Instruct 等基础模型,使用 OmniVChat-RL 奖励设计微调,再结合 OmniVChat-Bench 做回归评估。适合部署在边缘或云端,与现有 RTC 网关、消息队列对接,替换原先的级联模块。

局限

  • **合成数据与真实场景的分布差距** 依然显著。OmniVChat-Studio 基于多智能体与视频生成技术构建对话数据,不可避免地受限于生成引擎的性能与多样性。真实设备录制的音视频常包含噪声、运动模糊、遮挡、多人混音、非标准光照等,合成数据难以全面覆盖,导致模型在 OmniVChat-Bench-Human 上的提升可能无法完全反映真实开放环境。此外,该数据引擎生成流程复杂、成本较高,限制了数据规模扩展到大规模预训练的可能性。
  • **评估体系尚不完整**。OmniVChat-Bench 覆盖五个能力类别,但主要评价回复的正确性、效率和风格,未纳入安全性、事实一致性、多语言、长程记忆等关键维度。RL 奖励中效率与风格的量化设计较为简化,难以刻画真实对话中的主观质量与上下文适配性。基准中人类录制子集规模较小,统计功效有限,且部分指标依赖自动评分模型,可能引入额外偏差。
  • **方法通用性未得到验证**。训练实验仅基于 Qwen3-Omni-Instruct 单个模型,未展示对其他全模态模型的适用性;RL 奖励中各项权重与超参数未进行系统消融,对模型架构的敏感性未知。另外,任务定义要求用户输入完全不含文字 query,而实际交互中用户常混合语音、视频与文字,该设定可能限制 OmniVChat 在更广泛场景下的直接部署。
论文Haolin He2026-09-18原文

相关内容