港中文等提出 OmniVChat:以合成数据训练原生音视频对话
港中文等提出 OmniVChat:用合成数据造出带评分标准的音视频对话,让评测与训练奖励共用一套标准。
现有音视频模型大多只做「看着视频回答问题」,而 OmniVChat 定义的原生音视频对话是直接同时接收音频和视频,不经语音转文字等中间环节,从而保留语气、停顿、表情和镜头朝向。团队用多智能体管线合成单轮与多轮对话数据,并让同一套评分标准既用于评测,也作为强化学习的奖励。
正文摘录
.34.35.png)  一、什么是 OmniVChat?从音视频问答到原生音视频对话 在现有的音视频交互研究里,对 “交互” 的定义其实往往是针对音视频内容的问答:给定一段流式视频,用户输入一个文本问题,模型再挑合适的时机作答。这种交互方式与日常用户和 AI 的交互范式(比如给 AI 打视频电话)差别很大。  在这篇文章中,我们把 OmniVChat(Omni Video Chat)定义为原生的音视频对话:模型直接、同时接收用户的音频和视频,不需要额外的文本问题、外部字幕或语音识别转写,从而保留语气、停顿、表情和镜头朝向等线索。举个例子,用户举着手机,一边拍一边问:“我左边会议室的门开着吗?