行业新闻

港中文等提出 OmniVChat:以合成数据训练原生音视频对话

港中文等提出 OmniVChat:用合成数据造出带评分标准的音视频对话,让评测与训练奖励共用一套标准。

现有音视频模型大多只做「看着视频回答问题」,而 OmniVChat 定义的原生音视频对话是直接同时接收音频和视频,不经语音转文字等中间环节,从而保留语气、停顿、表情和镜头朝向。团队用多智能体管线合成单轮与多轮对话数据,并让同一套评分标准既用于评测,也作为强化学习的奖励。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/15c4f82a-7656-4228-8895-85d20b2579ae/Screenshot2026-09-28at14(2).34.35.png) ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqElqZ0GcgINP4V78xIEARSSDI7pRpUQpZAhGK6rr8zoMJM3icYLohdHNhq93gll1YkHwsYaOO3tolCuL5QN5gAtJc46PnNgECQI/640?wxfmt=png&from=appmsgimgIndex=0) 一、什么是 OmniVChat?从音视频问答到原生音视频对话 在现有的音视频交互研究里,对 “交互” 的定义其实往往是针对音视频内容的问答:给定一段流式视频,用户输入一个文本问题,模型再挑合适的时机作答。这种交互方式与日常用户和 AI 的交互范式(比如给 AI 打视频电话)差别很大。 ![图片](https://mmbiz.qpic.cn/mmbizjpg/5L8bhP5dIqHldRWYH3FuneuEzlNUw37ticvTSVicIbAaLRAqhTmnicc6hvdicOBVxpgyBk6w5b1hlWdL8m6wc418GGIx9L47GWGb4AQHP1Yicg9w/640?wxfmt=jpeg&from=appmsgimgIndex=1) 在这篇文章中,我们把 OmniVChat(Omni Video Chat)定义为原生的音视频对话:模型直接、同时接收用户的音频和视频,不需要额外的文本问题、外部字幕或语音识别转写,从而保留语气、停顿、表情和镜头朝向等线索。举个例子,用户举着手机,一边拍一边问:“我左边会议室的门开着吗?

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-09-28原文

相关内容