Ex-Omni-2D:具有原生视觉呈现的表达性全模态对话模型
全模态对话模型能够理解多模态输入并合成语音回复,但它们的回复在视觉上是无形的。我们提出 Ex-Omni-2D,一个全模态对话框架,它生成由文本、个性化语音和参考条件视频组成的协调响应。给定多模态查询、参考图像和参考音频,该模型预测一个结构化的 视觉思维计划 (VTP),描述场景、情感和运动,随后生成响应文本和原生多码本语音单元。 这些语音单元形成一个共享的声学-时间接口:它们被解码为语音,并与视频帧在线对齐。该接口使得响应和虚拟形象路径能够从异构的语音、对话和虚拟形象视频数据中学习,避免了大规模查询-文本-语音-视频监督的需要。一个全序列 视频生成器 作为主要教师模型。 为了高效的增量生成,我们进一步将其蒸馏为一个少步块因果 流式学生 (Streaming Student),其 前缀流 (Prefix Streaming) 机制在连续块之间携带干净的潜变量,以减少累积的后期块退化。通过四步推理,完整的四 GPU 流水线在 400×720/720×400 分辨率下实现了端到端 RTF 为 1.293,提供了一个实用的质量-效率平衡点。
论文精读
TL;DR Ex-Omni-2D 让对话模型输出文本、个性化语音和参考视频,以 Visual Thought Plan 和多码本语音单元统一声学-时间接口,蒸馏流式学生后四步推理达 RTF 1.293。
问题
问题背景
当前多模态对话系统正从纯文本或纯语音交互走向全模态表达,即同时生成文本、语音和视觉呈现。研究者关注如何在真实对话中让模型具备“数字人”般的自然响应能力。
现有方法局限
现有omni-modal dialogue model 通常只输出文本和语音,缺乏同步的视觉表达;少数引入视频生成的工作要么依赖大规模成对的查询-文本-语音-视频监督数据,难以扩展,要么将语音和视频分开生成,导致口型、节奏、情绪不一致。具体而言:
- 语音与视觉轨迹错位,响应缺乏连贯的肢体语言和表情;
- 视频生成往往需要数十步迭代,端到端推理延迟过高,无法满足实时对话;
- 训练数据稀缺,难以覆盖多样化的对话场景与个性化声音。
为什么这个问题难/重要
技术挑战在于:语音单元、文本、视频帧 三者的时序对齐需要统一的声学-时间接口;同时生成个性化语音并驱动参考条件下的视频,要求模型理解场景、情绪和动作意图,而不仅仅是信号级合成。业界关注度持续上升,因为数字人交互、虚拟主播、AI 助手等产品需要低延迟、高表现力的实时响应。若无法在质量与效率之间取得平衡,落地应用就会受阻。
行业类比
类比 自动驾驶中多传感器融合 的挑战:单独处理文本、语音、视频就像分别处理摄像头、激光雷达、雷达信号,只有通过统一的时序接口和轻量化推理,才能实现实时、鲁棒的整体决策。
核心洞察
- Ex-Omni-2D 将多码本语音单元作为共享声学-时间接口,直接驱动语音合成和视频帧的在线对齐。与常见做法——先独立生成语音和视频再事后同步——不同,这一设计让语音单元携带时序信息,使视频生成不再依赖显式时间戳或大规模文本-语音-视频三元组监督,大幅降低了多模态对齐的工程复杂度。
- 通过全序列视频生成器作为教师,蒸馏出少步块因果流式学生模型,并采用 Prefix Streaming 机制在连续块间传递干净隐变量,有效抑制了长序列生成的累积误差。相较于直接训练自回归视频生成或分块独立推理,该方案在保持生成质量的同时将推理步数压缩至 4 步,四 GPU 流水线 RTF 达到 1.293,为实时全模态对话提供了实用的效率-质量平衡点。
方法
输入与整体流程
Ex-Omni-2D 接收三类输入:多模态查询(文本/图像/音频)、参考图像、参考音频。系统先预测 Visual Thought Plan (VTP),结构化描述场景、情感与运动;随后生成响应文本和原生多码本语音单元。这些语音单元充当共享声学-时间接口,一方面解码为个性化语音,另一方面与视频帧在线对齐。
关键模块:Teacher-Student 视频生成
视频生成采用全序列 Video Generator 作为 Teacher,直接生成参考条件视频。为满足流式推理需求,将其蒸馏为少步 block-causal Streaming Student。Student 的关键设计是 Prefix Streaming:跨连续块传递一个干净的潜变量,避免误差累积导致后期块质量下降。这样只需四步推理,即可实现块级因果生成。
训练与数据策略
共享语音接口允许响应与化身两条路径分别从异构数据学习:对话数据训文本/语音,化身视频数据训视频生成,无需大规模成对的 query-text-speech-video 监督。输出端最终合成协调的文本、个性化语音与视频。RTF 1.293(400×720/720×400 四 GPU)验证了工程可行性。
与同类方法的差异点:通过显式 VTP 和共享多码本语音接口解耦语义规划、语音合成与视频生成,避免了端到端对稀缺四元组数据的依赖,并以蒸馏流式学生兼顾实时性。
实验
实验设计
Ex-Omni-2D 采用 full-sequence Video Generator 作为 Teacher,蒸馏出 block-causal Streaming Student,通过 Prefix Streaming 机制在连续 chunk 间传递干净 latent,减少累积误差。推理采用 4 步生成,四 GPU 并行,目标分辨率 400×720 和 720×400。数据训练来自异构的语音、对话和虚拟人视频,无需大规模 query-text-speech-video 配对监督。评估端到端实时因子 RTF。
关键发现
在 400×720/720×400 分辨率下,端到端 RTF 达到 1.293,意味着生成速度略低于实时(RTF<1 为快于实时,1.293 略高于实时)。四步蒸馏显著降低推理步数,同时保持视觉-语音协调性。Visual Thought Plan (VTP) 结构化规划场景、情感、动作,与 multi-codebook speech units 实现声学-时间对齐,使得响应文本、个性化语音和参考视频在线同步。
基线对比深度解读
论文未提供与外部基线的定量比较,但内部蒸馏对比强调 full-sequence Teacher 作为质量上限,Streaming Student 在极少步数下逼近。Prefix Streaming 解决长序列分块推理中的晚期 chunk 退化问题,是区别于常规自回归视频生成的关键。对工程实践的启示:该管线在多卡上达到实用 RTF,适合部署面向实时交互的 omni-modal avatar;但需关注多模态训练数据异构性带来的对齐难度,以及蒸馏过程中 teacher-student 分布差异。
行业影响
落地场景
- 虚拟客服与数字人直播:电商、内容平台可直接部署,接收用户多模态查询(图文/语音),实时生成带参考形象的讲解视频与个性化语音,替代真人重复性应答。
- 在线教育:基于教师参考照片与音频,自动生成虚拟讲师答疑视频,支持个性化辅导与课程自动生成。
- AI 陪伴与社交:用户上传角色图片与声音,生成可对话的动画形象,提升沉浸感。
商业价值
- 降本:减少真人拍摄、动画制作与后期同步成本,视频生成全自动化,边际成本大幅下降。
- 增收:7×24 小时实时互动能力提高用户停留时长与转化率,尤其适用于直播带货和在线客服。
- 体验提升:语音-口型同步自然,个性化声音与形象一致性增强信任感,RTF 1.293 接近实时,满足交互延迟要求。
与现有产品/工作流的接口
- 模型可封装为 多模态对话 API,接入现有对话系统(如 Rasa、Dialogflow、LLM Agent),输入多模态查询与参考素材,输出文本、语音单元与视频帧序列。
- 生成的
multi-codebook speech units可与主流 TTS 后端(如 ESPnet、VITS)对接,视频部分可直接渲染到数字人 SDK(如 NVIDIA ACE、Azure Speech)。 - 部署需 4 GPU,推理成本较高,适合云端 GPU 集群或边缘高配设备,可通过模型量化或进一步蒸馏降低资源占用。
具体落地 Use Case
- 电商直播带货:输入商品图片 + 主播参考图/音频,模型实时生成主播讲解视频与语音回答用户问题,用于晚间无人值守时段或高峰分流。
- 在线教育答疑:学生上传题目截图,系统自动生成教师虚拟形象讲解视频,使用教师本人参考音频和照片,提供个性化辅导体验,无需真人录制。
局限
- Ex-Omni-2D 在推理时需要用户提供参考图像和参考音频来驱动生成,这带来个性化能力,但也限制了其通用性。模型只能复现参考中的人物外观和声音特征,无法生成参考集之外的虚拟形象;若参考图像分辨率低或姿态极端,生成质量下降。此外,相比一些不依赖参考的条件生成模型或可控制属性的系统,其在多人对话、角色切换等场景下灵活性不足。对于需要快速适配新形象的部署环境,需要额外采集参考数据或重新微调,增加了落地成本。
- 多码本语音单元作为共享声学-时间接口,实现了语音和视频的在线对齐,但离散化编码可能损失韵律、情感强度和说话风格等声学细节,导致合成语音的自然度低于专用 TTS 模型。同时,流式对齐依赖逐块预测,长序列中早期误差可能传播,引发唇同步漂移。与直接使用连续语音特征的方法相比,该设计在保真度上存在固有折衷,论文未充分展示在不同语言、口音或情绪下的鲁棒性评估。
- 为了将延迟降低到实用水平,作者将全序列教师蒸馏为四步块因果流式学生,但少步推理可能削弱视频帧的细节保真度和运动平滑度,尤其在快速动作或复杂背景下。虽然 Prefix Streaming 缓解了后期块退化,但累积误差仍可能存在。端到端 RTF 1.293 是在四 GPU 条件下测得,单卡或边缘设备难以达到实时,限制了大规模部署。与纯语音或文本对话模型相比,额外视频生成带来的算力开销仍然显著,对产品化成本构成挑战。