Motion-Omni: 用于口语对话的端到端联合语音与全身动作生成
Motion-Omni 提出一个端到端框架,让口语对话模型在生成语音的同时,原生输出显式面部表情以及手部、上半身和下半身动作。这些动作直接从产生语音的隐藏状态中生成,无需级联式二次推理。 现有方法通常将语音与动作分离:口语对话模型只生成语音而缺乏动作,而共语动作模型仅从音频产生动作。级联方案需要先生成完整语音,再运行动作模型,既增加延迟又阻碍联合优化。Motion-Omni 通过联合训练解决该问题:在冻结语音通路时动作与音频错位,只有同时优化 LLM、Speech Generator 和 Motion Generator,才能恢复对齐并保持对话能力。 监督信号来自可扩展的模型无关流水线,用可替换的动作教师为一致语音伪标注,得到 422,856 个质量排序的样本(1,402 小时)。此外发布 SwDA-500 数据集,以及首个面向随机开放式全身口语对话的公开评估协议,统一渲染、自动指标、人工评估和延迟测量。实例化为 Motion-Omni-Q7(基于 Qwen2.5-7B-Instruct),在参考无关动作指标上与同音频教师级联相差 2% 以内,响应速度提升 5.4 倍(RTF=0.78,快于实时),在节拍相关性和多样性上超越所有非教师级联,词错误率达 2.62%,为对比的全模态系统中最低。
论文精读
TL;DR Motion-Omni 通过共享隐状态与联合训练,端到端生成口语对话和全身共语动作,无需级联,推理快于实时且音画对齐。
问题
问题背景
数字人对话系统正从单一语音交互走向语音、面部表情、手势与全身动作 的协调生成,业界关注如何让虚拟人在自然对话中像真人一样边说话边做动作。
现有方法局限
主流方案采用级联架构:先由口语对话模型生成语音回复,再将音频输入独立的语音驱动动作模型。该路线存在明显技术缺陷:
- 两段式推理:需要额外一次完整的前向传播,增加延迟,难以满足实时对话需求。
- 无法联合优化:动作模型仅接收成品音频,看不到语言生成过程中的隐藏状态,导致动作与语义、韵律的错位。
- 训练信号割裂:语音和动作分别训练,缺乏端到端的对齐反馈,难以捕捉说话节奏与肢体节拍之间的关联。
技术挑战与重要性
端到端联合训练面临跨模态优化冲突:若冻结语音路径只训练动作,动作会与音频失同步;若同时调整大语言模型、语音生成器和动作生成器,则可能损害对话能力。论文通过渐进式课程训练、多目标损失平衡解决了这一难题,同时构建了可扩展的伪标注数据管线,产出42万+条质量排序样本。此外,现有评测缺少针对随机、开放式全身口语对话的统一协议,论文发布了首个公开评测方案,涵盖自动指标、人工评估和延迟测量。
行业类比
类似端到端自动驾驶取代分阶段感知-规划-控制管线,端到端口语动作生成可降低延迟并提升一致性,适合实时交互式数字人应用。
核心洞察
- 端到端联合生成语音与全身运动是解决口语对话中多模态对齐问题的关键设计。现有级联方案先产出语音再驱动运动模型,不仅引入二次推理延迟,而且语音与运动无法在同一优化目标下协同,导致节奏与语义对齐存在系统偏差。Motion-Omni 从 LLM 隐藏状态同时驱动语音生成器与运动生成器,共享表示使模型能够学习跨模态时序耦合,并在单次前向中完成响应,实现 RTF=0.78 的实时性能与接近级联的运动质量,同时推理速度提升 5.4 倍。
- 联合训练中冻结语音通路会导致运动与音频不对齐,表明跨模态模型必须共同适应而非简单拼装。通常为保持语音质量会冻结预训练语音模块,仅微调运动模块,但 Motion-Omni 实验显示这样会破坏运动与音频的同步。通过同时更新 LLM、语音生成器和运动生成器,模型在保留口语对话能力的同时恢复了运动对齐。这一发现揭示了语音-运动模态间的深层耦合依赖,为多模态生成系统的训练策略提供了重要参考:跨模态任务需要端到端协同优化,而非在固定主干上做浅层适配。
方法
输入、关键模块与输出流程
Motion-Omni 以对话上下文(文本或音频)为输入,核心 backbone 采用 Qwen2.5-7B-Instruct LLM。LLM 的隐藏状态同时驱动两条输出通路:Speech Generator 生成语音响应,Motion Generator 生成显式面部表情与手部、上半身、下半身运动。运动表示基于 VQ-VAE 将身体动作量化为离散 token,从而与 LLM 的 token 生成范式对齐。
训练策略与监督信号
采用 渐进式训练课程:先独立训练语音生成与运动生成能力,再联合训练 LLM、Speech Generator 和 Motion Generator,在语音质量与运动对齐双目标下协同适应。若冻结语音通路,运动会与音频错位,因此联合优化是恢复对齐的关键。监督数据来自可扩展的 伪标注流水线,使用可替换的运动教师模型对一致性语音响应打伪标签,得到 422,856 个质量排序样本(约 1,402 小时),并通过维度加权重建误差进行质量排序。
工程差异
相比传统级联方案(先生成完整语音,再对音频做二次推理),Motion-Omni 仅需一次前向传播即可同时输出语音与全身体运动,消除了二次推理延迟并支持语音-运动联合优化;在同类端到端语音-运动协同模型中,它显式覆盖面部、手、上下半身关节且发布了可复现的评估协议。
实验
实验设计
论文构建了 422,856 对语音-运动伪标签数据(1,402 小时),以 Qwen2.5-7B-Instruct 为骨干,采用渐进式课程联合训练 LLM、Speech Generator 和 Motion Generator。发布 SwDA-500 数据集及首个公开评估协议,统一渲染、自动指标、人工评估和延迟测量。
关键发现
Motion-Omni-Q7 在 reference-free motion metrics 上与同音频 teacher cascade 相差 2% 以内;RTF=0.78,比 cascade 快 5.4 倍,实现实时响应;WER 为 2.62%,在所有 omni-modal 系统中最低;在 beat correlation 和 diversity 上超过所有非 teacher cascade。联合训练至关重要:冻结 speech pathway 时 motion 与音频不对齐,只有 co-adapting 三个模块才能恢复对齐并保留对话能力。
对比解读
与 teacher cascade(两阶段推理)相比,Motion-Omni 通过共享隐藏状态端到端生成,省去第二次完整推理,显著降低延迟且性能损失极小。与非 teacher cascade 相比,在节奏相关性和多样性上优势明显,表明端到端联合优化能捕获更丰富的语义与韵律信息。整体证明 spoken dialogue model 可原生输出全身运动,为实时交互式 avatar 提供高效方案。
行业影响
落地场景
Motion-Omni 适合需要实时语音与全身动作同步的交互场景:虚拟客服、电商直播数字人、游戏 NPC、在线教育虚拟教师、医疗陪护虚拟人 等。其端到端架构避免了级联系统二次推理,RTF=0.78 低于实时阈值,可在消费级 GPU 上部署。
商业价值
- 降本:单模型替代 TTS + 动作生成两阶段,减少推理算力与延迟,降低每路并发成本;
- 体验提升:动作与语音联合训练提升节拍对齐与语义一致,用户沉浸感更强;
- 增收:低延迟支持实时互动,可扩展至直播带货、虚拟偶像等需高并发的 C 端业务。
与现有产品/工作流的接口
Motion-Omni 基于 Qwen2.5-7B-Instruct 扩展,可复用现有 LLM 对话系统 与 语音合成 组件;其 动作表示 采用可替换的 VQ-VAE 和 motion teacher,能对接不同角色骨骼或渲染管线。集成时需处理 多模态时序对齐 与 流式输出,可将模型封装为低延迟推理服务,替换现有 cascade 模块。
具体落地 use case
- 电商直播虚拟主播:实时回答商品咨询并生成自然手势和表情,降低真人主播成本。
- 在线教育虚拟教师:讲解过程中同步生成肢体动作,提升学生注意力与理解度。
局限
- **依赖伪标签 teacher 质量**:Motion-Omni 的监督信号来自可替换 motion teacher 生成的 pseudo-labels,因此模型性能上限受 teacher 约束。若 teacher 在特定语义-动作对齐或风格多样性上存在盲区,Motion-Omni 难以超越;文中仅验证了与同一 teacher cascade 的接近程度(2% 以内),换用其他 teacher 或跨数据集时的泛化性缺少系统实验,可能造成静默退化。
- **联合训练成本与复杂度高**:冻结 speech pathway 时 motion 与 audio 严重错位,必须同时 co-adapt LLM、Speech Generator 和 Motion Generator,带来较大显存/计算开销和训练不稳定性,需依赖 progressive curriculum 与多任务损失平衡等技巧;实际部署时还需维护三模块同步更新,工程复杂度显著高于 cascade,可能限制中小团队复现与迭代速度。
- **评估协议仍不充分**:虽然发布了 SwDA-500 和统一评测流程,但自动指标(如 FGD、beat correlation)与人类感知的一致性未充分校准,文中 Video LLM-as-Judge 的负结果也说明视频语义评判不可信赖;human eval 的标注者数量和评分细则可能不足以覆盖开放域对话中的细粒度动作质量,且缺少跨语言、跨风格及不同 avatar 渲染条件下的鲁棒性报告。