论文

释放全双工语音模型中 LLM 的能力

释放全双工语音模型中 LLM 的能力

当前语音大语言模型(LLMs)通常局限于生成口语回复,这限制了用户界面的输出形式为可语音化的内容,并抑制了代码生成、结构化分析和多步推理等文本原生能力,尤其是在需要持久、结构化且可检验的中间输出的实时交互中。现有工作虽然改进了口语推理或全双工轮流对话,但仍将文本视为隐藏的中间状态或次要模态,而非第一类输出通道。 我们提出 Listen-Write-Speak (LWS),一种文本优先的三通道范式。在该范式中,单个自回归 LLM 持续监听用户音频,同时 写 出可见的自由文本作为主要输出,并 说 出实时的口语响应——三者共享同一因果注意力上下文。该行为完全通过 Token Schema 实现,无需修改模型架构,并经由两阶段数据流水线学习,该流水线合成与输入时间线一致的每秒认知注释。 实验表明,LWS 在 Full-Duplex-Bench 上展现出强大的全双工交互能力,在 VoiceBench AlpacaEval 上达到 4.72 分,写作-口语一致性达 92.6%,并在 URO-Bench 上持续优于其内部消融模型。这些结果证明,可见写作可作为语音交互的第一类输出通道,且不牺牲实时响应性。

论文精读

TL;DR LWS 范式让语音 LLM 在实时对话中同步输出可见文本与语音,解锁代码生成、结构化推理等文本原生能力,且无需修改模型架构,多项基准测试表现领先。

问题

语音交互系统正从纯语音回复向全双工、多模态演进,但现有的语音大语言模型 (SpeechLLM) 依然将文本视为内部隐藏状态——模型可以“思考”出文字,却只能以音频形式输出最终结果。这直接抑制了代码生成、结构化数据分析、长链推理等文本原生能力在实时对话中的发挥。

现有方案的局限在于:

  • 全双工模型(如 Freeze-Omni 等)虽然能实现边听边说的实时交互,但输出通道仍被限制为音频,无法向用户暴露可检查的中间结果。
  • 推理增强型语音 LLM(如 ReMamba、SR-Tiny)在模型内部进行文本推理,但文本仅作为隐藏的“思维链”使用,用户无法观测、编辑或复用,导致可解释性和交互控制力不足。
  • 即使部分工作尝试生成文本,也仅将其作为从属模态——例如先静默写出全文再朗读——破坏了全双工的时间线连贯性,难以在瞬时反馈需求高的场景(如实时指令编写、紧急故障排查)中使用。

这一问题的技术挑战在于:单模型如何在共享因果注意力上下文中,同时完成三个异步任务——连续收听、实时书写可见文本、并行生成口语回应——且不引入任何架构改动。时序对齐、多通道一致性、以及文本内容的“可见性”要求(如每产生一个词就要即时渲染)对训练数据和 token schema 设计提出了极高要求。业界之所以高度关注,是因为未来智能助手必须能像人类同事一样:边听你说需求边在屏幕上打出分析思路,同时用语音保持交流,而不仅是一个只能“回答”的对话机器人。

一个贴切的类比是:实时协作编程助手 ——你需要它在你口述需求的同时,立刻在 IDE 中写出结构化代码,并用语音解释实现逻辑,而不能先思考完整方案再一次性朗读。

核心洞察

  • LWS 将可见自由格式文本提升为与语音并行的第一优先级输出通道,使全双工语音模型直接获得代码生成、结构化分析等文本原生能力,无需在语音与隐藏文本间额外转换。与仅将文本视作内部推理中间态或字幕的工作不同,LWS 在共享因果注意力下同时生成可检视的文本与语音,首次将写-说一致性推至 92.6%,在 VoiceBench AlpacaEval 达到 4.72,证明文本输出不仅可行且能支撑复杂交互。
  • 通过精心设计的 **Token Schema**(听单元-写单元-说单元),LWS 无需任何架构修改,仅在单一自回归 LLM 上实现三通道实时协同。这完全规避了分离式编解码器或多模块路由器带来的工程复杂度与推理延迟。两阶段数据管线—离线认知合成与在线时间轴构造—自动生成每秒级因果标注,使模型学会在听的同时规划写与说的时机,训练完全基于 token 操纵,为语音交互的快速工程化落地提供了简洁范本。

方法

输入与 token 化

用户连续语音首先经语音编码器转换为离散音频 token,作为模型的主输入。与对话上下文一起被组织成时间对齐的 token 序列,其中穿插特殊控制 token 以标记 聆听阶段说话阶段 的边界。

核心范式:Token Schema 驱动的三通道

Listen-Write-Speak (LWS) 将一个标准自回归 LLM 扩展为同时处理三个通道,完全依靠Token Schema实现,无需任何架构改动。Schema 将每个时间步划分为两种基本单元:

  • Listening Unit:模型仅接收音频 token,不产出任何输出,等效于将音频上下文写入内部状态。
  • Speaking Unit:模型同时生成两种输出 token——文本 token(主输出,对用户可见)和语音 token(并行合成口语),两者共享同一个因果注意力上下文。文本输出是自由形式的可见文字,可以是推理过程、结构化分析或代码;语音输出则实时朗读精简后的回复。两部分通过共享注意力实现跨模态一致性(writing–speaking consistency)。

之所以显式分离聆听与说话阶段,是因为两者的条件分布差异显著:聆听时分布仅依赖历史音频,说话时分布依赖音频+已生成文本。这种分离降低了条件熵,并保证了全双工下的因果一致性(详见原文附录 C)。

推理流程

在推理时,模型以流式方式运行:

  1. 持续接收音频 token,累积在聆听单元中。
  2. 当模型预测到说话时机(例如因历史模式或特殊 token),自动切换至说话单元。
  3. 说话单元内,自回归地生成文本 token(写入屏幕)和语音 token(送入语音合成器),直到预测出终止 token,再切回聆听状态。整个过程保持全双工,即边听边说。

数据构造:两阶段合成管道

训练数据通过两阶段管道合成以模拟真实的持续交互:

  • Stage 1:离线认知合成:利用 LLM 生成对话的“思维轨迹”,并为每句话估计语速,合成带有合理时间戳的音频。
  • Stage 2:在线时间线构建:将文本与音频按秒对齐,分配聆听/说话单元,生成每步的认知标注(cognitive annotations)。这一过程保证了训练数据中的 token 序列与真实的输入时间线匹配,使模型学会根据音频进展适时切换状态。

关键设计差异

与现有工作相比,LWS 将可见文本提升为一等输出通道,而非隐藏的推理中间态或语音的附属品。这使得 LLM 的文本原生能力(如代码生成、结构化推理)可以直接暴露给用户,同时不牺牲实时语音交互的响应性,这是以往 purely spoken 模型所无法做到的。

实验

实验设计

LWS 范式在三个维度的基准上接受检验:Full-Duplex-Bench 评估全双工交互质量,VoiceBench(基于 AlpacaEval 协议)衡量回复品质,URO-Bench 专门考察文本-语音双通道的推理与一致性。实验采用单一 自回归 LLM 基座,通过两阶段数据管线合成带逐秒认知标注的训练样本,无需任何架构修改。核心对比对象为 LWS 的内部消融变体,包括仅保留部分通道或更改时序关系的配置,以分离各设计要素的贡献。

关键发现

  1. 全双工交互能力:在 Full-Duplex-Bench 上,LWS 展现出流畅的实时双向互动,用户在说话时可立即获得文本反馈,同时语音通道异步生成口语回复。
  2. 回复品质:VoiceBench AlpacaEval 得分达到 4.72,证明以文本为主输出并未损害响应质量,反因其可结构化、可回溯的特性提升了复杂任务表现。
  3. 通道一致性:写作内容与口语内容的一致率高达 92.6%,说明共享因果注意力上下文能有效对齐双通道语义。
  4. 推理优势:在 URO-Bench 上,LWS 始终优于所有内部消融,尤其在需要中间推理步骤的任务中,可见的写作通道让逻辑链条更清晰,减少了口语式思维链的模糊性。

与基线对比深度解读

论文未引入外部全双工模型基线,而是通过细致的消融实验验证 Token Schema 设计的必要性。分离听取与话语阶段、将文本作为一等输出、保持因果注意力一致性,这三个要素各自带来增益,叠加后效果最优。这也解释了为何现有工作(将文本视为隐藏态或附属输出)难以同时达成强推理与低延迟:隐藏文本无法被用户实时检查,而附属文本缺乏因果约束会导致言行不一。LWS 的 text-first 范式 重新分配了模态角色,让语音回归口语交流本质,文本承担结构化认知功能,为实时交互系统提供了一种可落地的设计范式。

行业影响

落地场景

LWS 范式直接面向所有需要实时语音交互 + 可见文本输出的产品:

  • 实时编程助手:用户口述需求,系统同步展示生成代码、逻辑推导,并用语音解释,实现“边说边写”的结对编程体验。
  • 多模态客服与工单系统:用户语音描述问题,客服界面实时显示结构化摘要、操作指引,同时用语音安抚用户,提升一次解决率。
  • 在线教育/会议纪要:教师或主持人发言时,系统同时弹出板书/字幕与口头补充,学员可随时回溯文本,降低听觉记忆负担。

商业价值

  • 降本Token Schema 无需改变模型架构,可通过现有自回归推理管线快速部署,降低工程适配成本;全双工交互减少对话轮次,节约用户时间和系统计算开销。
  • 增收:文本可见性增强了用户对 AI 输出的信任,尤其适用于金融分析、医疗建议等需追溯的领域,可支撑更高溢价的专业付费服务。
  • 体验提升:92.6% 的写作-语音一致性意味着用户“听到的”与“看到的”高度吻合,减少误解;Full-Duplex-BenchVoiceBench 指标表明实时响应不牺牲质量,可在竞争中获得差异化优势。

与现有产品/工作流的接口

  • 即插即用:通过定义 Listening UnitSpeaking Unit 的 token 编排,LWS 本质是推理流程的扩展,可整合进 vLLM、TensorRT-LLM 等主流推理引擎,将现有语音 LLM 快速升级为三通道模型。
  • 数据管线兼容:两阶段数据合成方法(离线认知标注 + 在线时间线构建)可利用现有 ASR/语音对话数据集,无需额外人工标注,可与现有数据预处理流水线融合。

具体落地 Use Case

  1. 智能座舱多屏交互:驾驶员语音查询导航,中控屏同步显示路线文字详情与备选方案,同时语音播报关键点,确保驾驶安全的同时提供可回溯信息。
  2. 直播电商辅助:主播口播介绍商品,直播间实时弹出结构化产品卖点、优惠说明(文字),并用语音补充促销话术,提升转化率并降低主播口误影响。

局限

  • **数据合成对启发式规则的依赖**:LWS 的训练数据通过两阶段合成 pipeline 生成,包括语音速率估计、因果约束提示和全局时间线构造,这些过程依赖预定义的规则和启发式。虽然合成数据能有效模拟理想行为,但可能与真实用户交互中的噪声、停顿、打断等动态存在分布差异,影响模型在开放场景下的鲁棒性。论文未在真实人机对话数据上微调,因此其对域外情况的泛化能力有待验证。
  • **单一基础模型与规模限制**:实验仅基于一个特定大小的自回归 LLM 进行训练和评估,未展示方法在不同模型规模或架构(如不同参数量、非因果注意力)上的可迁移性。对于更大模型,写与说的并行输出可能增加显存和延迟,实时性保障可能需要额外工程优化。此外,仅在英文语音数据集上验证,多语言、多口音场景的适应性未知。
  • **写-说一致性的深层问题**:虽然报告了 92.6% 的写-说一致性,但剩余的 7.4% 不一致可能包含关键语义偏差(例如生成的结构化步骤与口语回复矛盾)。这种不一致在复杂推理任务中可能导致用户困惑,而当前方法仅依靠端到端训练对齐,缺乏显式的纠错或校验机制。当写作为主要输出通道时,文本中的错误比纯语音模式更显眼,对可靠性的要求更高。
论文Luoyuan Zhang2026-05-04原文

相关内容