哈工大团队斩获 ACL 2026 杰出论文奖,原生全双工语音大模型 Lychee-FD 发布
哈工大团队揭示了原生全双工语音模型难以兼顾智能与流畅的根本原因,并提出层次化解耦架构实现了类人交互能力。
全双工语音对话允许双方随时打断、同步倾听与回应,但模型内部语音生成与语义推理存在梯度冲突,导致“降智”。Lychee-FD 通过层次化解耦架构分离声学与语义深层参数,在保持低延迟的同时兼顾了语义理解与交互自然度,相关研究获 ACL 2026 杰出论文奖。
正文摘录
.jpg)  导读 全双工语音对话是人类最自然的交流方式,是语音对话研究的梦想。相比文本输入,语音天然更接近人的交流方式,但现有语音对话常常停留在 “一问一答、听完再说” 的轮次式交互范式。 近期,OpenAI 发布的 GPT-Live 又一次将实时语音交互推至聚光灯下,也进一步印证了一个趋势:语音交互正在从轮次式问答,走向连续、双向、实时的自然交流。 但要真正实现这一目标,真正的难点,不只是让系统 “看起来可以被打断”,而是让持续倾听、语义理解、语音生成和节奏控制成为模型内部原生具备的能力。如何 在保持语义理解能力与推理效率的同时,实现响应迅速、回答准确、对话自然的原生全双工语音交互 ,正是语音大模型走向类人交互的核心挑战。 近日,哈工大深圳计算与智能研究院立知( Lychee )大模型团队,在 2023 年研发的「立知」全模态理解和生成大模型(工信部和网信办双认证,Lychee: Uni-MoE-1.0-Omni 和 Lychee: Uni-MoE-2.0-Omni)基础上,迭代研发具有全双工语音对话功能的新一代大模型 Lychee: Uni-MoE-2.5-Omni。