论文

X-AuT:面向 Speech LLMs 的渐进式音频编码器压缩与跨尺度蒸馏

X-AuT:面向 Speech LLMs 的渐进式音频编码器压缩与跨尺度蒸馏

降低音频编码器深度可以降低语音大语言模型的推理成本,但直接移除完整 block 会扰动 decoder 所消费的 embedding,并可能引发删除与过早的序列结束错误。 我们提出 X-AuT,一个渐进式框架:通过短时行为探针(behavioral probes)选择层组合,并借助表示对齐、跨尺度蒸馏、按计划的 student-policy 监督以及 LoRA 微调来恢复剪枝后的模型。语言模型主干保持冻结,仅 attention LoRA adapters 与 tied output embedding 在蒸馏过程中适配。训练使用 transcript-consistency 流水线中一致度最高的层级数据,并在微调阶段进行来源重加权。 在十个公开的中英双语基准上,将 Qwen3-ASR-0.6B 的音频编码器从 18 层压缩到 16 层,宏平均错误率由 5.61% 降至 5.27%;14 层模型达到 5.75%,音频塔参数减少 20.7%。在相同配方下,1.7B teacher 的平均错误率为 5.55%,而自蒸馏为 8.45%;渐进式 18→14 剪枝优于直接剪枝(5.75% vs. 6.73%)。 这些单次运行结果确立了两种可实际落地的工作点,并表明精度影响在不同基准之间存在差异。项目网站:https://xpeng-ai.github.io/x-aut

论文精读

TL;DR X-AuT 用行为探针渐进剪枝语音 LLM 的音频编码器层,配合跨尺度蒸馏与 LoRA 微调恢复精度,将 Qwen3-ASR-0.6B 压缩至 14 层、减少 20.7% 音频塔参数,错误率仅 5.75%。

问题

问题背景

Speech LLMs 的典型架构由音频编码器(audio encoder)与语言模型解码器(LLM decoder)级联组成,推理成本集中在编码器前向与解码器逐 token 生成。行业正积极探索压缩音频塔(audio tower)深度来降低延迟与内存占用。

现有方法局限

现有层剪枝或深度压缩通常直接移除完整 Transformer blocks,导致编码器输出 embedding 发生剧烈分布偏移,使解码器产生 删除错误 与 提前结束 (premature EOS)。同时,缺乏 行为驱动的层选择:静态指标(如 L2 范数或注意力熵)无法反映剪枝后对下游解码器的影响。单纯的知识蒸馏(self-distillation)仅用原模型作为教师,无法弥补容量损失,且训练数据质量参差不齐会放大错误。

为什么这个问题难/重要

音频编码器的隐层表征与文本 token 空间之间存在跨模态 gap,深度减少后需要同时保持语音识别精度与生成稳定性。恢复训练若冻结全部骨干则表达能力不足,全量微调又可能灾难性遗忘或成本过高。业界对 低资源部署 Speech LLM 的需求迫切,需要在有限算力下找到精度与效率的帕累托最优,且要求方法可复现、无需额外标注数据。

行业类比

类似在端侧多模态 LLM 中压缩视觉编码器,需保持视觉-语言对齐同时降低图像 token 数量与 FLOPs,X-AuT 的渐进式剪枝 + 跨尺度蒸馏思路可迁移至该场景。

核心洞察

  • 通过短行为探针筛选剪枝层组合,而非简单剪除整块,能有效缓解语音 LLM 中解码器嵌入扰动导致的删除和提前终止错误。该方法先探测不同层组合在关键解码行为(如 EOS 生成、词删除率)上的表现,选择对下游解码影响最小的剪枝路径,再进入恢复训练。与直接按深度或宽度均匀剪枝相比,差异在于将行为指标前置到剪枝决策阶段,避免陷入精确率可观但生成行为恶化的局部最优。
  • 跨尺度蒸馏配合冻结 LLM 主干与注意力 LoRA 适配器,能在压缩音频塔的同时保留多语言 ASR 能力。与完全微调或仅进行自蒸馏不同,该方法用高一致性转录筛选后的数据做表示对齐,并在蒸馏阶段引入计划式学生策略上下文和源加权,使压缩后学生模型从较大教师模型中获取跨尺度监督。这为工程上在不增加解码器推理成本的前提下获得多个可部署的音频编码器规模提供了可复现路线。

方法

输入:语音波形与对应文本 token 序列。

关键模块:

  • 行为探测 通过短探测任务评估不同音频编码器层组合对解码行为的影响,确定安全剪枝顺序。
  • 渐进剪枝 从 18 层逐步剪至 16 层或 14 层,避免一次性移除整个块导致的嵌入扰动与删除/提前终止错误。
  • 三阶段恢复:
    1. 表示对齐:将剪枝后模型的中间表征与教师模型对齐,减少分布偏移。
    2. 跨尺度蒸馏:采用 scheduled student-policy supervision,学生自生成上下文逐步替代教师上下文;语言模型骨干保持冻结,仅更新注意力 LoRA 适配器与绑定输出嵌入。
    3. LoRA 微调:使用 transcript-consistency 流水线筛选的最高一致性数据子集,并进行源重加权。

输出:压缩后的语音 LLM,音频编码器层数减少,推理成本降低,宏平均错误率保持或改善(如 18→16 层从 5.61% 降至 5.27%)。

与同类方法差异:X-AuT 通过行为驱动的渐进剪枝结合跨尺度蒸馏与冻结骨干 LoRA 适配,显著优于直接剪枝(5.75% vs 6.73%)与自蒸馏(5.55% vs 8.45%),更有效抑制删除与提前终止错误。

实验

实验设计

本文在 Qwen3-ASR-0.6B 上验证音频编码器深度压缩。学生模型音频塔从 18 层逐步减至 16 层与 14 层,语言模型主干冻结,仅训练 attention LoRA 适配器与输出嵌入。训练数据经 transcript-consistency 管道筛选高一致性样本,微调阶段引入 source reweighting。评估覆盖十个公开中英 ASR 基准,报告 macro-average error。基线包括原始 18 层模型、self-distillation 与 direct pruning。

关键发现

18→16 层压缩 将 macro-average error 从 5.61% 降至 5.27%,在降低音频塔推理成本的同时实现精度提升。14 层模型 以 20.7% 的音频塔参数减少达到 5.75% error,提供第二个轻量操作点。使用 1.7B 教师 进行 cross-scale distillation 得到 5.55% mean error,显著优于 self-distillation 的 8.45%。渐进式 18→14 剪枝 达到 5.75%,优于 direct pruning 的 6.73%。行为探针选择层组合对保持 embedding 一致性起到关键作用。

基线对比解读

直接移除完整 block 会扰动 decoder 输入导致 deletion 与 premature EOS。渐进式剪枝通过 short behavioral probes 选择最优层组合,配合 representation alignment 与 scheduled student-policy supervision,比 direct pruning 降低近 1 个百分点 error。Self-distillation 效果不佳说明仅凭学生自身监督难以恢复跨层表示;跨尺度教师提供互补的信息,使 16 层学生甚至超过原始 18 层 baseline,验证了蒸馏与适配器的增益。

行业影响

落地场景

X-AuT 面向 Speech LLM 的音频编码器压缩,可直接应用于语音交互产品:智能客服、车载语音助手、实时会议转录、内容平台自动字幕等。尤其适合边缘设备或高并发云端服务,需降低音频编码器推理成本、缩短首字延迟的场景。

商业价值

通过渐进式剪枝音频编码器层数(如 18→16 层),减少参数量与 FLOPs,直接降低单次推理的 GPU/CPU 成本 与 延迟。论文中 14 层模型 WER 5.75% vs 原始 5.61%,但音频塔参数减少 20.7%,在可接受精度损失下大幅降低硬件门槛,对大规模语音服务可显著降低 TCO,同时提升交互响应速度。

与现有工作流接口

X-AuT 作为模型压缩流水线的一环,可无缝嵌入现有 蒸馏、LoRA 微调 工具链。其行为探针仅需短时推理即可选择层组合,不依赖全量训练;冻结 LLM backbone,仅训练音频塔与适配器,便于在已有 ASR 或 Speech LLM 服务上快速迭代部署。

具体落地 Use Case

  • 智能客服机器人:电商、金融客服场景中,语音识别要求低延迟与高并发。压缩后的 Speech LLM 可在低端 GPU 甚至 CPU 上运行,支持实时对话,同时保持可接受准确率。
  • 内容平台自动字幕:视频平台对海量音频流进行转录,使用 X-AuT 压缩模型可降低每千次转录成本,缩短批处理时间,并支持多语言(中英文)内容。

局限

  • 论文主要在中文-英语语音识别基准上验证,未涵盖语音翻译、语音问答等更广泛的语音理解任务,因此 X-AuT 的跨任务泛化能力尚不明确。实验仅基于 Qwen3-ASR-0.6B 单一架构,且只压缩音频编码器深度,未探索宽度、注意力头数或量化等维度,限制了方法的普适性结论。此外,所有结果均为单次运行(single-run),缺乏多次随机种子下的方差分析,无法评估训练不稳定带来的性能波动。
  • 训练流程依赖转录一致性过滤和源重加权,对数据分布和质量标签高度敏感。若实际部署场景中缺乏高质量的成对音频-文本数据或可靠的 ASR 标注,该方法的效果可能显著下降。同时,行为探针的短周期选择策略仅在小规模开发集上验证,选出的层组合是否能迁移到大规模实际数据仍存疑。推理效率方面,尽管音频塔参数减少,但语言模型主干和交叉注意力机制仍占主导,端到端延迟降低幅度可能有限。
  • 与现有工作相比,X-AuT 未与更先进的结构化剪枝、一次性 NAS 或动态推理方法进行系统对比,仅对比了 self-distillation 和 direct pruning,基准相对狭窄。蒸馏过程中冻结语言模型主干并只微调 LoRA 适配器和输出嵌入,虽然节省资源,但可能限制了学生模型对齐教师表示的上限。此外,跨尺度蒸馏的损失权重、温度等超参数需要针对不同模型规模重新调优,文章未提供明确的自动化调参方案。
论文Haojun Zhang2026-09-10原文

相关内容