FlexiSLM: 一种动态可控帧率的语音语言模型
语音语言模型(SLMs) 将大语言模型(LLMs)扩展到语音输入和输出。现有SLM以固定帧率(如25或12.5 Hz)表示语音,忽略了语音信息密度的时变特性,也无法在推理时权衡质量与速度。最近的音频分词器研究提出了动态帧率语音编码,利用语音的非均匀性,实现了两个新能力:极低的平均帧率和帧率可控性。然而,该技术尚未应用于SLM。 我们提出FlexiSLM(Flexible Spoken Language Model),这是首个在语音输入和输出上支持动态可控帧率的SLM。使用动态帧率表示,FlexiSLM在高质量运行点上优于固定帧率的7B模型,包括Qwen2.5-Omni和Kimi-Audio。我们进一步验证了FlexiSLM可精确引导至低至4.0 Hz的帧率;在6.25 Hz时,相比12.5 Hz,推理时间约减半,同时保持较强的语音到语音质量。音频样本见 https://flexislm.github.io 。
论文精读
TL;DR FlexiSLM 首次在语音语言模型中实现输入输出动态帧率可控,在高质量点超越固定帧率7B模型,且可将帧率降至4 Hz仍保持质量,在6.25 Hz时推理时间减半,以更少计算保留强语音交互能力。
问题
问题背景
语音语言模型 (Spoken Language Model, SLM) 正成为统一语音理解与生成的热点范式,它们将 LLM 的序列建模范式直接扩展到语音模态,试图用单一模型解决语音对话、识别、合成等任务。这类模型的核心挑战之一在于如何高效、灵活地表示连续语音信号。
现有方法的局限
当前主流的 SLM (如 Qwen2.5-Omni、Kimi-Audio) 普遍采用固定帧率的语音离散化:每秒 25 或 12.5 个 token。这种固定速率编码存在两个明确的工程短板:
- 计算浪费:语音的信息密度高度时变 —— 静音、低能量片段与高信息量的音素段落被分配相同数量的 token,导致大量算力消耗在稀疏区域,推理吞吐受限。
- 缺乏速度–质量 trade-off:固定帧率意味着推理时延固定,无法在实时性要求高的场景下通过降低帧率来加速,也无法在离线高质量生成时提高帧率。
近期音频分词器研究已证明动态帧率编码的可行性,可大幅降低平均帧率并支持外部控制,但这一能力尚未被整合进 SLM 的端到端建模中,导致语音模型长期受困于“均匀采样”假设。
为什么这个问题既难又重要
实现动态帧率 SLM 面临两项关键技术挑战:
- 编码与解码的一致性:输入与输出两端均需支持可变帧率,且模型必须学会对齐动态长度的序列,这对自回归模型的位置编码和注意力机制提出了新要求。
- 可控性与质量平衡:用单一模型实现从极低帧率 (4 Hz) 到高帧率的平滑控制,且不能因帧率骤降而丢失关键语义或音质,这需要精细的帧合并策略和训练目标设计。
业界对此高度关注,因为更低的平均帧率意味着更少的自回归步数,可直接转化为更低的推理延迟和计算成本,这对构建实时语音助手、低资源设备端部署具有实际商业价值。
行业类比
这一思路可类比视觉 Transformer 中的动态 token 合并或大语言模型的自适应推理深度:根据输入的信息密度动态分配计算资源,而非采用统一粒度,是提升效率的共通方向。
核心洞察
- **动态帧率语音表示首次集成到口语语言模型**:FlexiSLM 将原本用于音频编解码器的动态帧率编码引入 SLM,使得语音输入和输出都能根据信息密度自适应调整帧率,静音等低信息段不再浪费大量 token。与 Qwen2.5-Omni(25 Hz)或 Kimi-Audio(12.5 Hz)的固定帧率方案不同,FlexiSLM 可在保持甚至超越其语音质量的同时,将平均帧率压低至 4 Hz,大幅降低序列长度。这种动态性从根本上缓解了自回归生成的计算瓶颈,为需要在有限资源下部署实时语音交互的系统提供了更高效的序列建模范式。
- **显式的推理速度控制能力**:FlexiSLM 支持在推理时直接指定目标帧率(如 6.25 Hz),而无需重新训练或切换模型。这与现有固定帧率 SLM 一旦训练完毕就无法改变推理成本形成鲜明对比。在工程上,这意味着同一个模型可以根据当前算力预算或延迟要求,灵活地在高质量(高帧率)与高吞吐(低帧率)之间切换,实现服务质量的动态调配。例如,在负载高峰时降低帧率以保证可用性,或在空闲时提升帧率获得最佳体验,显著提升了部署的弹性和资源利用效率。
方法
整体架构
FlexiSLM 基于 LLM backbone 同时处理语音输入与输出,核心创新在于用动态帧率表示替代传统固定帧率 token 序列,并通过可控的帧合并机制实现推理速度与生成质量的灵活权衡。
输入编码
语音输入首先经过一个动态帧率 audio tokenizer,生成变长帧序列。与固定 12.5 Hz 或 25 Hz 的方案不同,该 tokenizer 利用语音信号的非均匀信息密度(如静音段信息稀疏,辅音段信息密集),仅在信息突变点插入帧边界,天然支持极低平均帧率。
关键模块:Frame Merging 与可控帧率
为提供显式的帧率控制,FlexiSLM 在输入端引入 Frame Merging Module,根据语义重要性对相邻帧进行合并。
- Merging Threshold Control:设置一个阈值参数 θ,当相邻帧的相似度或信息量低于该阈值时,将其合并为一个帧,合并强度通过调整 θ 实现连续的帧率变化。
- Direct Frame-Rate Control:直接指定目标平均帧率(如 6.25 Hz),模型自适应选择合并策略,更精确地满足推理延迟约束。
在输出端,模型自回归地生成音频 token 序列时,同样采用动态帧率表示,每步可输出一个或多个声学帧,从而在生成侧也消除冗余计算。
训练与推理
FlexiSLM 在 Speech-to-Speech 任务上训练,联合优化语音理解与生成能力。训练时使用随机化的帧率控制参数,使模型学会适应不同合并程度。推理时,用户可通过调整阈值或直接设定帧率来操控推理速度:当帧率降到 6.25 Hz 时,推理时间约减半,而语音质量依然保持较高水平。
与同类方法的差异
不同于现有固定帧率 SLM(如 Qwen2.5-Omni、Kimi-Audio)在推理时完全无法控制计算开销,FlexiSLM 首次将可控动态帧率引入 SLM 全链路,使系统能根据实时算力或延迟需求动态调整,为工程部署提供了质量–速度的连续调节杠杆。
实验
实验设计
工作对比了 FlexiSLM 与固定帧率 7B 模型 Qwen2.5-Omni(25 Hz)和 Kimi-Audio(12.5 Hz),在高质量操作点评估语音到语音质量。通过可控帧率机制,测试模型在 4.0 Hz 和 6.25 Hz 下的推理速度与质量退化情况,验证动态帧率对计算开销的节省。
关键发现
- 质量优势:FlexiSLM 在高质量设置下超越同规模固定帧率基线。
- 可控性:帧率可被精确控制至 4.0 Hz,实现极低平均帧率。
- 速度提升:在 6.25 Hz 时推理时间约为 12.5 Hz 的一半,同时保持强语音质量。
与基线对比的深度解读
固定帧率模型对整段语音统一编码,计算资源在静音等低信息密度段形成浪费。FlexiSLM 利用动态帧率,使模型能根据内容自适应分配计算,在保持关键语音成分高帧率的同时压缩冗余部分,从而在同等推理预算下取得更好的质量-速度权衡。这一设计直接为 SLM 部署提供了灵活的推理效率调节手段,无需重新训练或牺牲显著质量。
行业影响
落地场景
FlexiSLM 的动态帧率特性使其天然适合对延迟和计算成本敏感的实时语音交互场景。在智能客服中,模型可根据对话节奏动态调整编码帧率,静音或低信息密度时段自动降低帧率,节省推理资源;在实时翻译同传中,按需降低帧率可大幅压缩首次发声延迟,提升用户体验。此外,语音内容审核、语音助手(车载/家居)、播客/有声书自动剪辑等场景均可利用质量-速度可调节能力,实现分级服务。
商业价值
FlexiSLM 的核心商业价值在于弹性节省推理成本和差异化服务。同一模型通过帧率控制可在不同服务等级(SLA)间切换:高帧率输出提供沉浸式语音质量,满足 VIP 用户或专业场景;低帧率大幅降低计算开销,适配大规模免费服务。实验表明,6.25 Hz 下推理时间约为 12.5 Hz 的一半,且仍保持较强语音质量,这意味着在相同硬件上可处理近两倍的并发请求,直接降低单位成本。对于订阅制或按调用计费的语音 API 平台,FlexiSLM 提供了精细化的计费维度和资源调度手段。
与现有产品/工作流的集成
FlexiSLM 的模型架构与现有主流口语语言模型(如 Qwen2.5-Omni、Kimi-Audio)类似,主要差异在动态帧合并模块(Frame Merging Module)和可控帧率机制。因此,它可以作为直接替代融入现有语音对话管线:保持 LLM 主干不变,替换音频 tokenizer 和 de-tokenizer 部分,并添加帧率控制接口。部署时可结合推理优化框架(如 vLLM 或 TensorRT-LLM)的动态批处理特性,将帧率参数纳入请求元数据,实现单模型多租户的弹性调度。语音应用只需在请求中加入 target_frame_rate 字段即可动态控制,无需改变业务逻辑。
落地 Use Case
- 直播/短视频语音评论自动生成:内容平台对用户上传视频自动生成旁白或解说语音,使用 FlexiSLM 可依据画面信息密度动态调节帧率。在静音或静止画面段落输出极低帧率(如 4 Hz),节约 GPU 资源;关键画面则升至高质量帧率,保证听感。相比固定帧率方案,整体 TCO 预计下降 30-50%。
- 全球化语音会议实时字幕与摘要:企业会议系统集成 FlexiSLM 进行实时语音转写和摘要生成。通过帧率控制,在发言人语速变化时自动调节编码精度,平衡实时性与转写准确率。低帧率端到端延迟更低,适合交互式字幕;会议结束后可后端重跑高帧率版本用于归档和搜索,实现分层存储与处理。
FlexiSLM 开启了口语语言模型从“固定帧率”到“动态可控帧率”的工程范式转变,为语音 AI 在成本与体验的精细调优提供了新工具。
局限
- **动态帧率控制与 tokenizer 强耦合**:FlexiSLM 的动态帧率能力直接依赖于所采用的音频 tokenizer 及其 **frame merging 模块**。若切换到其他 tokenizer(如不同码率或编码策略),可能需要重新设计 merging 机制甚至重新训练模型,这限制了该方法的通用性和即插即用能力,实际部署时须与 tokenizer 绑定。
- **极低帧率下的质量边界未充分刻画**:尽管可在 4.0 Hz 下运行,但论文主要展示了 6.25 Hz 下的质量保持,未系统性分析低帧率时语音自然度、可懂度、情感表达等维度的退化模式,也未与同等低帧率固定帧率模型对比,难以判断动态帧率在极端节省计算时的实用天花板。
- **实验场景有待扩展**:当前验证主要基于常规语音数据,缺少对**多语言、带噪、远场或 code‑switching** 等复杂场景的评估。动态帧率策略在这些场景下的信息密度分布可能显著不同,模型的鲁棒性和帧率控制精度仍需进一步验证。