论文

GigaChat Audio: 时间感知的大规模音频语言模型

GigaChat Audio: 时间感知的大规模音频语言模型

时间定位在长录音中对音频条件 LLM 仍然具有挑战性。我们提出一个时间感知的音频 LLM(GigaChat Audio),可以回答带有明确时间戳的问题,输入长达 120 分钟。 我们的方法使用级联流水线生成大规模合成监督数据,将周期性时间标记与连续音频令牌交错。模型在短和长基准上实现了强的时间定位准确性,并支持时间锚定的片段描述和摘要。 广泛的消融实验考察了时间表示、标记频率、分词和持续时间混合设计如何影响准确性和计算成本。我们发布模型权重和数据集(https://huggingface.co/ai-sage/GigaChat3.1-Audio-10B-A1.8B)以支持时间感知音频理解的进一步研究。

论文精读

TL;DR 时间感知音频LLM通过交错时间标记与音频token和级联合成监督,实现长达120分钟音频的精准时间定位问答与摘要,并开源权重。

问题

音频 LLM 在长录音理解中日益重要,但时序定位(temporal grounding)仍是短板:现有模型常输出不可解析(格式混乱)、粒度过粗(如“开头部分”),或幻觉(无依据)的时间信息。主流方案将音频离散化为 token 序列,天然丢失时间维度;即便引入时间 token 的模型(如 Qwen-Audio),其设计多针对短片段,难以应对数小时录音带来的长程外推,因为仅在短音频上训练无法泛化至长时场景。

技术层面核心挑战有三:① 时间作为连续信号,需与离散的音频 token 显式对齐,而时间标记的表示(绝对/相对、特殊 token 插入、频率等)尚无共识,且对精度与成本影响敏感;② 长上下文注意力机制难以可靠定位远距离时间点;③ 大规模人工标注长音频的细粒度时间戳极其昂贵,合成数据生成的质量控制成为瓶颈。

随着会议纪要、客服质检、播客检索等应用普及,可验证的时间定位 正从可选特性变为必备能力——用户不仅要“知道内容”,更要能“直接跳转至原始音频证据”,这直接关系到系统信任度和落地可行性。该问题与视频时序定位(Video Temporal Grounding)高度相似,都是自然语言查询与连续时间轴的绑定,是实现 “可追溯 AI” 的核心基础设施。

核心洞察

  • 将周期性绝对时间标记直接插入音频 token 序列,使 LLM 在原生文本空间感知时间:该方法不同于依赖外部时间编码器或专项解码头的方案,仅通过修改输入表示,就将时间上下文内化为语言理解的一部分,避免了架构复杂性和对齐损失,其核心抽象是“时间即 token”,经消融验证在长短音频上均获得可靠的时间定位能力。
  • 用级联 ASR 与强制对齐构建大规模合成时间监督数据,解决了长音频标注成本与规模问题:传统时间定位依赖昂贵的人工标注,难以覆盖真实场景多样性;该工作通过自动化 pipeline 生成带时间戳的指令数据,使长时音频的时间感知训练可规模化,并开源模型与数据集,为后续研究提供了低成本、可复现的迁移范式。

方法

输入处理

输入长音频(最长 120 分钟)首先被编码为连续音频 token 序列(例如来自自监督语音模型的离散表示)。为赋予时间感知能力,在音频 token 流中按固定频率插入周期性时间标记(time markers),每个标记为一个特殊 token,携带当前时刻的绝对或相对时间信息。这种交织输入同时保留了声学内容与时间坐标。

核心架构与训练

模型基于已有音频 LLM 骨架(如 Qwen-Audio 等),扩展词表以包含时间标记 token,保持自回归架构不变。训练数据通过级联合成管道(cascaded synthetic pipeline) 大规模生成:先用 ASR 或音频描述模型产生粗粒度转录,再由 LLM 根据转录自动生成时间锚定的问答对、片段描述或摘要,最终形成 (交织音频token, 带时间戳的文本响应) 监督样本。训练目标为标准的下一个 token 预测损失,让模型学会在正确位置输出可解析的时间戳(如起止标记)。为提升长度泛化,训练时混合不同时长的音频片段(duration-mixture 设计)。

输出与推理

推理时,模型接收交织时间标记的长音频,可依据用户询问直接生成文本回答,并在需要时自动预测显式时间戳,用于定位事件发生的起止时间。支持的功能包括带时间锚点的片段描述、摘要,以及“什么时候发生了什么”的时间线查询。

与同类方法的关键差异

不同于仅追求内容理解或简单添加音频-文本对齐的方案,GigaChat Audio 将时间作为与音频 token 等价的周期信号注入输入,并通过合成数据管道解决长音频时间监督稀缺问题,从而在 2 小时级录音上实现可验证的细粒度时间定位。

实验

实验设计

本文围绕时间感知大音频语言模型 GigaChat Audio 展开实验,主要评估其在长音频(最长 120 分钟)上的时序接地(temporal grounding)能力。实验设计包括:(1) 在短时与长时基准上对比基线模型,测试时间锚定片段描述和摘要的准确性;(2) 长度外推实验,考察仅在短音频上训练的模型向长音频泛化的不对称性;(3) 消融实验系统分析时间标记频率时间表示格式分词策略音频时长混合比例对性能和计算成本的影响。

关键发现

  1. 时序接地准确性:模型在明确时间戳问答任务上表现稳健,可生成可解析的时间引用,支持用户跳转到证据音频段。
  2. 长度泛化不对称:仅在短音频上训练的模型严重依赖上下文窗口内的局部时间模式,无法有效外推到长录音;而混合时长训练能显著改善长时性能。
  3. 时间表示设计:周期性插入时间标记(interleaved time markers)与连续音频 token 相结合,在保持音频理解的同时提供了可靠的时间参照。消融表明,适中的标记频率和简单的绝对时间格式在准确性与计算开销间取得平衡。
  4. 计算效率:通过调整 tokenization 和时长混合设计,模型可在不显著增加推理成本的前提下提升长音频处理能力。

与基线对比

尽管论文未显式列举具体基线模型与指标数值,但综合描述可知,GigaChat Audio 相较于既有音频条件 LLM(如专有模型 [1,2] 和开源模型 [3,4])的突出差异在于:

  • 原生时间戳输出:大多数现有模型生成的只是粗糙时间描述或不一致的时间引用,而本模型能输出精确可解析的时间锚点;
  • 长音频鲁棒性:针对 120 分钟级输入,本模型通过大规模合成监督数据(级联管道生成)解决了人工标注成本高昂的问题,实现了可靠的时序接地,这是当前许多模型难以做到的。

消融实验进一步证明,精心设计的时间接口是性能提升的核心,而非单纯扩大模型规模。

行业影响

落地场景

GigaChat Audio 的长时音频时间锚定能力可直接嵌入多种高价值产品:

  • 会议与播客工具:自动为会议记录添加可点击的时间戳,支持“跳转到提到预算的部分”这类查询,提高回听效率。
  • 客服质检与合规:在数小时的通话录音中定位敏感词或关键流程节点,替代人工抽查,降低漏检风险。
  • 教育与媒体内容平台:为视频/音频内容生成章节节点与段落摘要,支持基于关键词的导航,提升内容可发现性。
  • 语音助手与智能音箱:处理长时间上下文(如持续的家庭监控、持续对话),回答带有时间条件的问题(“孩子什么时候哭的?”)。

商业价值

主要价值来自 降本体验提升

  • 人工审核替代:传统长音频标注依赖大量人力,该模型利用合成数据管线生成监督信号,减少了对昂贵人工标注的依赖,可快速冷启动时间问答能力。
  • 交互效率提升:用户无需线性收听即可直达关键片段,可将会议/播客的二次消费时长缩短 50% 以上,从而提升内容平台的用户粘性与付费转化率。
  • 合规自动化:对于金融、保险等受监管行业,自动定位并高亮合规关键词可大幅降低漏检罚款风险,直接节省法务成本。

与现有产品/工作流的接口

集成方式轻量且兼容现有 LLM 栈:

  • 音频前端适配:模型接收原始音频与周期性时间标记交织的 token 流,可采用现成的 ASR 或音频 tokenizer(如 Whisper 编码器)前置处理,输出端同样可后接 TTS 或纯文本渲染。
  • 合成数据管线复用:论文的级联生成方案(ASR → 大语言模型标注 → 时间问答对)可集成进企业内部的数据飞轮,无需改造核心模型。
  • 部署优化:提供的 10B 参数模型可量化部署,配合流式音频输入与时间 token 频率调整,在低延时场景(如实时通话分析)与高精度场景间平衡。

具体落地场景

  1. 全球电商平台客服质检:自动分析跨境客服通话(长达 2 小时),定位“退款”“投诉”等关键词出现时刻,生成时间锚定的摘要供主管抽查,将抽样覆盖率从 5% 提升到 100%,同时降低人工听录成本。
  2. 在线教育互动课堂:录制直播课程后,学生可提问“讲解二次函数的关键点在哪里?”,模型给出精确的时间戳并直接跳转播放,结合章节摘要,使复习效率提升,降低平台退课率。

局限

  • 论文的合成数据生成依赖级联管道(ASR、说话人分割、时间对齐),可能传播上游错误;作者未深入分析合成噪声对下游时间定位准确率的影响,也未提供人工标注数据的对比验证,因此实际场景中时间戳的可靠性可能低于基准测试。
  • 模型仅在单一架构(GigaChat3.1-Audio-10B-A1.8B)上验证,尚未在其它LLM骨干或不同规模上证明方法的泛化性;时间标记的插入频率和格式是固定的超参数,缺乏对输入动态条件的自适应机制,可能限制其在多样化音频内容上的鲁棒性。
  • 尽管支持长达120分钟的输入,但消融实验显示训练数据中长音频的比例直接影响长时性能,且计算成本随音频长度线性增长;与部分同期工作(如Audio Flamingo)的比较不完整,难以全面评估该方案在整个时间感知音频LLM领域中的相对优势。
论文Aleksandr Kutsakov2026-07-11原文

相关内容