论文

Thinking While Speaking: Inference-Time Knowledge Transfer for Responsive and Intelligent Conversational Voice Agents

Thinking While Speaking: Inference-Time Knowledge Transfer for Responsive and Intelligent Conversational Voice Agents

语音代理面临一个根本矛盾:使基础模型具备能力的推理、检索和工具调用过程是迭代且缓慢的,而对话交互要求毫秒级的响应速度。较小的实时模型能够满足延迟要求,但在复杂任务上无法与基础模型匹敌,导致当前语音代理不得不在响应性与能力之间取舍。 我们提出对话填充 (conversational infill) 方法,其中小型 talker 模型 在实时生成上下文相关的初始响应的同时,隐藏外部 reasoner 模型 的延迟,并在推理过程中将流式 reasoner 知识无缝集成到自身响应中。我们构建了一个包含 290,571 个示例的合成数据集,覆盖六个领域,并在 135M 到 1.7B 参数的七个广泛使用的小型语言模型上验证了该任务的可学习性。 系统实现 ConvFill 将首token响应时间维持在毫秒级,同时将准确率差距缩小至对应前沿 reasoner 模型性能的 6.3% 以内。在基于 Apple M2 SoC 部署 talker 模型的用户研究 (n=18) 中,参与者认为 ConvFill 整体上与前沿模型相当,在检索密集型任务中更偏好 ConvFill,并评价其响应性显著更高。 这些结果表明,对话填充在延迟-能力帕累托前沿上开辟了新的点位,为构建既具备响应性又高度智能的语音代理提供了实用路径。代码、模型和数据集见 https://github.com/vysri/conversational-infill。

论文精读

TL;DR 提出对话填充(conversational infill),让小型 Talker 模型即时生成回复以隐藏推理延迟,并流式融合 Reasoner 知识,在毫秒级响应下实现接近前沿模型的性能。

问题

问题背景

语音交互正成为下一代核心人机接口,业界追求兼具快速响应高能力推理的语音代理。

现有方法局限

当前方案普遍在延迟与能力间取舍:

  • 纯小模型:首字延迟可达 <500ms,但在复杂任务(多步推理、实时检索)上准确率远落后于大模型。
  • 纯大模型 (Reasoner):能力卓越,但从 ASR → 推理 → TTS 的端到端延迟常达 2–10 秒,破坏对话节奏。
  • 简单预填充或静默缓冲:用固定短语掩盖延迟,缺乏上下文适应性,机械感强。
  • 先答后替换:先给占位回复,待大模型结果出来后覆盖,但打断了话语连续性,衔接不自然。

为什么难且重要

从系统层面看,大模型的推理、检索、工具调用本质是迭代、慢速的,而人类对话的心理延迟阈值在 100–300ms。两者存在根本冲突,无法通过简单扩展解决。业界对此高度关注:Amazon Alexa、Google Assistant、Apple Siri 等都在探索如何在不牺牲智能的前提下保持即时响应。该问题对实时交互设备(车载助手、智能耳机、AR 眼镜)至关重要,甚至在 AI PinRabbit R1 等新硬件中成为体验临界点。

行业类比

类似于云游戏中的流式渲染:本地快速输出低画质帧保证低延迟,随后云端高质量数据逐步覆盖,与 ConvFill 的“先想后说、能力异步填充”策略异曲同工。

核心洞察

  • - **推理时知识传输解耦延迟与能力**:传统方案只能在实时小模型与高延迟大模型间二选一。Conversational infill 让 talker 模型在生成占位填充时流式接入 reasoner 输出并即时整合,既将首字响应控制在毫秒级,又逐步将回答质量提升至接近前沿模型。这一范式不同于级联回退或推测解码,本质上是在同一生成过程中进行动态知识注入,而非加速已有解码路径或简单等待。
  • - **大规模多域合成数据使小模型学会“对话填充”元能力**:通过覆盖 6 个领域、29 万样本的合成数据集,使 135M–1.7B 参数的 SLM 学会隐藏延迟并与 reasoner 协作。模型不仅要生成上下文一致的填充语,还需在推理阶段接收并融合流式知识,这种任务设计与常规指令微调不同,它塑造了模型对时序协作的认知,为实际部署提供了可复制的训练模板。
  • - **用户偏好验证了响应性提升可抵消部分能力差距**:在 Apple M2 SoC 上的实时用户研究 (n=18) 表明,尽管 ConvFill 所用 talker 模型绝对能力弱于纯 reasoner,但其毫秒级响应使整体评价与 frontier 模型持平,检索密集型任务中用户甚至更偏好它。这揭示了工程落地时的关键权衡:响应性的大幅改善可有效提升感知质量,重新定义延迟–能力的 Pareto 前沿。

方法

ConvFill 系统实现了一种名为 conversational infill 的推理时协作范式,核心思路是让小型 Talker 模型在对话中充当“填空者”,边等待 Reasoner 模型的复杂推理结果,边实时生成并动态整合延迟到来的知识,从而将 latency 隐藏在自然的话轮衔接中。

架构与工作流

系统采用双模型异步协作架构:

  • Talker 接口:每次交互时,Talker 接收当前对话上下文、用户输入以及 Reasoner 可能已返回的部分结构化知识流。其任务是在 毫秒级首次响应时间(TTFR) 内开始生成,并在生成过程中持续融合新到达的 Reasoner 输出。
  • Reasoner 接口:Reasoner 负责执行大规模检索、工具调用或多步推理,生成的结果以 token 级流式数据包形式异步推送给 Talker。Reasoner 不直接面对用户,延迟远高于实时要求(秒级)。
  • 推理时协作(Inference-Time Collaboration):Talker 在自回归解码的每一步,根据当前 prompt(包括历史对话和已到达的 Reasoner 片段)预测下一个 token,同时动态判断是否使用新到的 Reasoner 信息来“填充”或修正即将产出的内容。该过程不改变 Talker 的底层自回归解码机制,只是将流式信息作为额外前缀条件,做到了零额外推理开销。

训练策略

为让 Talker 学会 infill 行为,研究团队构建了 ConvFill 数据集:通过 topic-seeded freeform generation 和 Schema-Guided 对话 scaffold 两种方式合成 290,571 个样例,覆盖知识问答、任务指令、复杂检索等六个领域。每个训练样本模拟“Talker 先发制人生成→Reasoner 信息滞后到达→Talker 自然衔接”的对话轨迹。Talker 微调时采用标准的 next-token prediction 损失,但输入序列中按时间顺序交织 Reasoner 控制 token,从而学会识别何时等待、何时活用新信息。

关键差异

与传统 pipeline 方式(先等 Reasoner 完整输出,再交给 Talker 改写)不同,ConvFill 在推理时边输出边吸收,让 Talker 利用已生成部分的语义空间平滑对齐后续文本,缓解了延迟与能力的 trade-off。相比于端到端联合推理方案,它仅需训练轻量 Talker,无需改动 Reasoner,工程部署灵活。

实验

实验设计

实验基于自行构建的 ConvFill 合成数据集,包含 290,571 个对话示例,覆盖六个领域,生成结合主题种子自由生成与 DSTC8 模式引导。训练了 7 种小语言模型(135M 至 1.7B 参数)作为 Talker,与外部 Reasoner(前沿模型)协同。评估包括单轮/多轮基准测试(使用 LLM-as-a-Judge 等自动指标)和 18 人用户研究,后者在 Apple M2 SoC 上部署实时交互,涵盖直接任务、RAG 和 MCP 任务。

关键发现

  • 延迟突破:Talker 的即时响应保持毫秒级首字延迟(TTFR),远快于 Reasoner 的数秒延迟。
  • 能力补偿:流式集成 Reasoner 知识后,准确度差距缩小至前沿 Reasoner 的 ≤6.3%,大幅优于纯 Talker。
  • 用户偏好:整体评级与前沿模型持平,在检索密集型任务上更被青睐,响应速度评分显著更高。

基线对比深度解读

传统语音助手要么牺牲响应速度以换取强大推理(Reasoner-only),要么牺牲能力以追求低延迟(Small Talker-only)。ConvFill 通过推理时协同绕过这一取舍:Talker 先快速生成占位内容,掩藏 Reasoner 的延迟,同时动态融合 Reasoner 流式输出以修正和丰富回应。相比于等待完整 Reasoner 回复再输出的串行级联,ConvFill 的 TTFR 降低数个量级,且避免了纯 Talker 在面对复杂工具调用或多跳检索时的严重性能衰减。这本质上是在 延迟-能力 Pareto 前沿上找到新均衡,证明小模型可通过实时的知识传输扮演高能力、低延迟的对话界面。

行业影响

落地场景

  • 实时语音助手:智能音箱、车载语音、移动端语音交互中,用户既期望毫秒级响应,又需要复杂推理(如多步查询、工具调用)。
  • 智能客服机器人:在线客服系统需在用户提问后立即给出自然回应,同时后台检索知识库、调用业务 API,再将精确信息无缝嵌入对话。
  • 多模态数字人:虚拟角色伴随语音交互,需在不打断对话节奏的前提下整合推理结果。

商业价值

  • 降本:Talker 模型(135M–1.7B 参数)可部署于边缘设备,大幅减少云端大模型(Reasoner)的调用频次与计算开销。
  • 体验提升:用户研究表明 ConvFill 在检索重任务中更受偏好,整体评分与前沿模型持平,且响应速度感显著更高,有助于提升用户留存与付费转化。
  • 能力普惠:使资源受限的设备(如 IoT、MCU)也能提供接近最前沿的对话能力,拓展产品覆盖面。

与现有产品栈的集成

  • 双模组架构:通过 Talker 模型(本地或边缘)+ Reasoner 模型(云端 API)构成,可作为对话管理中间件插入现有 ASR/TTS 流水线。
  • 兼容主流框架:模型基座为 HuggingFace 上广泛使用的 SLM(如 Qwen2.5、SmolLM2),易于与 LangChain、LlamaIndex 等编排工具对接,并支持 MCP 工具调用协议。
  • 推理时流式整合:Reasoner 输出以流式 token 传入 Talker,Talker 动态插入生成序列,无需额外后处理逻辑。

典型应用案例

  1. 电商客服:用户询问“我的订单延迟了,预计何时送达?”,Talker 立即给出共情反馈,同时 Reasoner 查询物流系统获取详情,Talker 在后续话术中自然插入具体时间与补偿方案。
  2. 车载语音交互:驾驶员说“找附近的充电桩并推荐最快路线”,Talker 先确认指令,Reasoner 并行搜索地图、充电桩状态和实时路况,Talker 在说话中逐步整合结果,避免沉默等待。

局限

  • - **Synthetic Data Generalization**: The ConvFill training dataset of 290,571 examples is entirely synthetically generated using topic-seeded freeform generation and DSTC8 schema-guided scaffolds. While this enables large-scale curation, it may fail to capture the full spectrum of real-world conversational variability, including code-switching, emotional nuance, and domain-specific jargon not present in the six predefined domains. The validation cascade (structural, NLI, BERTScore) provides only proxy quality control and does not guarantee robustness to out-of-distribution inputs. The talker models, trained exclusively on synthetic data, may behave brittlely under adversarial queries or atypical flows, limiting deployment in safety-critical applications. The underlying LLM for data generation is undisclosed, raising concerns about bias leakage or distributional mismatch with target populations. This reliance on synthetic pipelines constrains ecological validity and necessitates extensive real-world calibration before production use.
  • - **Limited User Study and Evaluation**: The live user study involved only 18 participants, which is insufficient for statistically robust conclusions across nuanced task preferences (e.g., retrieval-heavy vs. direct tasks). The study ran exclusively on an Apple M2 SoC, leaving open questions about performance on lower-end devices or under variable network conditions. The benchmark evaluation employs LLM-as-a-judge and reference-based metrics like BERTScore, both subject to known biases and poor correlation with end-user satisfaction. The claim of closing the accuracy gap to within 6.3% of frontier reasoner performance lacks transparency—the specific frontier model and latency profile are not fully detailed, making it hard to assess the true capability trade-off. Without larger, more diverse human evaluations and multi-device stress testing, the reported latencies and preferences may not generalize to typical voice agent deployments.
  • - **Dependency on External Reasoner and Streaming Robustness**: ConvFill assumes a reliable, low-latency stream from an external reasoner. In practice, network interruptions, latency spikes, or reasoner throttling could delay or truncate the stream, forcing the talker to generate filler that may be factually inaccurate. The talker’s small capacity (up to 1.7B parameters) limits its ability to comprehend and fluently rephrase complex reasoning chains; intermediate errors from the reasoner are likely to be propagated or amplified. The architecture introduces a cold-start dependency: the talker must wait for the first reasoner token before beginning infill, potentially increasing TTFR beyond the reported millisecond figures under adverse network conditions. Thus, ConvFill’s performance ceiling is directly tied to reasoner API reliability, which is outside developer control and may vary dramatically across deployment environments.
论文Vidya Srinivas2026-06-23原文

相关内容