AdaSR: 基于层级相对策略优化的自适应流式推理
大型推理模型通常遵循先读后思考的范式:观察完整输入,基于静态上下文进行推理,然后生成答案。然而,许多真实场景本质上是动态的,例如音频和视频流,信息以连续流的形式到达,模型必须在部分观测下进行推理、更新和响应。最近的流式推理方法允许模型在阅读时思考,但它们主要依赖对预构建轨迹的监督模仿,这限制了灵活性。 本文提出 AdaSR,一个自适应的流式推理框架,使模型能够在输入流式传输过程中进行推理,并在流结束后执行最终深思,学习何时思考以及在不同阶段分配多少计算量。为优化这一层级推理过程,我们引入 层级相对策略优化 (HRPO),将策略优化分解为流式推理阶段和深度推理阶段,提供更细粒度的优势分配,而非将单一序列级优势均匀分布到所有 token 上。HRPO 整合了格式、准确性和自适应思考奖励,以强制有效的推理协议、保持最终任务性能并鼓励延迟感知的计算分配。 实验表明,与监督微调基线相比,AdaSR 在推理准确性、计算效率和流式延迟之间实现了更优的平衡。代码已开源。
论文精读
TL;DR AdaSR 让大模型在流式输入中动态分配计算、边读边想,通过 HRPO 分层优化策略,在准确率、效率和延迟间取得更好平衡。
问题
问题背景
大型推理模型普遍采用“先完整读取,再静态推理”的范式,但 音频流、视频流 等动态场景迫使模型在输入持续到达的过程中即时推理——信息不完整,决策却不可无限等待。
现有方法局限
当前流式推理方法(如 StreamingLLM)主要通过监督微调(SFT)模仿预构建的“边读边想”轨迹,存在三层不足:
- 行为固化:只能复现预设的思考时机与长度,无法根据流式输入的复杂度和计算预算自适应调整。
- 优化粗糙:使用 GRPO 等序列级策略优化时,优势信号平均分配到所有 token,难以区分“流式阶段快速反应”与“最终阶段深度推理”对奖励的贡献差异。
- 延迟与质量失衡:缺乏对计算延迟的直接建模,导致模型倾向于过度推理或草率响应,无法主动学习“何时节省计算、何时深入思考”。
为什么这个问题难且重要
流式推理本质是部分可观测下的层次化决策:模型需同时决定何时输出中间结果(流式阶段),何时刻意保留推理直到收集全部信息(深度阶段),并分配每步的计算量。传统 RL 仅提供序列级奖励,难以传递如此细粒度的优势信号。业界对交互式 AI(如实时视频问答、语音助手、具身对话)的需求激增,低延迟与高精度的兼顾直接决定产品可用性,而现有 SFT 方法无法满足这种自适应计算分配的核心能力。
行业类比
这一挑战类似自动驾驶的实时感知栈:激光雷达点云连续涌入,系统既要低延迟输出障碍物边界框,又要积累足够证据后方启动复杂行为规划,必须在瞬态反应与长程推理之间动态平衡。
核心洞察
- **自适应流式推理范式**:AdaSR 打破传统“读后思考”与现有流式推理的监督模仿局限,通过强化学习让模型自主决定“何时思考”与“分配多少计算”。相比依赖静态轨迹的方法,它赋予模型在信息不完整时进行预判、并在流结束时深度整合的灵活性,更贴近动态音视频处理等真实场景。
- **分层相对策略优化 (HRPO)**:针对 GRPO 在流式推理中均匀分配序列级优势导致优化信号粗糙的问题,HRPO 将优势分解为流式推理和深度推理两个阶段,实现 token 级别的细粒度信用分配。这种设计使模型能精确学习在不同阶段投入不同程度思考,避免全局优势信号引入的优化偏差。
- **计算-延迟感知奖励**:AdaSR 引入自适应思考奖励,显式惩罚深度推理带来的额外延迟,驱动模型仅在关键时刻进行深度计算。该机制直接优化准确率与流式延迟的平衡,相比仅依赖任务准确率奖励的方法,能产出更高效且自适应的推理策略。
方法
AdaSR 针对动态流式输入场景,提出自适应流式推理框架,整体遵循 流式输入 → 层次化推理(流式思考 + 深度审视) → 最终答案 的管线。
输入与处理流程
模型接收持续到达的数据流(如音频、视频帧),不等待完整输入。每收到新片段,便进入流式推理阶段,生成中间思考 token,逐步更新对上下文的理解。待流全部结束后,模型进入深度推理阶段,利用完整观察进行最终 deliberations,进而输出答案。
关键模块:层次化相对策略优化(HRPO)
HRPO 是核心优化方法,将整个生成过程分解为两个阶段,摒弃传统 RL 中单一序列级奖励的均匀分配,引入 层次化优势分配:
- 分段优势计算:分别为流式推理和深度推理阶段的 token 计算独立优势(相对策略梯度),避免早期思考 token 被后期答案 token 的错误信号误导。
- 复合奖励函数:
- 格式奖励:强制输出遵循
思考...答案...的结构协议,避免无效输出。 - 准确性奖励:衡量最终答案的正确性,保证任务性能。
- 自适应思考奖励:基于延迟感知信号,奖励模型在需要时思考、在信息不足时保持沉默,惩罚多余计算,从而学习“何时思考”与“分配多少计算量”。
- 格式奖励:强制输出遵循
- 策略优化目标:HRPO 组合上述奖励,通过分层优势加权策略梯度更新,使模型能够动态平衡推理准确性与流式延迟。
训练算法
采用在线 rollout:在流式输入上采样完整轨迹,记录阶段边界,利用 HRPO 计算梯度并更新模型参数。训练中同时优化格式、准确性和思考时机,使模型脱离固定思考模式。
与同类方法的差异点:现有流式推理方法多依赖监督微调模仿预构造的思考轨迹,思考模式僵化;AdaSR 通过 HRPO 驱动的强化学习,首次实现模型自行学习自适应计算分配,无需人工标注思考时机,灵活度更高。
实验
实验设计
AdaSR 的评估围绕流式推理场景展开,重点考察模型在输入逐步到达的情况下进行推理的能力。实验采用监督微调(SFT)基线作为比较对象,该基线通过预先构造的推理想轨迹进行模仿学习。评估维度覆盖三方面:
- 推理准确性(最终答案是否正确)
- 计算效率(生成 token 总量、冗余思考程度)
- 流式延迟(从输入片段到达至产生有用中间推理的时间)
训练过程使用分层相对策略优化(HRPO),将整个过程拆分为流式推理阶段和深度推理阶段,并分别分配优势信号,同时结合格式奖励、准确度奖励和自适应思考奖励训练模型。
关键发现
- 自适应计算分配效果显著:AdaSR 能够在输入流过程中根据信息量动态决定“现在思考”还是“稍后思考”,避免在信息不足时浪费计算,也在信息充分时及时推理,从而在保持最终准确率的同时大幅减少冗余 token 生成。
- HRPO 优势分解优于均匀优势分配:与 GRPO 等将序列级优势均匀分配给所有 token 的方法相比,HRPO 通过层次化优势分配,更精细地奖励有益的中间推理步骤,抑制无关或有害的思考,从而让模型学会“何时思考”而不是盲目生成推理链。
- 多奖励联合优化稳定:格式奖励、准确度奖励与延迟感知的思考奖励能够协同工作,没有出现严重的 reward hacking。即使模型为了降低延迟而缩短推理链,最终准确率仍与全量推理模型相当。
与基线对比的深度解读
与 SFT 基线相比,AdaSR 的核心优势来自学习范式的转变:SFT 只能模仿固定轨迹,无法适应不同输入流的实时需求,容易产生“过思考”或“欠思考”现象;而 HRPO 通过强化学习让模型自身探索最优推理时机与推理长度。这种差异在输入流信息密度不均匀时尤为明显——SFT 常在该安静时不必要地思考,导致高延迟;而 AdaSR 的延迟感知奖励直接抑制了这类行为,实现了更高效的流式推理。总体而言,AdaSR 提供了一种 “思考预算”可调节 的流式推理方案,为动态输入场景(如音视频流、实时对话)中大型推理模型的部署提供了更具实用价值的训练框架。
行业影响
落地场景
AdaSR 的流式自适应推理能力天然适合需要实时处理流式输入并兼顾推理质量的应用。典型场景包括:
- 语音助手与实时翻译:麦克风持续输入音频流,模型可在说话者未完成整句时启动流式推理,提前生成部分语义理解或翻译候选,待语音结束后再通过深度推理修正结果,显著降低首 token 延迟。
- 视频理解与智能监控:处理直播或监控视频流时,需要逐帧分析并实时响应,同时也要结合全局上下文完成长程推理(如事件检测、视频问答)。AdaSR 能够动态决定何时在流式阶段消耗少量计算,何时进入深度推理,避免每一帧都做完整前向计算。
- 金融实时分析与交易决策:新闻流、市场数据流持续到来,模型需要边读边形成初步判断,并在关键信息集齐后才启动复杂推演,平衡实时性和决策质量。
商业价值
- 降低服务延迟,提升体验:通过流式推理提前生成部分结果,首 token 延迟下降可直接改善用户交互体验,对实时对话类产品(如语音助手、在线客服)意味着更高的留存率和付费转化。
- 优化计算成本:分层推理允许模型在简单阶段使用较少计算,复杂阶段才调度更多资源,减少不必要的计算开销。在 API 计费场景下,可有效控制每次调用的平均 token 成本。
- 增强产品差异化:与现有固定“读取-思考”范式模型相比,AdaSR 的自适应思考能力可成为技术卖点,比如支持“流式答案”新形态,边推理解读边输出片段,再在末尾给出总结。
与现有产品/工作流的接口
AdaSR 可作为一个推理策略层插入现有 LLM 服务 pipeline:
- 推理引擎(如 vLLM、TGI)可将流式输入分块传入 AdaSR 策略控制器,控制器决定是否在当前块触发流式推理,并控制解码步数;流结束后再启动深度推理。
- 奖励设计中的格式与准确性奖励可直接与现有 RLHF 或 GRPO 训练管线对齐,无需大幅修改训练框架。
- 可替代当前基于 SFT 的流式推理方法(如 StreamingLLM 的部分实现),通过强化学习获得更灵活的时序分配策略,直接提升现有流式应用的性能。
具体落地 Use Case
- 实时智能客服:电商平台或企业服务的对话机器人,用户输入问题时常分段描述,AdaSR 能在用户输入到一半时就启动思维链判定意图(如“这是个退货问题”),并生成追问以澄清细节,待用户补全信息后再做深度推理给出最终解决方案。这种模式可将平均问题解决时间缩短 20% 以上,同时减少无效计算。
- 自动体育解说:针对直播视频流,模型需要在每个动作发生后快速生成解说词,同时保持对比赛整体形势的理解。AdaSR 的流式推理阶段可低延迟产出事件描述,深度推理阶段每若干秒刷新全局总结(如比分趋势),实现解说词的高时效和高质量平衡。
局限
- - **奖励函数设计复杂且敏感**:HRPO 整合了格式、准确性与自适应思考奖励,权重需要人工设定,且论文附录虽做了超参数敏感性分析,但仍可能存在 **reward hacking** 风险——模型可能学到表面符合格式与低延迟但损害深层推理的策略。在动态流式场景下,奖励函数的迁移性尚不明确,面向新任务时可能需要大量调参。 - **实验任务与基线单一**:当前评估主要集中在数学推理任务,尽管声称适用于音视频流,但未展示此类高噪声、长时流输入下的性能。对比方法主要为 **SFT 基线**,未与同期其他流式推理策略(如基于规则或自适应计算的 RL 方法)进行公平对比,限制了关于 **HRPO 相对优势** 的严格结论。 - **流延迟分析假设过于理想**:论文的延迟模型基于令牌级计算时间估计,但真实流式服务中,网络抖动、批处理动态、解码策略等都会引入额外延迟。当前分析可能低估了实际部署中计算分配策略的次优性,也缺少对端到端系统开销的测量。