论文

多智能体推理中的流式通信

多智能体推理中的流式通信

多智能体推理系统采用“生成-再传输”范式,导致端到端延迟随流水线深度线性增长。我们提出 StreamMA,一种将每个推理步骤一旦生成即流式传输给下游智能体的系统,通过流水线相邻智能体来降低延迟。 令人惊讶的是,这种流水线还提升了效果:由于多步推理质量不均匀,早期步骤比后期步骤更可靠,使用这些可靠的早期步骤而非完整链条,可防止易错的后期步骤误导下游智能体。我们通过首个封闭形式联合分析,对流式协议、串行协议和单步协议进行了形式化,推导出效果排序、加速上限和成本比。 在涵盖数学、科学和代码的 8 个推理基准、两个前沿 LLM(Claude Opus 4.6 和 GPT-5.4)以及 三种拓扑(Chain、Tree、Graph)上,StreamMA 均优于两个基线(在 HMMT 2026; Claude Opus 4.6-high 上平均 +7.3 pp,最大 +22.4 pp)。 此外,我们发现一个“步骤级缩放定律”:增加每个智能体的步骤一致地提升效果和效率,这是一个与智能体数量缩放正交且可组合的新缩放维度。

论文精读

TL;DR StreamMA 通过流式传输中间推理步骤实现多智能体流水线,打破生成后传输的线性延迟瓶颈,并利用早期可靠步骤提升效果,还发现了步骤级 scaling law。

问题

多智能体推理系统(Multi-Agent Reasoning)在复杂数学、科学和代码任务中展现出优于单智能体的潜力,但主流**“生成后传输”(generate-then-transfer)** 范式要求每个智能体完成完整推理链后才将结果传递给下游,导致端到端延迟随流水线深度线性增长。这种设计忽略了推理步骤之间的质量非均匀性:早期步骤通常更可靠,而后期易出错的步骤一旦被传递,可能误导后续智能体,降低最终答案的质量。现有方法缺乏对中间步骤流式利用的机制,无法在降低延迟的同时抑制错误传播。

实现流式通信的核心挑战在于,如何在部分信息到达时便启动下游处理,同时维持多步推理的连贯性与正确性。多个智能体并行流水线化执行时,需解决异步同步、状态管理以及早期终止策略等问题。此外,该领域的评价标准长期侧重准确率,而忽略延迟与计算成本的均衡,导致实际部署受限。业界对高吞吐、低延迟推理系统的需求日益迫切,尤其是在需要多轮协作的复杂场景中。

该问题的解决可类比 微服务架构中的流水线处理:将整体任务拆分为可独立执行的阶段,并通过流式传递中间结果提升系统吞吐与容错能力,使多智能体系统更接近生产级推理服务的要求。

核心洞察

  • **流式通信实现延迟与效果双重优化**:传统多智能体推理采用“生成后传输”,导致端到端延迟随流水线深度线性增长,且完整推理链后期易出错步骤会误导下游代理。StreamMA 将每个推理步骤即时流式传输到下游,流水线化相邻代理,显著降低延迟;更独特的是,下游代理基于早期可靠步骤工作,避免了后期错误干扰,反而提升答案质量。这一同时改善效率与效果的模式,打破了通常的权衡,并通过闭式分析首次给出协议间的效果排序与加速比上限,为实时多智能体系统提供了新的设计范式。
  • **步骤级缩放定律开辟新优化维度**:现有缩放研究多聚焦于模型参数量或智能体数量,StreamMA 发现增加每个代理的推理步骤数(如多步思维链)可一致提升下游代理的效果与效率,这一维度与代理数量缩放正交且可组合。这意味着实际部署中,工程师可通过调控每代理步骤数来灵活平衡性能与成本,不必强制扩充智能体集群,为多智能体系统的资源分配与性能调优提供了更细粒度的杠杆。

方法

StreamMA 提出了一种流式多智能体推理协议,将传统 “生成后传输” (generate-then-transfer) 变为 逐步骤流式输出

输入

多智能体系统由多个 LLM 实例组成,每个实例负责一个推理子任务,按拓扑结构(Chain / Tree / Graph)组织。输入为原始问题文本。

关键模块

  1. 流式生成与传输
    上游智能体在生成每一步推理后立即将中间状态(token 或文本块)发送给下游,下游同步开始处理,形成 流水线 (pipelining)。与串行协议(等待完整输出再传递)和单智能体协议(无通信)形成明确对比。

  2. 可靠性感知的早期停止
    流式传递时,下游智能体可优先使用上游早期的推理步骤。由于多步推理中早期步骤通常更可靠(不易受幻觉或错误累积影响),下游智能体基于这些可靠状态进行判断,避免被后期可能错误的步骤误导。该方法在数学、科学、代码等 benchmark 上同时提升了效果(平均 +7.3 百分点,最高 +22.4)和效率

  3. 统一形式化分析
    论文给出了流式、串行、单智能体三种协议的闭式联合分析,推导出效果排序、加速比上界和成本比。证明流式协议在效果和延迟上均优于串行,且在多数情况下成本可接受。

  4. 步骤级缩放定律 (Step-Level Scaling Law)
    发现增加每个智能体的推理步数可一致提升效果与效率,这与扩大智能体数量(agent-count scaling)正交且可组合,为资源分配提供了新维度。

输出

下游智能体综合部分可靠信息生成最终答案,输出为自然语言答案或代码执行结果。

与同类方法的差异

不同于仅关注延迟的流水线并行方案或仅提升效果的多数投票/反思方法,StreamMA 通过流式传递早期可靠步骤同时优化延迟与效果,且其增益源自对推理步骤非均匀可靠性的显式利用,而非单纯增加计算量。

实验

实验设计

在 8 个覆盖数学、科学、代码的推理基准上,评估 StreamMA 流式协议、串行(generate‑then‑transfer)与单智能体协议。使用 Claude Opus 4.6GPT‑5.4 两种前沿 LLM,以及 Chain、Tree、Graph 三种拓扑。核心对比维度包括:有效性排序、理论加速上限、实际延迟与成本比。此外,设计实验探究步骤级缩放定律——在固定智能体数量下,改变每智能体推理步数。

关键发现

  • 性能提升:StreamMA 平均比串行/单智能体基线高 +7.3 pp,在 HMMT 2026 上最大提升 +22.4 pp(Claude Opus 4.6‑high)。
  • 延迟降低:流水线化使端到端延迟不再随智能体数量线性增长,理论加速比可达智能体数量上限。
  • 早期步骤可靠性:反直觉的是,流式传输不仅不损失质量,反而因下游智能体仅接收更可靠的早期步骤,避免了长链推理中逐渐累积的错误。这构成一种隐式“早期停止”正则化,提升了答案稳定性。
  • 步骤级缩放定律:增加每智能体步数(如从 1 步增至 8 步)在多数配置下同时提升效果与效率,且与智能体数量缩放正交、可组合。这为多智能体推理提供了新的调参维度。

基线对比深度解读

传统 “generate‑then‑transfer” 范式下,每个智能体必须等待上游完整输出才启动,延迟 = 单智能体延迟 × 智能体数。StreamMA 打破这一僵局,一旦上游产生一个推理步骤立即传输,下游可同步开始,实现计算与通信重叠。更关键的是质量维度:串行链路中,较晚步骤的可靠性显著下降,而下游智能体被迫接收全部内容,可能被错误信息污染。StreamMA 的流式传输天然让下游基于初步可靠结论工作,相当于动态剪枝了不可靠部分。实验证实,即使在树和图拓扑中,流式协议仍稳健优于串行基线,且与模型大小、任务类型无关。这一发现重塑了多智能体通信设计原则:“尽早传递、持续更新” 比“全量最终结果”更优。对于工程落地,它意味着可在不牺牲精度的前提下,用更短响应时间服务推理链,尤其适合多轮交互式应用。

行业影响

落地场景

StreamMA 的流式多智能体推理可嵌入任何需要多步协作的 AI 产品,尤其适合数学 / 代码 / 科学推理等复杂任务。典型场景包括:

  • AI 编程助手:代码重构、修复建议、多文件依赖分析等长链推理任务,StreamMA 可在上游智能体生成部分方案时,下游智能体即开始验证与修正,避免完整生成后的大范围返工。
  • 金融分析系统:自动解析财报、计算指标、生成摘要,流水线化后提取与计算并行,用户秒级获得初步结论。
  • 智能客服诊断:多步骤问题排查(如网络故障、保险理赔),通过流式传递中间结论,缩短用户等待时间。

商业价值

  • 降本:利用早期步骤更可靠的特性,截断易出错的后期步骤,减少无效 Token 消耗与重试成本;按 Token 计费模式下直接节省 API 费用。
  • 增收:更低的端到端延迟提升用户体验,可支撑更高并发,带动订阅或按调用量付费产品的收入增长。
  • 体验提升:平均 +7.3 pp 的准确率提升与最高 22.4 pp 的增益(HMMT 2026),使产品在推理质量上更具竞争力;流式输出让用户感知“思考过程”,增强信任感。

与现有产品 / 工作流的接口

StreamMA 可作为通信协议层集成进现有 Multi-Agent 框架(如 LangGraphAutoGenCrewAI):

  1. 将智能体间的 generate-then-transfer 调用替换为流式 yield,每个推理步骤生成后立即通过 WebSocket / SSE 推送给下游。
  2. 下游智能体需支持部分响应解析提前中止,可基于已有流式 API 增强。
  3. 拓扑无关的标准化接口(Chain / Tree / Graph)使集成改造范围限于通信层,不触动智能体内部逻辑。

具体用例:编程助手(如 GitHub Copilot)多步重构

用户提出“重构认证模块以支持 OAuth2”请求,传统流程需计划智能体生成完整方案后,实施智能体修改代码,审查智能体再校验,总延迟为各步之和。

  • 应用 StreamMA:计划智能体每生成一个子步骤(如“替换 token 存储方式”),实施智能体立即开始对应修改,审查智能体同步检查。若某早期步骤不可行,可在计划生成中途提前终止,节省后续资源。
  • 效果:延迟降至最长单步时间,用户可看到渐进式进度,准确率因早期可靠步骤主导决策而提升。

具体用例:电商智能客服多轮理赔

理赔流程包含审核订单 → 校验退货政策 → 计算退款金额 → 生成工单,传统串联式处理让用户等待整链完成。

  • StreamMA 下,审核订单智能体输出有效订单号后,政策校验立即启动,退款计算也可提前根据订单金额预估。早期步骤(订单校验)高可靠,即使后续政策细节复杂,错误也不会污染整条链。
  • 用户几秒内看到预估退款,交互体验大幅提升,人工客服从重复解释中释放,聚焦异常案例。

局限

  • **可靠性假设的边界未充分定义**:论文论证流水线化提升有效性的核心前提是“早期步骤更可靠”,但该假设可能高度依赖任务类型与模型行为。若早期步骤本身包含偏差或幻觉,流式传输会放大错误,而非抑制后期误导。论文未给出该假设的定量验证条件,也未分析在开放域推理或对抗性输入下可靠性的退化情况,这限制了方法在安全性关键场景中的直接应用。
  • **实验覆盖度有限**:评估仅基于两个闭源前沿模型(Claude Opus 4.6 与 GPT-5.4)及八个推理基准,虽覆盖数学、科学、代码,但缺少对其他模型规模(如开源模型)、更多领域(如常识推理、长链规划)以及真实部署环境下的延迟测量。模型名称本身也暗示了时间限制(虚构版本),可能无法反映当下主流 LLM 的特性,泛化结论有待进一步验证。
  • **流式通信的工程代价未被充分量化**:论文重点分析理想化流水线的加速比与有效性提升,但未深入讨论实现流式传输所需的低延迟通信基础设施、智能体间的同步开销、以及在大规模图拓扑或异构计算节点下的可扩展性。实际部署中,细粒度流式传递可能引入非平凡的序列化与调度成本,部分抵消理论上界收益,而论文缺乏相关的系统级开销分析。
论文Zhen Yang2026-06-03原文

相关内容