去中心化多智能体系统与共享上下文
多智能体系统 (MAS) 通过在测试时将复杂问题分解为并行子任务来扩展大语言模型的推理能力。然而,现有 MAS 大多依赖集中式编排,即由主智能体分配工作、收集输出并合并结果。随着子任务数量的增长,这一控制器成为通信和集成的瓶颈。 我们提出 DeLM (Decentralized Language Models) 框架,通过并行智能体、共享已验证的上下文字段和任务队列实现去中心化协调。智能体异步认领子任务、读取累积进度、执行局部推理并写回紧凑的已验证更新。共享上下文字段作为通用通信介质,使智能体能够基于彼此的验证进展进行构建,而无需通过中央控制器路由每次更新。 实验表明,DeLM 在软件工程测试时扩展和长上下文推理上均有显著提升。在 SWE-bench Verified 中,DeLM 在 Avg.@1、Pass@2 和 Pass@4 上均取得最优性能,相比最强基线提升高达 10.5 个百分点,同时每任务成本降低约 50%。在 LongBench-v2 多文档问答中,DeLM 在四个前沿模型系列中取得最高平均准确率,相比最强基线提升最多 5.7 个百分点。代码已开源。
论文精读
TL;DR DeLM 通过共享验证上下文和任务队列实现无中心控制器的多智能体异步协作,解除单点瓶颈,在软件工程和长上下文推理上性能提升显著且成本减半。
问题
问题背景
随着大语言模型 (LLM) 在复杂推理任务中的应用不断深入,多智能体系统 (Multi-Agent Systems, MAS) 通过将问题分解为并行子任务实现测试时扩展 (test-time scaling),已成为提升推理能力的关键范式。业界普遍关注如何通过多个 LLM agent 协同工作来突破单模型能力上限。
现有方法局限
当前主流 MAS 框架普遍采用集中式编排 (centralized orchestration) 架构:一个主控 agent 负责任务分配、结果收集与最终合并。这种设计存在两个根本性技术瓶颈:
- 通信瓶颈:随着子任务数量增长,所有 agent 的中间结果必须路由至主控节点,导致通信开销线性增加,主控 agent 成为信息汇聚的单一故障点。
- 整合瓶颈:主控 agent 需要理解并融合来自不同 agent 的异构输出,其上下文窗口和处理能力限制了系统的可扩展性。当任务复杂度上升时,集中式调度器往往成为延迟和成本的放大器。
这些局限使得现有方法在面对大规模、长上下文的推理任务时,难以兼顾性能与效率。
为什么这个问题难且重要
挑战在于,去中心化协调 需要在没有全局编排的情况下,保证多个 agent 之间信息一致、无冲突地逐步推进推理过程。简单移除中心控制器会导致状态混乱和重复工作,而引入过于复杂的协商机制又会抵消去中心化带来的效率收益。
原作者指出:“共享上下文充当公共通信基质,使 agent 能够基于彼此已验证的进展构建推理,而无需将所有更新路由至中心控制器。”
这一问题的解决直接关系到 大模型推理系统的可扩展性 与 token 经济性。在软件工程、长文档问答等真实场景中,任务规模动态变化,要求系统既能并行加速,又能稳定收敛,且成本可控。业界对于在保持高性能的同时大幅降低每任务成本(如本文实现约 50% 成本削减)有着强烈需求。
行业类比
这类挑战与 分布式数据库系统 中的共享状态协调问题高度相似:多节点并发读写共享数据,需通过紧凑的日志 (gist) 与验证机制避免冲突,同时避免单点瓶颈,最终实现线性扩展。
核心洞察
- - DeLM 的核心创新是用**共享验证上下文**代替集中式编排。多个 agent 异步认领任务、读取累积进度、写入紧凑验证更新,无需中央控制器协调。与 AutoGen、MetaGPT 等依赖主 agent 派发合并的方案不同,DeLM 通过全局上下文实现并行协作,避免控制器成为通信和集成瓶颈。该设计天然可扩展,agent 数量增加不会线性恶化延迟,在 SWE-bench 和 LongBench-v2 上同时获得性能增益与约 50% 的成本降低。
- - DeLM 通过**验证准入**和层次压缩实现低通信开销的高可靠协作。只有通过验证的更新才写入共享上下文,防止错误累积;层次化摘要与选择性展开则将更新压缩为紧凑形式,大幅降低 token 消耗。相比单纯消息广播或路由的系统,这种机制使共享上下文保持全局一致性的同时避免冗余通信,是去中心化高效协作的关键,在 SWE-bench Verified 上以更低成本超越最强基线达 10.5 个百分点。
方法
输入:任务分解与队列初始化
复杂问题被预先分解为子任务列表,形成优先级感知的任务队列,初始共享上下文可容纳问题描述或为空。智能体并行启动,无中心调度器指派工作。
关键模块:去中心化协作与验证流
1. 并行智能体与任务认领
每个智能体自主从队列中拉取下一可用子任务,异步执行本地推理。任务间存在依赖时,队列根据共享上下文的完成状态动态调整顺序。
2. 共享验证上下文(Shared Verified Context)
全局上下文仅存储经过紧凑压缩与验证的更新条目,充当智能体间的隐式通信基底。智能体读取累积进展、写入自身发现,无需路由至中心节点,从根本上避免通信瓶颈。
3. 层次化压缩与准入验证(Compression & Verified Admission)
智能体完成子任务后,更新经历两阶段压缩:
S_i:面向引用的证据图(ref-grounded evidence map),保留关键信息的细粒度位置;G_i:极紧凑的共享上下文条目(如补丁摘要或答案片段)。
写入前,更新需通过准入验证:规则检查(如补丁是否通过关键测试、引用是否匹配原文)确保仅高质量内容进入共享状态,避免噪声累积。
4. 选择性解折叠(Selective Unfolding)
最终求解时,可调用 UNFOLD 将 G_i 恢复为 S_i,进一步 DEEP_UNFOLD 回溯至原始证据片段,支持可审计的答案生成。
输出与工程优化
所有子任务完成后,共享上下文聚合为完整解决方案(如代码补丁或多文档答案)。系统通过稳定共享上下文下的KV-cache重用和并发读写控制(concurrent admission & read/write discipline)大幅降低推理成本。
与同类方法的差异
不同于传统中心化多智能体系统依赖单一控制器汇聚与派发信息,DeLM 以共享上下文作为去中心化通信媒介,实现智能体间隐式协作,在扩展并行度的同时保持状态一致性,兼顾效率与准确度。
实验
实验设计
DeLM 在两个主线场景评估:软件工程测试时扩展和长上下文推理。
- SWE-bench Verified 包含真实 GitHub issue,需生成补丁修复;报告 Avg.@1、Pass@2、Pass@4 和成本。
- LongBench-v2 Multi-Doc QA 评估多文档问答能力,跨四类前沿模型族测量平均准确率。 基线包括当前最强的集中式多智能体系统和相关方法。DeLM 以并行、异步智能体配合共享验证上下文和任务队列工作,各智能体独立认领子任务、读写共享状态并局部推理。
关键发现
- SWE-bench Verified 上,DeLM 在所有指标(Avg.@1 / Pass@2 / Pass@4)均获最优,相对最强基线的增益最高 +10.5 pp,同时每任务成本降低约 50%。效率提升源于并行智能体通过共享失败互补、准入约束确保状态一致性以及紧凑补丁摘要传递发现。
- LongBench-v2 上,跨四个前沿模型族,DeLM 的平均准确率最高,相对最强基线提升最高 +5.7 pp。
- 消融分析表明:共享验证上下文、压缩摘要长度和入场验证机制各自对性能有显著贡献。选择性展开策略在保持信息保真度的同时控制上下文长度。
基线对比深度解读
现有集中式 MAS 依赖主控智能体分配、收集与合并结果,随子任务增多,主控成为通信和集成瓶颈,导致延迟上升与错误传播。DeLM 通过去中心化协调消除此瓶颈:
- 共享上下文作为公共通信基质,智能体直接读写已验证进展,无需逐次往返中央节点,降低通信开销且加速决策。
- 验证准入机制过滤低质量更新,避免噪声累积,保证共享状态可靠,使并行探索的收益最大化。
- 任务队列与异步执行允许动态负载均衡,在复杂任务上实现自然扩展。 结果上,DeLM 在扩展性、准确率和成本效率全面超越集中式基线,尤其在长上下文和代码修复任务中展现了去中心化架构的实用优势。
行业影响
落地场景
DeLM 的去中心化多智能体架构可直接应用于复杂软件工程调试与修复(如 GitHub issue 自动解决)、多文档长上下文问答(金融研报分析、法律文书交叉比对)、以及需要并行探索的大型代码库理解任务。在内容平台,DeLM 可用于自动化审核策略的分布式推理;在医疗领域,可支撑跨病历、文献的辅助诊断。
商业价值
DeLM 在 SWE-bench Verified 上实现最高 Avg.@1、Pass@2、Pass@4,较最强基线提升达 10.5 个百分点,同时每个任务成本降低约 50%,直接体现降本与增效双重价值。共享验证上下文 消除了中心化调度节点的通信瓶颈,使任务吞吐量随 agent 数量近乎线性扩展,适合大规模 SaaS 或私有化部署。在 LongBench-v2 多文档问答任务上,DeLM 跨四个前沿模型家族平均准确率最高,表明其可无缝嵌入不同模型基座,保护客户模型投资。
与现有产品 / 工作流的接口
DeLM 可视为对现有 Agent 框架(如 LangGraph、AutoGen)的协调层替换:保留原有工具调用与提示模板,将中心化 Orchestrator 替换为 共享上下文 + 任务队列 机制。具体集成点包括:
- 任务分解阶段 沿用现有 issue-to-subtask 拆分器;
- Agent 执行器 使用原有 LLM,仅需实现读取 / 写入共享上下文、认领队列任务的协议;
- 验证器 可集成现有 CI / 测试框架,实现“验证后准入”;
- KV-cache 复用 和依赖感知队列可对接推理引擎(vLLM、TGI)降低时延。
具体落地用例
- 金融研报自动分析:投资机构每日需处理数百篇研报。DeLM 将多文档拆分为并行子任务,agent 独立提取关键数据、验证一致性,写入共享上下文。最终生成无冲突的综合简报,比串行处理节省 60% 时间,且通过共享失败发现减少信息遗漏。
- 电商平台客服自动化:复杂售后场景涉及订单、支付、物流等多个子系统。DeLM 启用多个轻量 agent 并行查询各子系统、分享已验证结果,避免中心化调度节点堆积,在高并发下保持低延迟与高准确率。
局限
- - **任务分解依赖性**:DeLM 的前提是复杂问题可被分解为相对独立的子任务,且子任务间的协调能通过紧凑的验证更新完成。对于需要高度交织的交互式推理或存在复杂时序依赖的场景,共享上下文可能无法传递足够的全局视角,导致局部决策冲突或重复探索。此外,任务队列的依赖感知机制尚处于早期阶段,面对动态变化的任务图时调度策略可能不够鲁棒,限制了框架在开放域规划或科学发现等领域的适用性。
- - **通信压缩与信息损失**:DeLM 通过分层摘要和选择性展开在共享上下文中维护紧凑的已验证更新,但压缩强依赖摘要模型的保真度。当子任务涉及细粒度代码逻辑或长链证据时,摘要可能丢失关键细节,迫使后续智能体进行深度展开,增加延迟和计算开销。当前实验未充分探索不同摘要模型质量对最终性能的敏感性,且验证机制要求每一步更新都可自动检验,这排除了一些难以定义即时验证标准的推理任务。
- - **扩展性与模型限定**:DeLM 利用 KV-cache 复用和共享上下文稳定性的工程优化,但目前验证主要基于特定模型系列(如 GPT、Claude)和两个基准任务。对于大规模智能体数目(如数百个并行),共享上下文的读写一致性、锁竞争和内存占用可能成为新瓶颈。此外,去中心化架构虽避免了单点控制器,却增加了智能体之间的协调冗余,在通信开销较小的轻量任务上可能不如集中式方案高效。未来需要更多实验评估其在更广泛模型和任务上的成本效益边界。