论文

AREX: 迈向递归自我改进的深度研究智能体

AREX: 迈向递归自我改进的深度研究智能体

深度研究要求智能体找到同时满足多个约束的答案。发现这类答案代价高昂,而验证候选答案通常可分解为可处理的约束逐项检查。这种发现-验证的不对称性表明,研究智能体不应仅仅延长搜索时间,而应通过验证中间结果并利用部分验证状态来指导后续改进,从而递归地改进当前答案。 我们提出 AREX 系列 递归自我改进 深度研究智能体。AREX 交替进行内部研究循环(收集证据、构建临时答案)和外部自我改进循环(逐约束审计答案、识别未解决主张、发起定向后续研究)。为支撑长期递归自我改进,AREX 学习一个自主上下文更新工具,将不断增长的交互历史压缩为紧凑的改进状态,其中保留已验证证据和未解决约束,无需依赖外部模型。 我们通过 智能体中间训练 和 长时序强化学习,在验证的合成任务和高质量轨迹上训练 AREX。为缓解长时序学习中稀疏的最终奖励,我们强调获得决定性证据或纠正错误研究方向的关键步骤。我们实例化了密集的 4B 模型和 122B-A10B 混合专家模型。 在 BrowseComp、WideSearch、DeepSearchQA、Humanity's Last Exam (HLE) 及其他推理和工具使用基准上,AREX 大幅优于同等规模的基线,并与使用更多激活参数的模型保持竞争力。

论文精读

TL;DR AREX 提出递归自改进 (RSI) 深度研究 Agent,通过交替执行研究循环与约束审计循环,自主压缩长程上下文,并用关键步奖励强化学习提升搜索效率,在多个复杂基准上超越同规模模型。

问题

问题背景

当前,深度研究(Deep Research) 聚焦于让 AI 智能体在开放信息环境中,从海量非结构化数据中检索、推理并综合出满足多个复杂约束的答案,如 BrowseComp、Humanity's Last Exam 等基准所示。

现有方法局限

主流方法多采用“搜索 + 生成”的流水线,或在单一循环内反复延长推理链(如 OpenAI 的 deep research 风格),但存在明显技术缺陷:

  • 无视发现-验证不对称性:发现一个同时满足所有约束的答案需海量探索,而验证可逐条分解为独立检查,现有系统未能将验证信号系统性地反馈为改进方向。
  • 上下文爆炸与状态丢失:长时域交互会使上下文窗口过载,而简单的摘要会丢弃已验证的证据或未解决的约束,导致后续迭代重新犯错。
  • 稀疏奖励困境:仅以最终答案正确性为奖励,训练信号极其稀疏,智能体难以学会在关键步骤(如获取决定性证据、纠正错误方向)上分配算力。

为什么这个问题难且重要

深度研究任务的约束组合爆炸使纯粹的前向搜索不可行,递归自改进(Recursive Self-Improvement) 成为必然选择,但其实现面临两个核心挑战:

  1. 递归控制:如何将验证结果自动转化为有针对性的子任务,并记住已验证信息与未解决约束,避免循环论证。
  2. 训练稳定性:在长时域强化学习中,必须设计稠密奖励或关键步强调机制,否则模型难以收敛。 业界对能够自主进行多轮验证、回溯修正的智能体需求强烈,这直接关系到复杂问答、科学文献综合等高级认知任务的落地。

行业类比:如同软件工程中测试驱动开发(TDD)——先定义测试(约束),再迭代编写代码(答案),通过不断运行测试来驱动重构,直到所有测试通过;AREX 将约束视为“验证器”,驱动答案的递归精化。

核心洞察

  • **利用发现-验证不对称性实现递归自改进**:AREX 将深度研究建模为迭代的约束满足过程,交替执行证据收集的“内部研究循环”和逐约束审计的“外部自改进循环”。与现有工作通过单纯延长搜索时间或增大模型规模来提升深度研究能力不同,AREX 利用“发现答案代价高、而验证可分解为独立约束检查”这一不对称性,以已验证的部分结果指导后续改进,从而更高效地缩小答案空间,避免无效探索。
  • **学习自主上下文更新工具实现长程状态管理**:为支撑多轮递归改进,AREX 训练了一个压缩交互历史的上下文更新工具,将不断增长的对话记录转化为紧凑的改进状态,其中保留已验证证据与未解决约束,且无需外部模型辅助。这与常见的长上下文截断或外部摘要模型方案形成对比,降低了对外部模块的依赖,同时维持了跨轮次的信息连贯性,为长程深度研究任务提供了可部署的轻量级记忆机制。

方法

整体流程:递归自改进循环

AREX 将深度研究建模为双重循环交替的过程:

  1. 内层研究循环接收当前改进状态(包含已验证证据与未解决约束),调用工具(搜索、浏览等)收集证据,生成结构化暂定答案。
  2. 外层自改进循环对答案执行逐约束审计,识别未充分支撑的声明,形成新的改进状态并触发下一轮研究。

关键模块

  • 自主上下文更新:为避免长期研究时交互历史膨胀,AREX 学习了一个 context-update 工具,无需外部模型地将历史压缩为紧凑的改进状态。状态显式保留已验证证据和待解决约束,保证信息不丢失。
  • 结构化答案外化:内部循环生成的答案具有结构化格式,将复杂问题分解为可独立验证的子主张,便于审计器逐项检查。
  • 步骤感知强化学习:由于最终奖励高度稀疏,训练强调关键步骤——在获取决定性证据或纠正错误方向时注入额外奖励(step reward shaping);同时采用 Step-aware Group Policy Optimization 来稳定长周期学习。

训练数据与策略

  • 递归研究任务合成:自动生成多约束、需要交叉验证的复杂问题,确保任务本身要求迭代改进。
  • 教师轨迹收集:先使用强模型生成高质量研究轨迹,经质量控制后用作智能体中训练(agentic mid-training)的初始化,随后通过长周期 RL 进一步微调。
  • 渐进式多轮能力训练:分阶段引入多轮交互、上下文更新等能力,最后通过混合能力训练巩固。

差异点

相比现有深度研究代理(如仅延长搜索或依赖外部验证器),AREX 内置了递归验证驱动的改进机制,并通过可学习的上下文压缩维持长周期推理,无需远端大模型辅助,在效率与自主性上取得平衡。

实验

实验设计

AREX 的评估覆盖多个深度研究基准,包括 BrowseCompWideSearchDeepSearchQAHumanity's Last Exam (HLE) 以及若干推理与工具使用任务。对比基线主要为同等参数规模的模型,并考察与更大激活参数模型的竞争力。消融实验重点分析上下文更新行为递归自我改进的有效性、答案级置信度评分等机制。

关键发现

  1. 显著性能优势:AREX 在所有深度研究基准上大幅超越同等规模基线,且在部分任务上可与激活参数数倍于己的模型抗衡。
  2. 递归自我改进生效:外循环的约束级审计与定向后续研究使答案质量随改进迭代逐步提升,验证了“发现-验证”非对称性假设。
  3. 自主上下文更新工具:压缩交互历史为紧凑改进状态,无需外部模型,支撑长程自我改进不丢失已验证证据与未解决约束。
  4. 训练策略贡献:智能体中训练(agentic mid-training)与步骤感知的强化学习(step-aware RL)有效缓解了稀疏奖励问题,关键步骤强调(如证据获取或错误方向纠正)加速收敛。

与基线的深度对比

多数深度研究智能体仅通过延长搜索时间提升效果,未利用验证信号指导改进。AREX 通过内外循环交替将验证内化为研发控制闭环,其优势不仅来自更多计算,更源于结构化自我修正。与单纯扩大模型或激活参数规模的方法相比,AREX 以较小的激活参数量取得了竞争力,表明递归自我改进是提升研究智能体效率与上限的有效路径。上下文更新工具的消融显示,没有该工具时,长程任务性能显著下降,证实状态管理对持续自我改进至关重要。

行业影响

落地场景

AREX 的递归自改进范式可直接赋能需要多约束联合推理的深度研究场景:

  • 金融尽调:自动搜集并交叉验证企业多维度信息(财务、司法、舆情),持续修正不满足约束的论断,生成高置信度尽调报告。
  • 科研辅助:文献综述、实验条件验证等任务中,智能体可反复自检引用链与结论一致性,减少幻觉。
  • 电商选品:基于销量、评分、供应链等约束,迭代优化选品方案,动态搜索补充缺失信息。
  • 医疗证据综合:对临床研究进行多标准荟萃分析,自动发现并消解证据矛盾。

商业价值

降本:将分析师从繁复的信息收集与交叉验证中解放,单次复杂研究任务耗时可从小时级压缩至分钟级;自主上下文更新工具避免了长上下文 API 成本膨胀。 增收:在金融、咨询等高附加值行业,更快更准的深度报告直接提升服务吞吐量与客单价;内建可审计的验证链条增强客户信任。 体验提升:对外提供带有置信度评分和可追溯证据的答案,使非专业用户也能获得接近专家级的分析,扩大产品受众。

与现有产品/工作流的接口

AREX 可封装为 多工具智能体微服务

  • 集成方式:通过一组 API(搜索、爬虫、数据库查询、计算器)挂载到现有知识库或数据中台,内部维护压缩状态而非全量上下文,易于嵌入已有 RAG 或 Agent 框架。
  • 交互接口:接收自然语言研究问题,返回结构化答案、支持证据清单及约束满足状态报告,可直接对接到 BI 看板、客服工作台或报告生成系统。
  • 训练与迭代:利用平台已有的用户反馈日志生成约束式合成任务,持续通过关键步长奖励微调,实现领域适配。

具体用例

  • 金融领域:对冲基金部署 AREX,针对并购目标自动展开“财务异常→关联交易→负面舆情”的递归核查,输出可操作的风险摘要,替代初级分析师团队。
  • 电商领域:平台卖家服务嵌入 AREX,输入“寻找符合环保认证、退货率低于5%、近3个月增速超20%的户外灯具”,智能体自动爬取多平台数据并自我修正候选集,最终输出精选商品列表及验证依据。

局限

  • **训练数据依赖合成任务与高质量教师轨迹**,虽然通过 agentic mid-training 和 RL 提升了模型能力,但真实世界的深度研究任务多样性远超合成数据所能覆盖,模型在全新领域、噪声信息或对抗性场景中的泛化性未经验证。此外,教师轨迹的质量决定了行为克隆的上限,若教师策略本身有偏,递归自改进可能固化错误。
  • **递归自改进可能引入累积错误**。外循环通过对已生成答案进行逐约束审计并启动定向跟进研究,但审计自身并非完美,若某步验证错误地标记为已解决,后续改进将建立在错误前提上,最终答案质量反而降低。自主上下文更新工具通过压缩历史行为意图保持信息,但压缩过程中可能丢失关键的细粒度证据或约束关联,影响长期研究的一致性。
  • **计算效率与部署成本未充分讨论**。AREX 在推理时需要多次调用内部研究循环与外部自改进循环,上下文更新工具额外增加了推理开销。尽管模型规模被压缩到 4B 和 122B-A10B MoE,但相比单次生成或简单工具调用式研究 agent,其延迟和 token 消耗显著增加,论文未提供成本分析,限制了在资源敏感场景下的实用价值。
论文Shuqi Lu2026-07-23原文

相关内容