Harness-1: 使用外部化状态绑带的搜索代理的强化学习
问题:搜索代理常被训练为在增长记录上的策略,模型需同时决策如何搜索、记忆已见内容、证据有用性、开放约束及已验证声明。这种设定将过多日常状态管理置于策略内,强化学习被迫优化语义搜索决策与可恢复的簿记,而环境本可更可靠地维护后者。 方法:我们提出 Harness-1,一个 20B 参数 的搜索代理(检索子代理),在状态化搜索绑带内通过强化学习训练。绑带维护环境侧工作记忆,包括 候选池、重要性标记精选集、紧凑证据链接、验证记录、压缩去重观察及预算感知上下文渲染。策略保留语义决策:搜索什么、保留或丢弃哪些文档、验证什么以及何时停止。 实验:在 8个检索基准(涵盖网页、金融、专利、多跳问答)上,Harness-1 达到 0.730 平均精选召回率,超过最强开源搜索子代理 +11.4 个点,并与更大的前沿模型搜索器竞争。在保留的迁移基准上优势尤其显著,表明基于显式搜索状态的强化学习可产生超越训练领域的检索行为。代码已开源。
论文精读
TL;DR Harness-1 将搜索状态外化至环境,使 20B 智能体专注语义决策,RL 训练后以 0.730 平均精选召回率大幅超越开源竞品,并展现出强泛化性。
问题
问题背景
搜索智能体(search agents)正逐渐成为复杂信息获取任务的核心范式,特别是在多跳问答(multi-hop QA)、网络检索、金融和专利分析等场景中。这类智能体需要在多轮交互中规划查询、筛选证据、验证声明并动态调整搜索策略。当前研究热点在于如何通过强化学习(RL)训练出能自主决策的高效检索策略,以替代硬编码的启发式规则。
现有方法的局限
主流的搜索智能体通常将策略定义在持续增长的对话转录(transcript) 上:模型必须一边决定下一步搜索动作,一边在上下文中维护已看到的内容、有效证据、待验证的声明以及未解决的约束。这种设计将语义决策与状态簿记强行耦合在策略模型内部。对于 RL 训练而言,这带来两个核心问题:
- 优化目标混杂:RL 既要优化搜索行为的质量(如选择关键词、判断文档相关性),又要优化可恢复的簿记工作(如记录已读文档、避免重复)。后者本质上是确定性的环境功能,用学习信号去驱动不仅低效,还可能引入噪声。
- 长程依赖脆弱:多步搜索中,策略容易遗忘早期发现的关键证据或重复已完成的验证步骤,导致探索低效、决策失误,最终损害检索召回率。
难度与重要性
将搜索中的状态管理外化(state externalization) 是一个被低估但至关重要的方向。技术上,挑战在于如何设计一套通用的、环境端的工作记忆机制,既能泛化到不同领域,又不过度限定策略本身的可表达性。同时,RL 训练框架需要与这种有状态环境无缝对接,让策略专注于“在哪里搜”、“保留什么”、“何时停止”等语义级决策。业界关注度持续升温的原因是,RAG 系统、智能文档处理、企业知识库等应用都依赖检索子系统的精度和鲁棒性,而统一的搜索智能体有望减少针对每个任务单独调优的成本,并提升跨域泛化能力。
行业类比
这类似于现代编译器将寄存器分配交给编译器后端(环境)自动处理,而不是要求高层程序(策略)手动管理物理寄存器;通过分离关注点,既简化了上层逻辑,又保障了底层执行的可靠性。
核心洞察
- 将工作记忆与语义决策解耦,使强化学习专注优化搜索策略本身。传统搜索代理将状态记忆、证据跟踪等簿记任务内化到策略中,迫使 RL 同时学习语义和可恢复的环境操作,导致样本效率低且泛化弱。Harness-1 通过环境侧维护候选池、验证记录等显式状态,让策略只决定“搜什么、留什么、何时停”,这种职责分离不仅释放了模型容量,还使 RL 奖励信号更干净,从而在相同模型规模下获得显著的检索性能提升和跨域迁移能力。
- 显式状态抽象为搜索 Agent 提供了可泛化的行为基元。尽管仅在有限领域训练,Harness-1 在迁移基准上依然保持领先,表明 RL 学到的验证、去重、预算感知等行为并非依赖特定训练分布,而是来自状态空间中可组合的通用操作。这种设计让较小模型(20B)得以逼近更大前沿模型的搜索能力,为构建高效、可扩展的检索子系统提供了新的工程范式:通过环境状态定义而非数据规模来驱动泛化。
方法
Harness-1 的核心思路是将搜索代理的状态管理从策略内部剥离到外部工具(harness),让策略专注于语义决策。系统由两个部分构成:一个 20B 参数的语言模型策略,和一个维护环境端工作记忆的 有状态搜索 harness。
输入与整体流程
给定用户查询,harness 初始化空的工作记忆:候选池、精选集、证据链接、验证记录等。每一步,策略根据 harness 渲染的预算感知上下文(精简、去重、带重要性标记的观察)生成动作,例如:发出子查询、选取文档加入精选集、触发验证或声明停止。harness 执行动作,更新内部状态(去重、整理证据、压缩候选),并返回新的观察。最终输出为精选文档集合,评测指标采用 curated recall。
关键模块:状态化的搜索 harness
- 工作记忆部件:候选池存放检索到的文档;精选集(curated set)保存策略认为相关的文档,并附重要性标签;证据链接记录声明与文档的对应关系;验证记录追踪已核验的事实。
- 状态压缩与隔离:harness 自动完成观察压缩、去重、证据去噪等簿记操作,这些本在传统做法中需策略自行记忆。上下文渲染器还控制传入策略的 token 数量,避免预算溢出。
- 环境侧可靠性:排序、缓存、约束跟踪等可由确定性程序完成,比将其嵌入策略随机行为更稳定。
训练:强化学习优化语义决策
策略通过强化学习训练,奖励基于最终精选召回质量。由于状态管理已外包,策略的学习目标聚焦于“何时搜索、如何筛选、怎样验证、何时停止”等高层决策,避免了传统方法中 RL 需同时优化语义搜索和机械记忆的问题。训练数据覆盖 web、金融、专利、多跳 QA 等多领域,但学习到的行为展现出跨领域泛化能力。
与同类方法的差异
传统搜索代理(如 ReAct、ReST 等)将整个历史转录作为策略上下文,迫使语言模型同时充当决策者和记事本。Harness-1 将状态维护完全交给外部的 harness,使策略成为纯粹的语义决策器,从而提升搜索策略的训练效率和跨域泛化性。
实验
实验设计
Harness-1 在 8 个检索基准上评估,覆盖 网页搜索、金融问答、专利检索 和 多跳推理 等域。所有实验均使用 状态感知搜索框架(stateful harness),将环境簿记(候选池、已核实记录、去重观测等)外部化,策略模型仅保留语义决策(搜什么、保留/丢弃文档、何时停止)。主要指标为 curated recall,对比对象包括最强开源检索子代理及参数量更大的前沿模型搜索器,并专门测试了留出迁移基准以考察泛化能力。
关键发现
Harness-1(20B)取得 0.730 的 curated recall,比最强开源子代理高出 +11.4 点,且与远大于其参数量的前沿模型搜索器表现相当。迁移基准上的优势尤为突出,表明在显式搜索状态上做强化学习能学到跨域泛化的检索行为,而非依赖训练域捷径。此外,分离环境簿记后,RL 优化更聚焦于语义理解与搜索策略,避免了大量可恢复状态维护对策略梯度的干扰。
与基线对比的深度解读
传统搜索代理将完整对话历史作为策略输入,RL 需同时学习搜索决策和状态管理(如记忆已读文档、追踪未验证声明)。这种混合迫使策略在报酬稀疏的 episode 中自行维护长程一致性,极易陷入低效探索。Harness-1 将 工作记忆外部化,让环境承担确定性的簿记任务,策略只需回答“下一步查什么”——这实质是在 更纯净的马尔可夫状态空间 中进行决策。与最强开源基线相比,这种设计不依赖更大模型或更多算力,而是通过状态抽象缩小 RL 的搜索空间,从而提升样本效率和最终策略的健壮性。所得的大幅提升(+11.4)证明:对于需要多轮交互的检索任务,将状态管理与决策分离 是一条高性价比的架构方向,尤其适合资源受限或需要跨场景快速适配的工程场景。
行业影响
落地场景
Harness-1 作为一个 20B 的有状态搜索代理,可嵌入需要多跳检索与证据验证的场景:
- RAG 系统:在问答、客户支持中,代理维护工作记忆以高效筛选、验证文档,生成带引用的回答。
- 企业搜索:知识库、内部文档的语义探索,代理自动过滤僵死信息,仅保留关键证据,提升搜索精度。
- 电商 / 内容推荐:多步查询下,代理根据用户意图动态调整候选池,验证商品属性或内容一致性,提供可解释结果。
- 金融 / 专利分析:需可验证的检索记录,Harness-1 的验证记录与证据链接可直接作为审计轨迹。
商业价值
- 降本:自动完成原本人工执行的证据筛选与验证,减少后处理工时。
- 增收:更精准的检索结果提升转化率(如电商推荐)或决策效率(如研报生成)。
- 体验提升:用户获得带来源、可追溯的答案,增强信任;在合规场景中,验证记录降低人工审核成本。
与现有产品 / 工作流的接口
Harness-1 设计为检索子代理,可集成到现成的 Agent 框架:
- 接收自然语言查询,通过标准 API(如搜索调用接口)与环境交互。
- 与 LangChain、LlamaIndex 等编排层衔接,作为 RAG Pipeline 的替换组件。
- 部署为独立微服务,输入查询,输出
(精选结果, 证据链接, 验证记录)结构,下游模块可直接使用。
具体落地 Use Case
- 电商搜索:用户查询"适合摄影师的轻便笔记本电脑",代理多跳搜索候选型号,维护重要性标记,验证参数(重量、显卡)与评测一致性,最终返回精选清单并附引用来源。
- 金融研报:分析师提问"某公司过去三年营收增长率",代理从财报、新闻、行业报告中检索,维护证据链,验证数字冲突,输出摘要并标注可靠出处。
局限
- - **环境状态设计特定性强**:Harness-1 将状态显式化为候选池、整理集、证据链接和验证记录等组件,这种划分高度依赖对检索任务的先验理解(如多跳 QA、事实验证),虽然被在 8 个基准上验证,但这些基准大多结构化或半结构化,其泛化到开放域对话式检索、多模态检索或实时变化的知识源的能力尚未检验。若切换到新场景,工程师可能需要重新设计状态 schema,带来额外的工程成本。
- - **RL 训练计算开销大且未详述**:20B 参数的模型在状态模拟环境中进行强化学习,需要大量与环境交互的 rollout,这可能导致训练时间与资源需求显著高于监督微调或提示式搜索。论文未给出训练细节(如 GPU 天数、环境交互次数),对资源受限的应用团队而言,是否值得为 recall 提升付出额外成本仍存疑。
- - **仅聚焦检索子代理,未覆盖完整搜索系统**:Harness-1 作为 retrieval subagent,将语义决策(何时搜索、保留哪些文档、何时停止)留给策略,而将状态管理交给环境,但真实搜索系统往往涉及多步推理、工具调用、结果合成等,这些环节未在本工作中被验证。另外,尽管在开源代理中领先 +11.4 点,但相较于更大的 frontier-model searchers 只是“有竞争力”,绝对性能差距依然存在,限制了其在某些高精度场景的直接替代性。