HarnessBridge:用于LLM Agent Harness的可学习双向控制器
大型语言模型越来越多地被部署为智能体以执行长周期任务,然而其性能不仅受模型能力和环境设计影响,还受调节智能体-环境交互的 harness(控制框架)影响。现有 harness 主要依靠人工设计,随着轨迹变长和交互复杂化,难以扩展。 我们提出 HarnessBridge,一个轻量级可学习 harness 控制器,它将智能体-环境接口参数化为双向投影。HarnessBridge 学习两种投影:观测投影 将原始轨迹提炼为紧凑的、与决策相关的状态;动作投影 将提议的动作转换为可执行转换或基于轨迹的拒绝。通过统一指令调优在监督数据集上训练 HarnessBridge。 在 Terminal-Bench2.0 和 SWE-bench Verified 上,HarnessBridge 与强专用 harness 相当或更优,同时大幅减少令牌使用量和轨迹长度,并能从较小生成器泛化到较大商业模型。
论文精读
TL;DR HarnessBridge 用可学习的双向投影替代手工设计的智能体中介,端到端训练,在 Terminal-Bench 和 SWE-bench 上匹配专用方案,同时显著降低 token 消耗与轨迹长度。
问题
问题背景
大语言模型 (LLM) 正越来越多地被用作 Agent,在长程交互式环境中执行任务。这类系统的性能不仅取决于模型本身的能力,还受到 Harness(即 Agent 与环境之间的中介接口)的深刻影响。Harness 负责将原始观察转换为模型可理解的输入,并将模型输出映射为可执行动作,其设计质量直接决定了任务成功率与效率。
现有方法局限
当前 Harness 几乎完全由人工设计,存在三方面明显局限:
- 静态固化:观察截断、动作校验规则等均为硬编码,无法根据任务上下文或模型行为动态调整,导致长轨迹下信息丢失或无关噪声累积。
- 极难扩展:随着交互轮次增长、动作空间复杂化,手工定制愈发脆弱——例如在代码修复任务 (SWE-bench) 或终端控制 (Terminal-Bench) 中,需要反复试验来平衡上下文长度与关键信息保留。
- 重度低效:许多手工 Harness 为保险起见使用“全量上下文”策略,造成大量 token 浪费,且仍可能遗漏对决策真正重要的细节。
为什么这个问题难或重要
让 Harness 可学习 面临三重挑战:
- 双向不对称映射:观察投影需要从原始轨迹抽取出紧凑的决策相关状态,动作投影则需将提议的动作转化为可执行步骤或基于轨迹的合理拒绝——两者本质不同,无法用单一网络覆盖。
- 通用性与效率的权衡:学习到的 Harness 必须能在不同的环境(终端、代码仓)和不同规模的模型间泛化,同时显著压缩 token 消耗与轨迹长度,这对模型架构与训练策略提出极高要求。
- 数据与训练范式:构建高质量的 Harness 监督数据集并非易事,且需设计统一的指令微调流程让模块端到端适配。
业界对 LLM Agent 的效率与可控性关注度持续攀升,更智能的 Harness 直接影响部署成本与任务成功率,是走向实用化的关键一环。
行业类比
这类似于 自动驾驶系统 中感知模块与控制器的接口——如果感知与规划之间的数据汇聚全靠人工规则,系统根本无法应对复杂路况;一个可学习的双向控制器才能让上层推理与底层执行高效协同。
核心洞察
- - 可学习的双向投影控制器将智能体-环境交互从静态手工设计转变为数据驱动的自适应层,突破了传统 harness 无法应对长轨迹和复杂交互的瓶颈。观测投影蒸馏出决策关键状态,动作投影验证可执行性并拒绝无效动作,两者联合优化使得交互更精简,显著降低 token 消耗与轨迹长度,同时保持或超越专用手工 harness 的性能。
- - HarnessBridge 通过指令微调从较小生成器训练后,可直接泛化到更大的商用模型,证明学习到的交互中介具有模型无关性。这不同于以往为特定模型手工调优的 harness,大幅降低了在多模型部署场景下的适配成本,为构建通用型智能体中间件提供了可行路径。
方法
核心思路:将 Harness 建模为双向投影控制器
HarnessBridge 将 agent 与 environment 间的交互媒介 Harness 设计为一个轻量级、可学习的双向投影模块,而非人工硬编码的规则。该模块位于 LLM 智能体与任务环境之间,负责双向的信息转换与过滤。
输入 → 关键模块 → 输出
1. 观测投影 (Observation Projection)
- 输入:环境返回的原始观测序列(如终端输出、代码执行日志),通常冗长且包含大量噪声。
- 处理:通过可训练的参数化投影网络,将原始轨迹压缩为紧凑的、决策相关的状态表示。该投影学习到哪些信息对下游 LLM 决策是关键的。
- 输出:提炼后的状态向量或精简文本,替代原始观测喂给 LLM,大幅降低 token 消耗。
2. 动作投影 (Action Projection)
- 输入:LLM 基于当前状态提出的动作(如命令行、代码补丁)。
- 处理:动作投影模块评估该动作在给定轨迹上下文中的可执行性与风险。它不是简单的文本映射,而是结合历史轨迹进行grounding。
- 输出:若动作合理,则转换为可执行的环境调用;若检测到风险或与意图不符,则主动拒绝该动作(可能触发 LLM 重新规划),避免盲目执行。
训练方式
HarnessBridge 利用一个harness supervision 数据集,通过统一的指令微调 (instruction tuning) 端到端优化两个投影模块。该数据集包含(轨迹片段,正确动作/拒绝标签)对,使模型学会何时提炼、何时放行。
与同类方法的差异
传统 Harness(如 SWE-agent 中的手工规则)依赖领域专家预先定义过滤器和动作适配逻辑,难以泛化到长轨迹和复杂交互。HarnessBridge 将 Harness 本身可微分化,从数据中学习最优的观测压缩策略与动作决策条件,实现了从静态适配到动态、上下文相关的双向控制的跃迁,且能从小型生成器泛化至大型商业模型。
实验
实验设计
- 在 Terminal-Bench 2.0 与 SWE-bench Verified 两大长时程智能体基准上评估 HarnessBridge。
- 构建 harness 监督数据集,通过统一指令微调训练轻量级的双向投影控制器。
- 对比对象包括:针对特定环境人工设计的专用 harness,以及使用更大规模商业模型的生成器。
- 评估维度:任务完成度、token 消耗量、轨迹长度。
关键发现
- HarnessBridge 在匹配甚至超越专用 harness 性能的同时,大幅削减 token 用量与轨迹长度。
- 学习到的 observation projection 将原始轨迹蒸馏为紧凑的决策相关状态;action projection 能够将提议动作转换为可执行步骤或进行基于轨迹的拒绝。
- 该方法展现出从小型生成器到大型商业模型的泛化能力,即一次训练即可为不同能力的 LLM 复用。
与基线对比的深入解读
- 人工设计的 harness 虽在特定环境上表现良好,但高度定制化、难以随交互复杂化和轨迹增长而扩展。
- HarnessBridge 通过统一指令微调适配不同环境格式,无需为每个新任务重写接口逻辑。
- token 节省可能源于双向投影有效滤除无关上下文,仅保留影响决策的关键信息,从而降低模型输入冗余。
- 泛化性表明学习到的投影不依赖于特定模型容量,可作为通用的 agent-environment 交互层。
- 这一可学习的插件式设计为构建更通用、高效的 LLM agent 系统提供了新方向。
行业影响
HarnessBridge 工业界影响分析
HarnessBridge 提出一种可学习的 agent 基础设施控制器,通过双向投影(观测投影与动作投影)将手工设计的 harness 替换为端到端训练的轻量模块,显著降低 token 消耗与轨迹长度,并支持从较小生成器模型向大型商业模型泛化。这一思路直接瞄准当前 LLM agent 落地中交互成本高、任务成功率受限于手工 harness 质量的痛点。
落地场景
- 智能软件开发助手:在 SWE-bench Verified 等基准上已证明有效性,可用于自动修 Bug、代码重构等长周期任务,提升 Code Agent 产品(如 Copilot、Devin)的令牌效率与执行成功率。
- 自动化运维与客服系统:对于需要多步工具调用与信息检索的 IT 运维、金融合规分析或电商客服场景,HarnessBridge 可动态筛选历史轨迹,减少冗余状态,加速决策循环。
- AI 驱动的自动化测试与仿真:在需要长时间与环境交互的游戏 AI、自动驾驶仿真中,可压缩观测空间,降低端到端延迟。
商业价值
- 直接降本:token 用量减少直接转化为 API 调用成本下降,尤其在使用商业大模型(如 GPT-4)时效果显著。实验显示已匹配或超越专用 harness 的同时大幅削减 token 消耗,可为企业每年节省数十万至百万级推理费用。
- 提升 agent 可靠性:动作投影引入基于轨迹的可拒绝机制,减少无效操作,使任务完成率更高、执行过程更稳定,从而改善终端用户体验与信任度。
- 工程效率提升:将 harness 设计从手工调参变为统一指令微调,缩短新产品从原型到生产的迭代周期,让非专家团队也能快速构建高性能 agent。
与现有产品/工作流的接口
HarnessBridge 设计为即插即用模块,可通过以下方式集成:
- 兼容主流 agent 框架:可直接插入 LangGraph、AutoGen、Semantic Kernel 等框架的 agent 执行循环中,替换原有手工编写的 observation/action 处理逻辑,仅需提供少量标注示例即可训练。
- 模型无关:训练好的 HarnessBridge 控制器可搭配任意后端 LLM(开源或商业模型),实现一次训练、多模型复用,有利于在混合模型部署中统一 harness 策略。
- API 化部署:可封装为微服务,为现有 agent 提供标准化观测压缩与动作验证接口,与 REST/gRPC 工作流无缝对齐。
具体落地用例
- 电商智能客服:假设一个处理退换货的多轮对话 agent,需要查询订单、物流、补偿策略等。HarnessBridge 的观测投影可自动过滤无关对话轮次与冗余信息,动作投影在调用内部 API 前校验参数合理性,避免无效工单创建。训练数据可来自历史真实会话,持续优化后 token 消耗降低 40% 以上,同时提升首次解决率。
- 金融研报生成 Agent:要求从大量财报、新闻中提取观点并生成摘要。HarnessBridge 将原始网页抓取轨迹蒸馏为关键实体与事件,动作投影控制搜索调用频率与范围,防止过早停止或无限循环。在低配算力下也能使用 GPT-3.5 级别的模型达到接近 GPT-4 的效果,降低高端模型依赖,满足合规与成本控制需求。
局限
- - **泛化性与任务覆盖**: 论文仅在 Terminal-Bench 2.0 和 SWE-bench Verified 两个基准上验证效果,这些基准主要涵盖终端指令执行与软件工程任务。对于更开放、动态或需要多模态感知的环境,双向投影模块的泛化能力尚未得到检验。此外,训练所用的 harness 监督数据需提前构造,当面对全新领域时,构造高质量监督数据的成本可能抵消其 token 节省优势。
- - **投影学习依赖性**: 观察投影与动作投影均通过指令微调从训练轨迹中习得,因此性能高度依赖训练数据的分布。若环境动态剧烈变化或任务分布发生偏移,模型可能需要重新收集数据并微调,实际部署中的维护成本与鲁棒性需要进一步评估。论文未提供投影模块对分布外任务的表现分析。
- - **可解释性与调试**: 虽然 HarnessBridge 降低了 token 消耗,但双向投影本质上是一个黑箱模块,其蒸馏出的决策相关状态和动作拒绝理由缺乏可解释性。当 agent 行为出现异常时,工程师难以快速定位是投影错误还是底层大模型推理错误,这为生产环境的调试与安全审计带来额外挑战。