论文

JIT-Agent: 通过即时 Harness 进化扩展 Harness 智能

JIT-Agent: 通过即时 Harness 进化扩展 Harness 智能

Agent 的能力并非仅由模型决定。Agent harness(智能体框架),涵盖记忆管理、规划策略、动作协议以及工具/技能编排,往往比底层基础模型贡献更大。然而,harness 的设计仍依赖人工、针对特定任务,且从根本上难以扩展。为此,我们提出 JIT-Agent,一个可训练的 harness 智能模型,能够为任意现成的 Agent 大语言模型(LLM)即时合成任务自适应的 harness。 我们将 agent harness 形式化为一个可组合、可机器生成的工件,由固定的四模块协议支配。JIT-Agent 针对给定任务定制 harness,修复 harness 以保证稳定可靠运行,并通过从不断扩展的历史 harness 配置库中提炼性能信号实现自我进化。借助 JIT-Agent 作为 harness 助手, - DeepSeek-V4-Flash 在 DeepSearchQA 上超越 GPT-5.6(+9.1),在 OdysseyBench 上超越 +4.3; - 本就强大的 GLM-5.2 额外提升高达 +20.2 分。 在受控评估中,JIT-Agent 生成的 harness 在性能上与 OpenCode、Claude Code 等成熟 agent 运行时相当,并持续改进 DeepSeek V4、Mimo-V2.5、Qwen3.6 等多尺度模型系列。据我们所知,JIT-Agent 是首个专为即时 harness 生成而构建的模型,将 harness 智能确立为一个可训练、可迁移且可复合的维度,正交于模型扩展。

论文精读

TL;DR JIT-Agent 训练一个 harness 智能模型,为任意现成 agentic LLM 即时合成任务自适应的 agent harness,使 DeepSeek-V4-Flash 超越 GPT-5.6,GLM-5.2 最高提升 20.2 分。

问题

问题背景

当前 AI agent 研究关注如何在不改变基础模型的前提下提升任务表现。agent harness (包含内存管理、规划策略、动作协议、工具编排) 对最终性能影响显著。

现有方法局限

主流做法仍以人工设计为主,针对特定任务编写固定 harness,难以泛化到新任务或不同模型。Ahead-of-Time (AOT) 框架如 OpenCode、Claude Code 功能成熟但配置固化,调整成本高;手动优化需要领域专家反复试错,无法规模化。现有自动方法多局限于单一维度(如仅优化 prompt 或工具选择),缺乏对整个 harness 的全局搜索和生成能力。

为什么这个问题难/重要

harness 组合空间巨大,各模块相互耦合,需要平衡性能、可靠性和 token 成本。任务类型和 backbone 模型差异导致“最优”配置高度动态,需要实时生成和修复机制。业界对 agent 系统的可扩展性和成本效率要求越来越高,harness intelligence 作为可训练、可迁移、可复合的新维度,与模型扩展正交,有望成为提升 agent 能力的另一条低成本路径。

行业类比

类似编译器后端优化针对不同硬件即时生成代码:JIT-Agent 为不同任务和模型即时生成专用执行环境,替代通用框架的“一刀切”。

核心洞察

  • JIT-Agent 的核心洞察是把 agent harness 从手工工程问题转化为可学习的生成问题,即训练一个专门的“harness 智能模型”为任意 LLM 即时合成任务自适应的执行框架。与 DSPy 等优化提示或工具选择的自动化框架不同,JIT-Agent 生成的是涵盖记忆、规划、动作协议和工具编排的整体 harness,并通过三阶段训练(定制、修复、自进化)使其具备泛化和持续改进能力,而非静态搜索或规则配置。
  • 另一关键洞察是 harness intelligence 可以作为与模型 scaling 正交的独立扩展维度,通过 harness 的迁移复用提升不同基础模型的 agentic 能力。实验显示 JIT-Agent 生成的 harness 能让 DeepSeek-V4-Flash 超越 GPT-5.6,并一致提升 DeepSeek V4、Mimo-V2.5、Qwen3.6 等多尺度模型家族,证明 harness 优化无需微调 backbone,提供了一种低成本、可叠加的性能提升路径,与单纯扩大模型参数形成互补。

方法

输入与总体框架

JIT-Agent 接收两个核心输入:任务描述 与任意现成的 agentic LLM(如 DeepSeek-V4-Flash、GLM-5.2)。其目标不是微调底层模型,而是为当前任务即时合成一个任务自适应 agent harness,该 harness 由固定的四模块协议管理:记忆管理、规划策略、动作协议、工具/技能编排。

关键模块:统一 Harness 代码库与 HarnessFactory

JIT-Agent 将 harness 形式化为可组合、机器可生成的工件。核心基础设施是一个统一代码库,包含:

  • 模块化 Harness 设计空间:每个模块(记忆、规划、动作、工具)都定义了可配置的子组件和参数。
  • HarnessFactory:根据任务和模型特征,从设计空间中选取并组合模块,生成可执行的 harness 代码或配置。

训练三阶段:定制 → 修复 → 进化

训练 pipeline 分三个阶段,让 JIT-Agent 逐步获得完整的 harness 智能:

  1. Stage I: Customizing Harness
    给定任务和模型,训练 JIT-Agent 生成初始 harness 配置,目标是最大化任务性能。数据来自预收集的 (任务, 最优 harness) 对。
  2. Stage II: Repairing Harness
    在初始 harness 执行失败或不稳定时,训练模型对 harness 进行修复,例如调整模块参数或替换子组件,以提高可靠性和执行稳定性。
  3. Stage III: Learning to Evolve Harness
    从不断扩展的历史 harness 配置档案中蒸馏性能信号,使模型学会根据新任务自适应地改进先前 harness,形成持续进化能力。

推理架构

推理阶段支持两种模式:

  • 静态推理:一次性生成完整 harness,然后交给底层 LLM 执行任务。
  • 流式推理:在任务执行过程中逐步生成或调整 harness,适应动态变化。

输出

最终输出是一个可直接用于底层 LLM 的 harness 工件(代码或结构化配置),该 harness 封装了任务所需的记忆、规划、动作和工具编排逻辑。

与同类方法的差异

与依赖人工设计或任务特定优化 harness 的现有方法(如 OpenCode、Claude Code 等固定运行时)不同,JIT-Agent 是首个专门为即时 harness 生成训练的模型,将 harness 智能定位为可训练、可迁移、可与模型扩展正交的复合能力维度。

实验

实验设计

JIT-Agent 作为 harness helper,与多类 backbone 模型配合,在 DeepSearchQA 和 OdysseyBench 两个基准上评测。对比对象包括原始 backbone(无 harness 辅助)、GPT-5.6、以及成熟的 agent runtimes(OpenCode、Claude Code)。同时,在不同模型家族(DeepSeek V4、Mimo-V2.5、Qwen3.6)上验证泛化性,并覆盖静态与流式推理模式。

关键发现

  • 配备 JIT-Agent 后,DeepSeek-V4-Flash 在 DeepSearchQA 上超越 GPT-5.6(+9.1),在 OdysseyBench 上提升 +4.3。
  • 原本已较强的 GLM-5.2 获得最高 +20.2 的提升。
  • 生成的 harness 与 OpenCode、Claude Code 等成熟运行时性能相当,且跨模型家族一致提升。

与基线对比的深度解读

JIT-Agent 展现出的提升并非依赖特定模型,而是通过 harness 智能 这一正交维度实现。与手工设计、任务特定的 harness 相比,JIT 生成的 harness 可即时定制、修复和演化,摆脱了人工调整的不可扩展性。这验证了 harness 本身可作为可训练、可迁移、可累积的能力源,为 agent 工程提供新的 scaling 路径。

行业影响

JIT-Agent 将 agent harness 从手工设计变为即时生成的模型能力,可显著降低 agent 落地门槛。

落地场景

  • 企业级 agent 平台:如客服自动化、IT 运维、数据分析助手,可根据用户查询实时生成最优记忆、规划、工具调用策略。
  • 软件开发 agent:类似 OpenCode / Claude Code 的编码助手,可动态调整代码导航、测试执行与调试流程。
  • 垂直行业:例如电商平台中,针对不同商品品类动态切换查询、推荐、售后处理逻辑;内容平台中,根据内容类型(图文 / 视频 / 直播)生成适配的审核或生成管道。

商业价值

  • 降本:省去大量 prompt engineer 或 harness 设计人力;JIT 生成可复用档案,随着任务积累,生成质量提高,边际成本递减。
  • 增效:在 DeepSearchQA、OdysseyBench 等基准上,同一 backbone 加持 JIT 后平均提升 4-9 分,直接改善任务成功率与吞吐。
  • 体验提升:响应更稳定,减少因 harness 不适配导致的错误重试,降低延迟。

集成接口

  • 以轻量级 API 或本地模型形式部署,接收任务描述、可用工具列表、backbone 模型信息,输出 JSON 格式 harness 配置。
  • 可插入现有 agent 框架(如 LangGraph、AutoGen)的 harness 层,在任务开始时调用 generate_harness(),并在执行失败时调用 repair_harness()。
  • 支持 streaming inference,可与流式 agent 交互兼容,无需大幅重构现有 pipeline。

具体用例:某电商平台在促销节日期间,用户咨询量激增,JIT-Agent 可以为订单查询、退换货、物流跟踪等不同意图动态生成专属 harness,让同一 LLM 在不同场景下都保持高准确率与低 token 消耗。另一用例:内容平台的自动化审核流水线中,针对短视频、长图文、直播弹幕等格式差异,JIT-Agent 即时生成不同的审核策略与工具调用图,提高审核效率与一致性。

局限

  • 实验评估的 backbone 模型范围可能有限:尽管测试了 DeepSeek V4、Mimo-V2.5、Qwen3.6 等模型家族,但未覆盖更多不同类型的 agentic LLM(如 Claude、Gemini)作为 backbone,也未测试极端规模差异(如小型模型)。此外,基准 DeepSearchQA 和 OdysseyBench 主要面向深度搜索和推理任务,可能无法全面反映真实世界 agent 任务多样性。
  • JIT-Agent 生成 harness 的运行时开销未被充分讨论:虽然提到 token and cost efficiency,但没有详细分析 JIT-Agent 在推理时生成 harness 的延迟和计算成本,这对于实时应用至关重要。特别是在 streaming inference 架构下,可能增加了额外延迟。与预定义 harness 相比,动态生成可能带来更高的部署复杂度。
  • 自我进化阶段可能存在分布漂移风险:通过从先前 harness 配置档案中蒸馏性能信号进行自我进化,可能导致模型过度适应特定任务分布,或在连续部署中积累偏差。论文未明确如何防止过拟合或确保生成 harness 的稳健性,尤其是面对分布外任务时。
论文Guibin Zhang2026-08-26原文

相关内容