JIT-Agent: 通过即时 Harness 进化扩展 Harness 智能
Agent 的能力并非仅由模型决定。Agent harness(智能体框架),涵盖记忆管理、规划策略、动作协议以及工具/技能编排,往往比底层基础模型贡献更大。然而,harness 的设计仍依赖人工、针对特定任务,且从根本上难以扩展。为此,我们提出 JIT-Agent,一个可训练的 harness 智能模型,能够为任意现成的 Agent 大语言模型(LLM)即时合成任务自适应的 harness。 我们将 agent harness 形式化为一个可组合、可机器生成的工件,由固定的四模块协议支配。JIT-Agent 针对给定任务定制 harness,修复 harness 以保证稳定可靠运行,并通过从不断扩展的历史 harness 配置库中提炼性能信号实现自我进化。借助 JIT-Agent 作为 harness 助手, - DeepSeek-V4-Flash 在 DeepSearchQA 上超越 GPT-5.6(+9.1),在 OdysseyBench 上超越 +4.3; - 本就强大的 GLM-5.2 额外提升高达 +20.2 分。 在受控评估中,JIT-Agent 生成的 harness 在性能上与 OpenCode、Claude Code 等成熟 agent 运行时相当,并持续改进 DeepSeek V4、Mimo-V2.5、Qwen3.6 等多尺度模型系列。据我们所知,JIT-Agent 是首个专为即时 harness 生成而构建的模型,将 harness 智能确立为一个可训练、可迁移且可复合的维度,正交于模型扩展。
论文精读
TL;DR JIT-Agent 训练一个 harness 智能模型,为任意现成 agentic LLM 即时合成任务自适应的 agent harness,使 DeepSeek-V4-Flash 超越 GPT-5.6,GLM-5.2 最高提升 20.2 分。
问题
问题背景
当前 AI agent 研究关注如何在不改变基础模型的前提下提升任务表现。agent harness (包含内存管理、规划策略、动作协议、工具编排) 对最终性能影响显著。
现有方法局限
主流做法仍以人工设计为主,针对特定任务编写固定 harness,难以泛化到新任务或不同模型。Ahead-of-Time (AOT) 框架如 OpenCode、Claude Code 功能成熟但配置固化,调整成本高;手动优化需要领域专家反复试错,无法规模化。现有自动方法多局限于单一维度(如仅优化 prompt 或工具选择),缺乏对整个 harness 的全局搜索和生成能力。
为什么这个问题难/重要
harness 组合空间巨大,各模块相互耦合,需要平衡性能、可靠性和 token 成本。任务类型和 backbone 模型差异导致“最优”配置高度动态,需要实时生成和修复机制。业界对 agent 系统的可扩展性和成本效率要求越来越高,harness intelligence 作为可训练、可迁移、可复合的新维度,与模型扩展正交,有望成为提升 agent 能力的另一条低成本路径。
行业类比
类似编译器后端优化针对不同硬件即时生成代码:JIT-Agent 为不同任务和模型即时生成专用执行环境,替代通用框架的“一刀切”。
核心洞察
- JIT-Agent 的核心洞察是把 agent harness 从手工工程问题转化为可学习的生成问题,即训练一个专门的“harness 智能模型”为任意 LLM 即时合成任务自适应的执行框架。与 DSPy 等优化提示或工具选择的自动化框架不同,JIT-Agent 生成的是涵盖记忆、规划、动作协议和工具编排的整体 harness,并通过三阶段训练(定制、修复、自进化)使其具备泛化和持续改进能力,而非静态搜索或规则配置。
- 另一关键洞察是 harness intelligence 可以作为与模型 scaling 正交的独立扩展维度,通过 harness 的迁移复用提升不同基础模型的 agentic 能力。实验显示 JIT-Agent 生成的 harness 能让 DeepSeek-V4-Flash 超越 GPT-5.6,并一致提升 DeepSeek V4、Mimo-V2.5、Qwen3.6 等多尺度模型家族,证明 harness 优化无需微调 backbone,提供了一种低成本、可叠加的性能提升路径,与单纯扩大模型参数形成互补。
方法
输入与总体框架
JIT-Agent 接收两个核心输入:任务描述 与任意现成的 agentic LLM(如 DeepSeek-V4-Flash、GLM-5.2)。其目标不是微调底层模型,而是为当前任务即时合成一个任务自适应 agent harness,该 harness 由固定的四模块协议管理:记忆管理、规划策略、动作协议、工具/技能编排。
关键模块:统一 Harness 代码库与 HarnessFactory
JIT-Agent 将 harness 形式化为可组合、机器可生成的工件。核心基础设施是一个统一代码库,包含:
- 模块化 Harness 设计空间:每个模块(记忆、规划、动作、工具)都定义了可配置的子组件和参数。
- HarnessFactory:根据任务和模型特征,从设计空间中选取并组合模块,生成可执行的 harness 代码或配置。
训练三阶段:定制 → 修复 → 进化
训练 pipeline 分三个阶段,让 JIT-Agent 逐步获得完整的 harness 智能:
- Stage I: Customizing Harness
给定任务和模型,训练 JIT-Agent 生成初始 harness 配置,目标是最大化任务性能。数据来自预收集的 (任务, 最优 harness) 对。 - Stage II: Repairing Harness
在初始 harness 执行失败或不稳定时,训练模型对 harness 进行修复,例如调整模块参数或替换子组件,以提高可靠性和执行稳定性。 - Stage III: Learning to Evolve Harness
从不断扩展的历史 harness 配置档案中蒸馏性能信号,使模型学会根据新任务自适应地改进先前 harness,形成持续进化能力。
推理架构
推理阶段支持两种模式:
- 静态推理:一次性生成完整 harness,然后交给底层 LLM 执行任务。
- 流式推理:在任务执行过程中逐步生成或调整 harness,适应动态变化。
输出
最终输出是一个可直接用于底层 LLM 的 harness 工件(代码或结构化配置),该 harness 封装了任务所需的记忆、规划、动作和工具编排逻辑。
与同类方法的差异
与依赖人工设计或任务特定优化 harness 的现有方法(如 OpenCode、Claude Code 等固定运行时)不同,JIT-Agent 是首个专门为即时 harness 生成训练的模型,将 harness 智能定位为可训练、可迁移、可与模型扩展正交的复合能力维度。
实验
实验设计
JIT-Agent 作为 harness helper,与多类 backbone 模型配合,在 DeepSearchQA 和 OdysseyBench 两个基准上评测。对比对象包括原始 backbone(无 harness 辅助)、GPT-5.6、以及成熟的 agent runtimes(OpenCode、Claude Code)。同时,在不同模型家族(DeepSeek V4、Mimo-V2.5、Qwen3.6)上验证泛化性,并覆盖静态与流式推理模式。
关键发现
- 配备 JIT-Agent 后,DeepSeek-V4-Flash 在 DeepSearchQA 上超越 GPT-5.6(+9.1),在 OdysseyBench 上提升 +4.3。
- 原本已较强的 GLM-5.2 获得最高 +20.2 的提升。
- 生成的 harness 与 OpenCode、Claude Code 等成熟运行时性能相当,且跨模型家族一致提升。
与基线对比的深度解读
JIT-Agent 展现出的提升并非依赖特定模型,而是通过 harness 智能 这一正交维度实现。与手工设计、任务特定的 harness 相比,JIT 生成的 harness 可即时定制、修复和演化,摆脱了人工调整的不可扩展性。这验证了 harness 本身可作为可训练、可迁移、可累积的能力源,为 agent 工程提供新的 scaling 路径。
行业影响
JIT-Agent 将 agent harness 从手工设计变为即时生成的模型能力,可显著降低 agent 落地门槛。
落地场景
- 企业级 agent 平台:如客服自动化、IT 运维、数据分析助手,可根据用户查询实时生成最优记忆、规划、工具调用策略。
- 软件开发 agent:类似 OpenCode / Claude Code 的编码助手,可动态调整代码导航、测试执行与调试流程。
- 垂直行业:例如电商平台中,针对不同商品品类动态切换查询、推荐、售后处理逻辑;内容平台中,根据内容类型(图文 / 视频 / 直播)生成适配的审核或生成管道。
商业价值
- 降本:省去大量 prompt engineer 或 harness 设计人力;JIT 生成可复用档案,随着任务积累,生成质量提高,边际成本递减。
- 增效:在 DeepSearchQA、OdysseyBench 等基准上,同一 backbone 加持 JIT 后平均提升 4-9 分,直接改善任务成功率与吞吐。
- 体验提升:响应更稳定,减少因 harness 不适配导致的错误重试,降低延迟。
集成接口
- 以轻量级 API 或本地模型形式部署,接收任务描述、可用工具列表、backbone 模型信息,输出 JSON 格式 harness 配置。
- 可插入现有 agent 框架(如 LangGraph、AutoGen)的 harness 层,在任务开始时调用
generate_harness(),并在执行失败时调用repair_harness()。 - 支持 streaming inference,可与流式 agent 交互兼容,无需大幅重构现有 pipeline。
具体用例:某电商平台在促销节日期间,用户咨询量激增,JIT-Agent 可以为订单查询、退换货、物流跟踪等不同意图动态生成专属 harness,让同一 LLM 在不同场景下都保持高准确率与低 token 消耗。另一用例:内容平台的自动化审核流水线中,针对短视频、长图文、直播弹幕等格式差异,JIT-Agent 即时生成不同的审核策略与工具调用图,提高审核效率与一致性。
局限
- 实验评估的 backbone 模型范围可能有限:尽管测试了 DeepSeek V4、Mimo-V2.5、Qwen3.6 等模型家族,但未覆盖更多不同类型的 agentic LLM(如 Claude、Gemini)作为 backbone,也未测试极端规模差异(如小型模型)。此外,基准 DeepSearchQA 和 OdysseyBench 主要面向深度搜索和推理任务,可能无法全面反映真实世界 agent 任务多样性。
- JIT-Agent 生成 harness 的运行时开销未被充分讨论:虽然提到 token and cost efficiency,但没有详细分析 JIT-Agent 在推理时生成 harness 的延迟和计算成本,这对于实时应用至关重要。特别是在 streaming inference 架构下,可能增加了额外延迟。与预定义 harness 相比,动态生成可能带来更高的部署复杂度。
- 自我进化阶段可能存在分布漂移风险:通过从先前 harness 配置档案中蒸馏性能信号进行自我进化,可能导致模型过度适应特定任务分布,或在连续部署中积累偏差。论文未明确如何防止过拟合或确保生成 harness 的稳健性,尤其是面对分布外任务时。