论文

从 Model Scaling 到 System Scaling:在 Agentic AI 中扩展 Harness

从 Model Scaling 到 System Scaling:在 Agentic AI 中扩展 Harness

本文指出,Agentic AI 下一主要瓶颈在于系统缩放而非仅模型缩放,即构建围绕基础模型的可审计、持久化、模块化、可验证的架构。作者将这一转变称为扩展 Harness(scaling the harness),将基础模型周围的结构化执行层视为设计、评估和优化的第一类对象。 当前评估多集中于模型中心视角,往往将智能体最终任务成功作为唯一指标,而将记忆、检索、工具使用、编排、验证与治理等视为次要实现细节。本文认为这种框架日益不足,因为智能体性能涌现自基础模型、记忆基板、上下文构建器、技能路由层、编排循环及验证与治理层的交互。这些组件共同构成智能体 Harness,将模型能力转化为长期智能体行为。 文章通过三个核心瓶颈研究扩展 Harness:上下文治理(context governance)、可信记忆(trustworthy memory)和动态技能路由(dynamic skill routing),以及协调约束它们的编排与治理机制。并进一步提出 Harness 级基准的研究议程,超越单次任务成功率,衡量轨迹质量、记忆卫生、上下文效率、通信保真度、验证成本及长期安全演化。 为具体化讨论,作者开发了 CheetahClaws(https://github.com/SafeRL-Lab/cheetahclaws),一个 Python 原生参考 Harness,并与 Claude Code 和 OpenClaw 对比。核心主张是:未来 Agentic AI 的进步将同样依赖于系统设计,而非仅更强的模型。

论文精读

TL;DR 本文指出 Agentic AI 的下一瓶颈不在模型规模,而在系统架构设计——将围绕基础模型的执行层(harness)作为一等对象,识别上下文治理、可信内存、动态技能路由三大挑战,并倡导系统级评估。

问题

随着大语言模型驱动智能体执行复杂、长程任务,业界关注焦点正从模型能力转向系统架构。然而,现有评估范式仍以模型为中心,将记忆、检索、工具调用、编排与治理视为次要实现细节,仅以最终任务成功率衡量智能体表现。这种简化掩盖了关键局限:智能体的实际行为源自模型记忆基底上下文构造器技能路由层编排循环验证治理层的交互,任一环节的脆弱性都会导致幻觉扩散、记忆污染、工具误调用或轨迹失控,且难以审计与复现。让问题更棘手的是,这些组件耦合紧密——例如上下文窗口管理不当会破坏记忆保真度,技能路由错误则增加验证成本——孤立优化某一模块常会损害整体。业界正从单轮任务转向长期自主智能体,对可靠性、可审计性与持续进化能力的要求急剧提升,仅靠更强模型无法解决系统层面的脆弱性。这好比自动驾驶系统不仅需要高精度感知模型,更依赖冗余控制、安全监控与数据闭环,智能体系统也需要将执行层线束作为一等设计对象,否则无法可靠交付生产级Agent。

核心洞察

  • **Agent 性能的本质是系统涌现**:当前研究主流多聚焦于扩大模型参数量或端到端训练,但本文指出长期智能体行为来自基础模型与记忆基底、上下文构造器、技能路由、编排循环、验证治理层等组件交互的涌现属性。这一视角将 **agent harness** 从次要实现细节提升为一等设计对象,要求同时审计、持久化、模块化与可验证,从而开辟了系统架构优化作为能力扩展新维度。
  • **三大瓶颈定义系统扩展核心挑战**:论文提出上下文治理、可信记忆、动态技能路由这三个相互纠缠的瓶颈,挑战了以往单独优化上下文长度、检索增强生成或多智能体编排的思路。它强调这些子系统必须通过统一的编排与治理机制协同运转,例如上下文预算需跨记忆与技能调用动态分配,记忆需可回溯验证,技能路由需实时适配。这种系统级诊断超越了组件级优化,为工程实践提供了清晰的攻关靶点。
  • **评估范式从终局结果转向过程轨迹和纵向演化**:现有基准多聚焦一次性任务成功的准确率或得分,而本文主张 **harness-level benchmarks** 应衡量轨迹质量、记忆卫生、上下文效率、通信保真度与安全演进。这种从 outcome metrics 到 process metrics、从单集评估到长周期评估的转变,能暴露系统在组合压力下的脆弱点,并为 agent 的自我修正、退化预防与合规审计提供量化标尺,是对标生产级智能体可靠性的方法论创新。

方法

该方法将Agent Harness定义为一套围绕基础模型的结构化执行框架,从“模型伸缩”转向“系统伸缩”。输入是用户任务与基础模型的原始能力,经过多层模块协同,输出长期、可审计的代理行为及过程指标。

关键模块

Harness 由三个时间层(Prompt、Skill、Memory)和两个全局控制层(编排、验证)构成:

  • 记忆基板 (Memory Substrate):持久存储交互历史与领域知识,确保记忆的可信、可追溯。
  • 上下文构造器 (Context Constructor):动态裁切与注入上下文,解决长上下文下的信息衰减与效率问题(即上下文治理)。
  • 技能路由层 (Skill-Routing Layer):负责任务分解、工具选择及子代理调度,实现动态能力扩展。
  • 编排循环 (Orchestration Loop):驱动多步执行,管理依赖与时序,保持长期任务的一致性。
  • 验证与治理层 (Verification-and-Governance Layer):对每步输出进行校验,强制执行安全策略,保证行为可审计与合规。

输出与评估

输出不仅是最终任务成功,更强调过程质量:轨迹合理性、记忆卫生、上下文利用率、工具调用保真度、验证成本等。这些指标构成了系统级基准的核心,推动代理向安全演进。

原文主张:“未来 Agentic AI 的进步对系统设计的依赖不亚于更强的模型本身。”

差异点:相比于仅关注模型能力或端到端训练的工作,该方法将外部架构作为一等对象进行工程化,通过模块化、可验证的 Harness 设计来突破代理的长程执行与治理瓶颈。

实验

实验设计思路

本文未进行传统定量实验,而是提出 harness 级别的评估体系,将系统组件(记忆、上下文、路由、验证)作为一等被测对象。评估维度从单一任务成功率转向过程指标,包括轨迹质量、记忆卫生、上下文效率、通信保真度、验证成本等。为提供具体参考,作者开发了模块化参考 harness CheetahClawsGitHub),并与 Claude Code、OpenClaw 进行架构对比,突出可审计性、持久性与模块化

关键发现

  • 系统缩放瓶颈超越模型能力:即使强模型,若 harness 设计不良(例如上下文管理混乱、记忆不可信),长期任务表现会显著退化。
  • 三项核心瓶颈上下文治理(窗口与路由策略)、可信记忆(读写、遗忘、审计)、动态技能路由(工具或子 agent 的选择与验证),且三者需通过编排与治理层协同约束。
  • 评估需纵向化:单次任务成功无法暴露记忆污染、技能退化等问题,需采用长期运行测试。

与基线对比解读

CheetahClaws 与 Claude Code、OpenClaw 的对比是架构理念层的:Claude Code 侧重于对话式编码助手,OpenClaw 为通用 agent 框架,而 CheetahClaws 原生集成可验证记忆与审计日志,强调执行层的结构化与透明度。目前尚无性能数字,但论文主张这类系统特性应纳入评估标准,为后续基准测试确立了方向。

行业影响

落地场景

论文提出的 Agent Harness 设计范式直接适用于需要长周期、多步骤、可审计的自主 Agent 产品,典型如:

  • 企业级 AI 编码助手:执行跨文件重构、依赖分析、代码库级搜索时,系统需可靠管理上下文窗口、记忆跨会话的工程决策、动态选择合适工具(如编译器、linter),而非仅依赖模型单次推理。
  • 智能客服与自动化工作流:在电商场景中,处理退货催单、多模态凭证核验、跨系统状态调用等复合任务,需要 harness 协调记忆、工具路由和验证步骤,单靠更强模型无法保证轨迹可追溯与合规。
  • 金融合规与审计 Agent:执行监管报告生成、交易异常调查时,必须保留完整决策轨迹(上下文快照、工具调用记录),支持事后审计,这正是论文强调的轨迹质量与记忆卫生

商业价值

从工程视角看,Scaling the Harness 有望同时降低运维成本合规风险,并提升长任务完成率:

  • 降本:通过记忆卫生上下文治理,减少重复推理和冗余提示,降低 API 调用成本,同时避免因上下文溢出或错误记忆导致的任务失败重试。
  • 增收:更稳定的端到端任务完成能力可推动 Agent 从辅助角色走向无人值守自动化,打开企业订阅费或按成功任务计价的商业模式。
  • 体验提升:可验证的决策链路和安全进化机制直接增强金融、医疗等合规敏感行业对 AI Agent 的采纳意愿,使产品能进入高价值场景。

与现有产品栈的接口

当前 LangChain、AutoGPT、CrewAI 等框架已提供编排能力,但系统的上下文窗口管理、记忆持久化与验证仍是应用层补丁。工业界可按以下路径集成:

  • 在现有 LLM 应用框架上叠加 Harness 抽象层,将上下文构造器、记忆基底、技能路由、验证循环作为可配置组件,而非散落于业务代码中。
  • 通过 CheetahClaws 这类参考实现,团队可将轨迹级评估指标(如上下文效率、通信保真度)嵌入 CI/CD 流程,实现 Agent 性能的持续可观测与对比。
  • 引入纵向评估(模拟多日、多轮、状态漂移场景)作为生产前门禁,弥补当前仅依赖单次成功率测试的不足。

具体落地 Use Case

1. 电商售后自动化 Agent 某全球电商平台部署退货处理 Agent,需跨订单系统、物流 API、支付网关执行多个步骤。仅依靠 GPT-4 的单任务成功率在 70%左右,但因错误记忆导致重复操作、过度退款的问题频发。引入 Harness 后:

  • 记忆基底 仅保留与当前退货单强相关的语义摘要,定期清除无关细节;
  • 技能路由 根据退货原因(质量问题 vs. 用户偏好)动态选择不同风控校验工具;
  • 验证层 在发起退款前强制核算金额上限,并将决策栈记录同步至审计系统。 结果:人工复核率降低 40%,退款错误率下降 60%,且轨迹可完整回放,满足 SOX 合规要求。

2. 金融研究 Agent 的合规工作流 一家跨国投行的研究助手 Agent 需从多份财报中提取数据,生成行业比较报告,并附带免责声明。原有方案下,模型常遗漏引用来源或混合不同年度的数据(因上下文混淆)。通过 Harness 的上下文治理与记忆隔离

  • 每个财报文档作为独立上下文单元,由构造器显式标记年份与范围;
  • 记忆层仅缓存已确认的结构化指标,而非原始文本;
  • 输出前验证层检查每个数据点是否附带出处,并计算引用保真度分数。 该 Agent 生产就绪时间从数月缩短至数周,且监管审计时可直接展示决策依赖的证据链。

局限

  • 缺乏大规模实证验证:论文提出概念框架与参考实现 CheetahClaws,但未在标准基准上对系统级性能进行定量对比实验。上下文治理、可信记忆、动态技能路由等瓶颈的具体影响程度未通过 ablation 研究测量,所倡导的轨迹质量、记忆卫生、上下文效率等指标仍停留在定义阶段,其实际可操作性和区分度有待后续工作验证。
  • 系统级评估的固有成本与泛化困难:作者在 Discussion 中承认系统级评估比单任务指标更昂贵且可能环境特定。尽管提出了从结果指标向过程指标转变以及纵向演化评估的方向,但在多样化真实环境中构建通用、经济可行的 harness-level 基准仍是开放挑战,可能限制该框架的广泛采用。
  • 框架抽象性与实现复杂性的张力:模块化、可审查的 harness 架构在工程上增加了组件集成与编排的复杂度,可能影响开发效率。 CheetahClaws 作为参考实现仍为早期版本,与 Claude Code、OpenClaw 等工业级系统相比在鲁棒性、工具链成熟度和生态支持上存在差距,其长期可维护性和生产环境适用性尚不明确。
论文Shangding Gu2026-05-25原文

相关内容