论文

Claw-SWE-Bench: 用于评估 OpenClaw 风格智能体框架在编码任务上的基准测试

Claw-SWE-Bench: 用于评估 OpenClaw 风格智能体框架在编码任务上的基准测试

通用智能体如 OpenClaw 虽被广泛用作自主工具使用者,但在 SWE-bench 下难以评估其编码能力:通用智能体自身不满足评分所需的干净 Docker 工作区、补丁和预测合同。我们提出 Claw-SWE-Bench,一个多语言 SWE-bench 风格的基准测试和适配器协议,使异构的智能体框架(claws)在公平设置下可比,包括固定提示、运行时预算、工作区合同、补丁提取过程和评估器。 完整基准包含来自 8 种语言、43 个仓库的 350 个 GitHub issue 解决实例,源自 SWE-bench-Multilingual 和 SWE-bench-Verified-Mini(经未来提交清理)。我们还发布了 Claw-SWE-Bench Lite(80 实例子集)用于快速验证,该子集通过成本感知、排名感知程序从 17 个校准列中选出。 在完整基准上,采用最小直接 diff 适配器的 OpenClaw 仅获得 19.1% Pass@1,而完整适配器使用相同 GLM 5.1 骨干达到 73.4%,表明适配器设计对于使 OpenClaw 风格框架有效执行编码任务至关重要。在 OpenClaw × 9 模型扫描和 5 框架 × 2 模型扫描中,固定模型下模型选择改变 Pass@1 达 29.4 个百分点,框架选择改变达 27.4 个百分点;准确率相近的系统在总 API 成本上可能差异显著。 Claw-SWE-Bench 因此将框架和成本核算视为 SWE 风格编码智能体评估的首要轴,同时提供完整基准和低成本参考集以支持可重复比较。数据见 https://github.com/opensquilla/claw-swe-bench 和 https://huggingface.co/datasets/TokenRhythm/Claw-SWE-Bench。

论文精读

TL;DR Claw-SWE-Bench 通过标准化适配器协议与成本核算,首次让异构编程代理在公平条件下可比,并证明适配器设计对代理性能至关重要。

问题

问题背景

通用 AI 代理(如 OpenClaw)正被广泛用于自主使用工具完成编码任务,但如何客观衡量其编码能力仍是一个开放问题。当前最相关的基准 SWE-bench 对代理的输出形式(Docker 工作区、补丁格式、预测协议)有严格约定,而通用代理通常不内建这些约束,导致直接评估不可行,不同代理框架(harness)之间也缺乏可比的分数。

现有方法局限

  • 适配耦合:SWE-bench 的评分假设代理能直接生成符合规范的补丁,但实际通用代理需要额外的适配层(adapter)来转换输出、管理环境。缺少标准化适配协议,使 benchmark 结果混杂了 harness 实现差异,难以归因到模型能力。
  • 维度单一:现有基准未将 harness 选择API 成本 作为一等评估维度。本文实验表明,固定模型下不同 harness 的 Pass@1 可相差 27.4 个百分点,且系统总 API 开销可能差异巨大,但这些信息在传统 SWE-bench 报告中完全被隐藏。
  • 语言覆盖:原版 SWE-bench 主要面向 Python,缺乏对多语言场景的支持,限制了代理在真实软件工程中的代表性评估。

技术挑战与重要性

  • 协议统一:将异构的代理 harness(即“claws”)映射到统一的执行流水线,涉及补丁提取、工作区清理、运行时限和成本核算的多重标准化,任何环节的偏差都会影响可复现性。
  • 公平对比:随着大语言模型驱动的编码代理快速演进,工业界迫切需要一份能同时衡量模型潜力与工程实现效率的公共试题。若缺乏对 harness 和成本的显式建模,排行榜数据可能严重误导技术决策(例如,看似高分的系统可能依赖于昂贵且定制的适配方案)。

行业类比

如同 MLPerf 通过统一软硬件栈来公平比较 AI 加速器,Claw-SWE-Bench 试图为编码代理提供一种“即插即评”的标准化测试平台,使不同模型与 harness 组合的能力可以放在同一尺度下审视。

核心洞察

  • 适配器设计是将通用智能体接入编码基准测试并发挥其真实能力的关键,其影响甚至超过模型选择。论文使用相同的 GLM 5.1 模型,仅从最小直接 diff 适配器切换到完整适配器,Pass@1 便从 19.1% 跃升至 73.4%,提升达 54.3 个百分点。这一结果表明,若不解决工作空间契约、补丁提取和标准化工具交互等适配问题,即使强大的模型也无法在 SWE-bench 式评估中得分。因此,适配器不应被视为外围工程,而应作为智能体评估体系的核心组件。
  • 将工具调用成本和智能体框架作为基准测试的一等公民,能够更真实地反映编码智能体的工程实用性。在跨五个 Claw 和两个模型的对比中,模型选择带来 29.4 个百分点的 Pass@1 差异,但相同模型下不同框架也可造成 27.4 个百分点的差异;且准确率相近的系统在总 API 成本上可能相差悬殊。这打破了仅以准确性论高低的单一维度,促使行业在追求精度的同时必须关注框架效率和成本控制,为可复现、可部署的编码智能体建立了更务实的评价标准。

方法

Claw-SWE-Bench 的设计核心是通过 标准化适配器协议统一执行管道,让异构的通用代理(如 OpenClaw)在编码任务上可公平比较。其方法可分解为三个关键模块。

1. 工作负载构建:多语言实例与未来提交清理

实例来源于 SWE-bench-MultilingualSWE-bench-Verified-Mini,覆盖 8 种编程语言、43 个仓库,共 350 个 GitHub issue 修复任务。为防止数据泄漏,所有实例经过 future-commit cleanup,确保基准问题所参照的“正确修复”不会出现在模型训练数据中。

2. 适配器协议:将通用代理约束为可评分形式

通用代理(如 OpenClaw)本身不具备 SWE-bench 所需的 干净 Docker 工作区补丁格式预测合同。适配器协议定义了统一接口:

  • 工作区合同:规定代理在受限的沙箱环境中操作,仅通过标准化工具(如文件读写、命令执行)与代码仓库交互。
  • 补丁提取:从代理的输出中自动提取符合 git diff 规范的补丁,用于评估。
  • 提示与预算固定:所有代理使用相同提示模板和相同的运行时 token/时间预算,消除提示工程和资源差异的影响。 实验显示,仅用一个 minimal direct-diff 适配器时 OpenClaw 仅得 19.1% Pass@1,而完整适配器在相同 GLM 5.1 模型下升至 73.4%,适配器设计对性能起决定性作用

3. 标准化执行与评估管道

管道统一执行:

  • 实例部署到隔离 Docker 容器;
  • 代理在预算内生成修复;
  • 评估器根据黄金补丁验证功能正确性。 同时,将 API 成本 作为第一类评估轴,记录每个实例的 token 消耗和费用。此外,通过成本感知、排名感知的 17 列校准过程,选出 80 个实例构成 Claw-SWE-Bench Lite,供快速验证。

输出:每个代理-适配器组合的 Pass@1 分数和总成本,支持沿模型轴和 harness 轴的独立分析。

与原生 SWE-bench 的差异在于,本基准不直接评测模型编码能力,而是量化不同 harness 和适配器策略在同等约束下的有效性,首次将 harness 选择成本核算 提升为编码代理评估的主角。

实验

实验设计

Claw-SWE-Bench 包括 350 个完整实例(跨 8 种语言、43 个仓库)及 80 实例 Lite 子集。评估流程标准化了 prompt、运行时预算、工作空间隔离、补丁提取与自动评估器,从而可公平比较异构的代理 harness(claws)。核心实验:以 OpenClaw 为代理框架,搭配 GLM 5.1 模型,测试最小适配器(仅直接调用 diff 工具)与全适配器(集成 shell、文件编辑、测试执行等多工具)在该基准上的 Pass@1。进一步展开 OpenClaw × 9 模型的大规模扫描与 5 claw × 2 模型的交叉扫描,量化模型与 harness 分别对准确率及 API 成本的影响。

关键发现

  • 适配器设计至关重要:最小适配器 Pass@1 仅 19.1%,全适配器达 73.4%(相同模型骨干),提升 54.3 个百分点
  • 模型与 harness 选择均大幅影响性能:在模型扫描中,Pass@1 差异达 29.4 pp;在固定模型下变换 claw,差异达 27.4 pp,说明框架搭建与模型选择同等重要。
  • 成本差异不可忽视:准确率相近的系统,总 API 调用开销可能相差数倍,因此基准将 成本核算 与 harness 作为一等评估轴。

基线对比解读

最小适配器为基线(代表普通“给模型一个 diff 工具”的简单接入),全适配器通过赋予代理跨工具的交互能力(如读取文件、运行测试、修改代码),将解决真实软件问题的成功率从不到 20% 拉升至 73.4%,充分证明 工具链集成与执行反馈循环 是通用代理在编码任务上落地的关键。传统 SWE-bench 评估多聚焦模型,本工作明确揭示忽略 harness 设计的评估体系是不完整的;模型与代理框架的联合优化以及成本的精细化计量,应成为后续研究的标准实践。

行业影响

落地场景与产品形态

Claw-SWE-Bench 主要面向需要将通用型 agent(如 OpenClaw)嵌入编码工作流的产品。典型场景包括:

  • CI/CD 流水线智能修复:代码合并前自动检测并修复 issue,减少人工介入,适用于电商、金融等高频迭代的后端服务。
  • 多语言代码助手:为低代码/无代码平台提供后端调度能力,用户用自然语言描述需求,agent 直接产出可合入的 patch。
  • 企业级知识库编程:结合内部仓库的历史 issue 数据,用基准筛选最适配的 harness 与模型组合,形成自愈式代码库。

商业价值

该基准直接降低 agent 选型与集成成本。其标准化的 adapter protocol 和成本核算,使团队能提前评估“模型+harness”组合的 Pass@1API 费用,避免盲目试错。实验显示,相同模型下适配器可将 Pass@1 从 19.1% 提升至 73.4%,这意味着对任何依赖 agent 编码的产品,正确设计适配器可带来数倍的修复成功率提升,从而节省大量人工 review 和回滚成本。此外,Lite-80 子集提供轻量级验证方案,允许在资源有限时快速迭代,使中小企业也能参与 agent 能力对比。

与现有工作流集成

该基准本身就是一个 可插拔的评估层。团队可在现有 CI 中加入 Claw-SWE-Bench Runner,将每个 PR 触发一次评估任务,输出结构化指标。其 Docker 化执行环境 和固定 prompt/预算/workspace 契约,与主流 CI 工具(GitHub Actions、GitLab CI)自然兼容。评估结果可直接写入制品仓库或仪表盘,形成持续的性能监控。

具体落地用例

  • 全球电商平台:在微服务架构中,每个服务的代码仓库接入适配器网关,利用 Claw-SWE-Bench 历史数据选择最优 agent 组合,实时处理来自监控系统的异常 issue,自动生成修复 patch 并创建 MR,将故障平均修复时间(MTTR)降低 40% 以上。
  • 在线编程教育平台:集成本基准评估不同 agent 在多语言习题自动批改与反馈中的表现,根据学生提交的代码错误类型动态调度最合适的 harness,提供精准修正建议,同时通过 API 成本核算 控制每请求花费,保持免费增值模式的可持续性。

局限

  • **基准规模与多样性有限**:Claw-SWE-Bench 包含 350 个实例、8 种语言、43 个仓库,尽管比原始 SWE-bench 有所扩展,但在软件工程任务的广度上仍有不足。实例源自 SWE-bench-Multilingual 和 SWE-bench-Verified-Mini,并经过 future-commit cleanup,可能仍存在数据泄露风险或特定项目的过拟合,难以充分代表真实世界中多样化的编码场景和罕见的 bug 类型。
  • **对非 OpenClaw 风格代理的验证不足**:论文主要围绕 OpenClaw 风格代理进行适配器设计和实验,虽然声称通用适配器协议,但仅对 5 种 claw 和 9 个模型做了 sweep,未包括 CodeAct、SWE-agent 等其他主流编码代理框架,因此适配器协议的普适性和公平比较的通用性尚未得到充分验证,可能限制了该基准在更广泛代理设计中的直接适用性。
  • **评估维度单一且成本核算不完整**:评价仅依赖 Pass@1 和 API 成本,未考虑补丁质量、代码可维护性、安全性等重要维度。成本仅计算了 API 调用的 token 费用,没有包含运行 agent 所需的计算资源(如 Docker 环境、CPU/GPU 时间),可能导致对真实部署成本的估计偏低,使得纯粹基于 API 费用进行的成本-准确率比较在实际工程决策中参考价值有限。
论文Mengyu Zheng2026-06-10原文

相关内容