ClawProBench: 基于轨迹的 AI 智能体评估,具备运行时覆盖与冻结工作区风格保留集
现有智能体基准往往只评估最终答案,即便智能体运行在有状态运行时上。我们认为这低估了评估对象的复杂性:正确的评估单元应是模型加运行时的声明配置,其故障可能发生在证据获取、运行时路由、安全边界或重复执行中。我们提出 ClawProBench,一个面向运行时原生智能体评估的轨迹感知基准,实例化于 OpenClaw——一个提供工作区工具及浏览、记忆、消息、调度、技能和子代理等原生界面的实时智能体运行时。 ClawProBench 定义了两个赛道:包含 102 个场景的完整画像(full profile),涵盖实时工作区与原生运行时路由任务;以及包含 68 个场景的冻结保留集(frozen holdout),采用封闭世界 JSON 输出契约以实现稳健排名。试验通过安全门控公式从执行轨迹中评分,结合正确性、过程质量与效率,并保留故障证据以供审计。 我们评估了 68 个配置于完整画像,37 个配置于保留集。最高安全门控平均轨迹得分为 0.7671。原生运行时任务表现不如工作区实时任务(0.5238 对 0.6415)。在保留集上,pass@k-any 优于严格三次试验通过率(0.6638 对 0.2890),而完整画像与保留集的排名相关性较弱(Spearman 0.1300)。仅基于正确性的排名与过程感知、安全门控及严格通过视图存在显著差异。最终答案排行榜可能掩盖原生界面弱点、一次性成功及轨迹局部的智能体故障模式。
论文精读
TL;DR ClawProBench 通过执行轨迹评估 OpenClaw 运行时上的 agent 配置,包含 live/workspace 与 frozen holdout 双轨,实证最终答案排行榜会掩盖 native-surface 弱点和过程质量差异。
问题
问题背景
AI agent 评测正从单一模型能力转向 模型 + 工具运行时 的配置级评估,业界关注 agent 在真实有状态环境中的执行可靠性。
现有方法局限
传统 benchmark 通常只比较 final answer,即使 agent 运行在 stateful runtime 上:
- 无法检测证据获取失败、运行时路由错误、安全边界越界、重复执行不稳定等 trace-local 故障;
- leaderboard 排名基于最终正确性,掩盖了原生 surface 弱点与一次偶然成功;
- 缺乏 frozen holdout 的固定契约,跨 runtime 对比与排名稳健性不足。
为什么这个问题难/重要
Agent 故障可发生在推理-行动循环的任意环节,只有 execution trace 才能提供失败证据。但 trace 评价需要:
- 安全门控的评分公式,同时考虑正确性、过程质量与效率;
- 冻结的闭世界 JSON 输出契约,保证 holdout 排名可复现;
- 区分 pass@k-any 与 strict three-trial pass,反映真实可靠性。 这直接关系到生产环境中 agent 的可信部署与持续评测,业界对可审计、防污染的评测基础设施需求强烈。
行业类比
类似自动驾驶评测若只看是否到达终点,而忽略驾驶过程中的安全与合规,将无法反映系统的真实可信度。
核心洞察
- 评估对象从单一模型转向声明式模型+运行时配置,通过 execution trace 定位失败阶段,而非仅凭最终答案。传统 agent benchmark 往往只看最终任务成功与否,无法区分证据获取、运行时路由、安全边界或重复执行中的缺陷。ClawProBench 在 102 个 full profile 场景中覆盖 8 个 native OpenClaw 表面,发现 native-runtime 任务得分 0.5238 显著低于 workspace-live 任务 0.6415,这类差异在仅汇报最终正确率的 leaderboard 中会被掩盖。
- Safety-gated 评分同时考虑 correctness、process quality、efficiency,并保留失败证据用于审计,使 leaderboard 对偶然成功和过程缺陷更敏感。holdout 上 pass@k-any 为 0.6638,而 strict three-trial pass 仅 0.2890,说明一次性成功与稳定可靠之间存在巨大差距;且仅按正确性排名与 process-aware、safety-gated 排名相关系数仅 0.1300,提示单一维度排名会误导模型选择。
方法
输入与评估对象
ClawProBench 的输入是 声明的模型+运行时配置(model-plus-runtime configuration),而非孤立模型。评估在 OpenClaw 运行时上执行,该运行时提供 workspace tools 和八个 native surfaces(browsing、memory、messaging、scheduling、skills、subagents 等)。
关键模块
- 场景设计:full profile 包含 102 个场景,覆盖 workspace-live 和 native-runtime routing 任务;frozen holdout 包含 68 个场景,采用 closed-world JSON 输出契约,用于跨运行时比较和稳定排名。
- 执行与轨迹捕获:每个 trial 在运行时内真实执行,记录完整 execution traces,包括工具调用、状态变化、中间步骤和最终输出。
- 评分公式:采用 safety-gated score,综合 correctness、process quality 和 efficiency 三个维度;安全门控在检测到安全边界违反时对分数进行降权或置零。
- 失败证据保留:执行状态和失败检查的具体证据被保存下来,支持审计和后续诊断。
输出
输出每个配置的 trace score、排名以及失败模式分析,同时提供 pass@k-any 和 strict three-trial pass 等聚合指标。
与仅依据最终答案的同类基准相比,ClawProBench 的差异点在于:它把评分建立在执行轨迹上,显式评估过程质量和安全边界,从而暴露单次成功所掩盖的原生表面缺陷和 trace-local 失败模式。
实验
实验设计
ClawProBench 采用双轨设计:
- Full profile:102 个场景,覆盖 workspace 任务与 8 个 native OpenClaw surfaces(browsing、memory、messaging、scheduling、skills、subagents 等)。
- Frozen holdout:68 个 workspace 场景,使用 closed-world JSON 输出契约,便于跨 runtime 稳健排名。
每个 trial 从执行 trace 中提取证据,按 safety-gated 公式计算 correctness、process quality、efficiency 三部分得分,并保留失败 checklist。快照中 full profile 有 68 个有效条目,holdout 有 37 个干净条目。
关键发现
- 全 profile 最高 safety-gated 平均 trace 得分为 0.7671。
- Native-runtime 任务平均得分 0.5238,明显低于 workspace-live 的 0.6415,说明原生表面更难。
- Holdout 上
pass@k-any为 0.6638,远高于strict three-trial的 0.2890,表明多数配置无法稳定复现成功。 - 扩展 29 个模型的跨 track 排名相关性极弱(Spearman ρ=0.1754,95% CI [-0.23, 0.54]),无法得到精确排序结论。
- 基于最终答案的 leaderboard 会掩盖 native-surface 弱点、一次性成功及 trace-local 失败模式。
对比解读
与只评最终结果的 agent benchmark 相比,ClawProBench 从 trace 中分离证据获取、runtime 路由、安全边界与重复执行四类失败来源,提供更细粒度的诊断。纯 correctness 排名与 process-aware、safety-gated、strict-pass 视角差异显著,提示业界常用 leaderboard 可能高估或低估某些配置。工程选型应同时参考 trace score、pass@k-any 与 strict pass,并在 native runtime 上验证而非仅关注 workspace 任务。
行业影响
落地场景与可用产品
ClawProBench 面向企业级 AI Agent 平台(客服、供应链自动化、内部知识助手),这类产品依赖多工具运行时(浏览器、消息、记忆、调度等)。其 trace-aware 评估可用于 agent 上线前的验收与回归测试,覆盖 workspace 任务和 native-surface 任务(如跨系统路由、文件操作)。
- 电商智能客服 Agent:需同时操控订单系统、网页查询和消息发送,ClawProBench 可测评多表面协同下的过程可靠性(例如是否频繁重试超时、是否错误调用工具)。
- 金融合规助手:执行数据查询与报告生成时,安全门控能检测是否访问未授权数据源,减少合规风险。
商业价值
核心价值在于降低 agent 生产事故率和提升可审计性。传统 final-answer leaderboard 会掩盖 native-runtime 失败和一次性成功;ClawProBench 的过程质量、安全门控和 trace 证据保留,可直接减少故障排查时间和人工审查成本。对于强监管行业(金融、医疗),可审计的 trace 是刚需。此外,frozen holdout 设计支持可重复的排名,避免 benchmark 污染,帮助团队做出更稳健的模型/运行时选型决策。
与现有工作流集成
- 作为 CI/CD 质量关卡:每次模型或 runtime 升级时自动运行 holdout,追踪
pass@k-any与 strict pass 的差异,防止回归。 - 对接现有 agent 框架(LangChain、AutoGen 等)的 trace 输出,或通过 OpenClaw 运行时插件捕获统一轨迹。
- 将 trace 导出为结构化日志(兼容 OpenTelemetry),嵌入监控栈和评估平台(LangSmith、W&B),实现从研发到生产的全链路观测。
ClawProBench 的 runtime-native 视角提醒我们:Agent 评估必须从“只看答案”转向“看过程与边界”,这直接决定企业在生产环境中的信任度和 ROI。
局限
- 评估绑定于特定运行时 **OpenClaw**,尽管作者进行了跨运行时对比(OpenClaw–IronClaw–NanoClaw),但 native surfaces 的定义与实现带有平台特异性,迁移到其他 agent 框架(如 LangGraph、AutoGen)时需重新适配场景与评分规则,限制了基准的通用性。此外,safety-gated 评分公式中的权重、阈值和效率指标需人工设定,缺少客观校准标准,可能导致不同实验室解读差异。快照中的有效样本数(68 个 full-profile 条目、37 个 holdout 条目)仍属小规模,统计结论需要更多配置和重复试验验证。
- Frozen holdout 采用 closed-world JSON 输出合同,虽然提升了排名可靠性并抑制泄漏,但固化了任务交互模式,无法评估真实工作场所中常见的自由形式输出、模糊目标或动态环境适应能力。过程质量评分仅从执行轨迹中提取结构化特征(如工具调用顺序、状态检查点),可能忽略隐式推理质量、错误恢复策略或人机协作维度。另外,benchmark 主要基于文本与结构化数据,对视觉感知、多模态输入或 GUI 操作等场景覆盖不足,与 WebArena、OSWorld 等强调交互与视觉的基准相比,在任务多样性和真实感上存在差距。