EnterpriseClawBench: 从真实工作会话中评估智能体
企业智能体越来越多地在工作空间中运行:它们读取异构文件、调用工具并交付业务产物。为此,我们提出了 EnterpriseClawBench,一个基于专有真实工作会话构建的企业智能体基准。 从大量工作会话档案出发,EnterpriseClawBench 生成了 852 个可复现任务,每个任务都配对了恢复的夹具、重写的提示、角色类别、技能子类、硬规则和语义评估准则。由于会话包含企业内部内容,我们不公开基准数据;相反,我们的可复用贡献是构建与评估协议。 在 EnterpriseClawBench 上,最佳配置(Codex with GPT-5.5)仅达到 0.663。这些结果表明,企业智能体评估必须报告框架-模型组合、产物交付、视觉质量、成本、运行时和技能迁移行为,而非将性能压缩为单一分数。
论文精读
TL;DR 从真实企业工作会话中提炼出 852 个可复现任务的企业代理基准,数据不公开但公开构建与评估协议,揭示真实场景下模型能力差距并倡导多维评估。
问题
问题背景
企业级 AI 代理正从聊天助手演变为嵌入实际工作环境的自主执行者。它们需要处理多种异构文件(文档、表格、演示文稿、代码)、调用工具链、并交付符合业务规范的最终产物。目前工业界亟需能够真实反映这种全流程能力、且可复现的评估基准。
现有方法局限
主流代理基准(如 SWE-bench、WebArena、GAIA)大多依赖合成数据或公共数据集,与企业实际生产环境存在显著差距:
- 任务不可复现:真实会话中的文件、上下文与动态状态难以完全重建,导致同一任务在不同时间、不同环境中结果漂移。
- 评估维度单一:传统基准常仅报告 pass/fail 或单一得分,忽视了 交付物质量(如表格格式、视觉美观度)、操作成本(token 消耗、推理时间)、跨技能迁移 等工程关键指标。
- 隐私隔离缺失:企业会话包含敏感业务数据,直接开源会带来合规风险,这迫使社区依赖公开的非企业数据,限制了基准的代表性。
为什么这个问题难且重要
构建企业代理基准面临三重挑战:
- 数据脱敏与可复现性平衡:必须从私有会话中提取任务骨架,重写提示、恢复数据夹具(fixtures),同时保证任务难度和多样性不降级。企业文档的格式多样性(例如 .xlsx 的公式、宏、条件格式)使夹具生成极易丢失信息。
- 评估协议设计:需要模拟真实工作站的运行时环境,统一测量 模型 + 代理框架(harness) 组合的表现,且评估器自身要对生成物进行细粒度语义评判(如 rubric 得分、视觉布局检查),而非仅仅文本匹配。
- 工程实用性导向:企业选型不只关注准确性,更关心 成本-得分曲线、角色适配(如分析师 vs 开发者的技能差异)等,现有基准无法提供这些决策依据。
因此,一个能够输出多维指标、保护隐私、任务可复现的企业代理基准对整个行业至关重要。
行业类比:就像自动驾驶需要基于真实交通场景的闭环仿真而非仅虚拟赛道,企业 AI 代理的迭代同样必须依赖 真实办公会话派生出的高保真任务,才能确保评估结果可以迁移到生产环境。
核心洞察
- 真实企业工作负载是评估企业 Agent 能力的前提,合成任务无法替代。EnterpriseClawBench 从大量内部会话中重建 852 个可复现任务,每个任务保留原有的异构文件、工具调用和业务产物交付要求,更贴近实际工作环境。这与现有基准(如 SWE-bench、WebArena)依赖静态或模拟场景不同,暴露了模型在复杂业务流程和长程交互中的真实短板,最佳配置仅得 0.663 分。
- 单一成功率指标掩盖了企业部署中的关键决策因素,多维评估范式成为刚需。实验揭示,最佳组合(Codex + GPT-5.5)在不同维度上存在显著权衡:高得分方案往往伴随高成本或长耗时,且不同角色和产物类型(如报告、表格、代码)的表现差异明显。因此,报告必须同时呈现支架-模型组合、产物交付质量、视觉质量、成本、运行时间和技能迁移行为,而非仅追求排行榜顶部的一个数字。
方法
企业会话还原:从真实工作流到可复现任务
输入 为大量真实的企业工作场所会话(proprietary workplace sessions),这些会话记录了代理在文件系统环境中执行的多步操作、工具调用和最终交付物。
关键模块:EnterpriseClawBench 构建管道
环境快照恢复
从每个会话中提取工作空间的文件状态,生成 fixtures(恢复后的文件环境),确保任务可以在独立条件下重新执行。提示词重写与去上下文化
原始用户提示被重写为泛化但等价的指令,移除企业专有内容,保留任务意图、约束和成功条件,形成独立的任务定义。任务分类体系
为每个任务分配 role class(如数据工程师、报告撰写员)和 skill subclass(如代码生成、图表创建),构成细粒度的技能标签,用于后续分析技能迁移行为。硬规则与语义评卷
- 硬规则 (hard rules):强制检查输出格式、文件存在性或工具调用序列,提供客观通过/失败信号。
- 语义评卷 (semantic rubrics):多维度人工制定的评分标准,覆盖交付物正确性、视觉质量、步骤合理性等,用于计算主得分。
人工审计与 Lite 子集
从全量 852 个任务中手动抽检并修正,生成 120 个任务的 Lite 精选集,保证评估标准可靠,同时作为快速迭代的基准。
输出:多维评估协议
任务被分发到不同的 harness--model 组合(如 Codex + GPT-5.5)执行,最终报告的不再是单一分数,而是包含工件交付率、视觉质量分、API 成本、端到端运行时、技能迁移增益等多维指标。评估明确要求区分 Harness(如 OpenClaw)与基座模型对性能的独立贡献,揭露工具编排与模型能力之间的复杂交互。
与 SWE-bench、WebArena 等传统代理基准不同,EnterpriseClawBench 不公开数据以保护企业隐私,但其核心贡献是可复用的构建与评估协议,使任何组织都能基于自身工作流构建同类基准;同时,它率先将工件视觉质量和技能迁移上升为一级指标,更贴合企业实际交付场景。
实验
实验设计
EnterpriseClawBench 从真实企业会话中构建出 852 个可复现任务,每个任务附带恢复的 fixtures、改写后的 prompts、角色类别(role classes)、技能子类(skill subclasses)、硬性规则和语义评分标准(rubrics)。实验主要基于 120 个任务的人工审计 Lite 子集,评估不同的智能体框架与模型组合(harness–model)。评估维度不采用单一分数,而是覆盖 artifact 交付质量、视觉质量、成本、运行时间及技能迁移行为。基线配置包括不同基础模型与 harneess 的搭配,并使用自动化评估加人工 checks。
关键发现
- 最佳组合性能有限:在 Lite 子集上,Codex + GPT-5.5 仅获得 0.663 的综合得分(满分 1.0),说明企业真实工作流对当前智能体仍具显著挑战。
- 多维度评估必要:性能不能简化为单一点数;例如,artifact 交付准确率与视觉质量等子指标表现差异明显,且不同角色类别(如数据分析 vs. 文档生成)下的分数波动大。
- 成本–分数权衡:更强模型虽然分数更高,但推理成本与运行时间也明显上升,需在实际部署中权衡。
与基线的深度对比
现有智能体基准多集中于对话或孤立工具调用,EnterpriseClawBench 首次基于真实企业 workspace 会话构建,因此其基线分数 0.663 直接暴露了生产环境下的能力缺口。与同类 Claw 风格基准(如 AgentClaw)相比,该基准强调 artifact 交付物的完整性和视觉质量,而这些维度在常规文本或执行匹配指标下常被忽略。实验还表明,单纯的模型升级(如从 GPT-4 到 GPT-5.5)带来的提效,不如 harneess 工程(如工具链优化)对 artifact 质量的影响显著,这为工程实践提供了清晰的改进方向。
行业影响
落地场景
EnterpriseClawBench 所代表的评估范式直接服务于 企业级智能代理 的选型与优化,其核心场景是 非结构化工作流的自动化:代理需要读取异质文件(PDF、PPT、CSV)、调用工具(搜索、代码执行、图像生成),并产出符合业务要求的交付物(文档、图表、幻灯片)。典型用例包括:
- 电子商务平台的营销自动化:代理根据促销计划、商品数据和品牌素材,生成多尺寸广告海报与投放文案,需平衡视觉质量、产出速度与品牌一致性。
- 金融机构的合规报告生成:代理从审计底稿、交易记录与监管规则中提取关键信息,生成格式严格、引用清晰的合规文档,对硬规则遵守和交付物完整性要求极高。
商业价值
该基准直接瞄准 AI 代理部署的隐性成本与质量风险:
- 降本:通过量化 harness–model 组合 在成本、运行时间、技能迁移等多维度的表现,企业可避免为低效配置支付高额推理成本,并减少人工复核与修正开销。
- 增收:代理生成的交付物若视觉质量差或内容不合规,会直接损害转化率或招致罚款。EnterpriseClawBench 对 artifact delivery 与 visual quality 的细粒度评估,有助于上线高可靠代理,保障业务效果。
- 体验提升:多任务 skill transfer 的度量,反映出代理能否复用已有技能加速新任务,直接影响用户等待时间与输出一致性。
与现有产品/工作流的接口
The benchmark construction protocol 是最可复用的产出,可平滑嵌入现有 AI 工程栈:
- 代理框架评估层:与 OpenClaw、LangChain 等代理脚手架集成,作为 CI 流水线中的回归测试套件,每次模型或工具更新后自动评估核心任务得分。
- 内部基准构建工具:企业可参照论文的 fixture 恢复、语义 rubric 生成、硬规则校验 流程,从自身历史会话中构建私有基准,不必泄露数据即可获取性能信号。
- 多目标决策仪表盘:将 leaderboard 输出的多维指标(cost, runtime, artifact delivery score, visual quality 等)接入现有的 MLOps 监控平台,形成代理效能的实时雷达图,而非依赖单一通过率。
具体落地用例
- 电商促销内容工厂:代理每周生成 500 张活动海报,需同时满足品牌 VI 规范(视觉质量)、避免素材版权问题(硬规则)、输出不同尺寸(artifact delivery)。利用 EnterpriseClawBench 的 rubric,团队可筛选出在“visual quality”与“skill transfer”(快速适应新品牌风格)上最佳的
Codex + GPT-5.5配置,硬规则在校验阶段直接拦截违规项。 - 金融投研报告撰写:代理从多份 PDF 财报、Excel 估值模型和法律文本中提取数据,生成摘要报告。该场景对“artifact delivery”(报告格式与引用完整性)和“hard rules”(财务数据单位换算、敏感词过滤)极为敏感。通过 EnterpriseClawBench 的构建协议,机构可从内部历史投研指令中生成测试集,评估不同代理的合规率与生成成本,最终选择在
runtime与score之间达成最优平衡的方案。
局限
- - **数据可及性与复现性受限**:因为源会话包含企业内部敏感内容,`EnterpriseClawBench` 无法公开原始数据,只给出构建与评估协议。这意味着社区无法在同一组 852 个任务上直接复现论文结果、开展诊断实验或进行公平的模型对比,基准的开放性大打折扣。虽然协议可被其他企业复用,但不同企业的数据分布差异会使 leaderboard 不可比,协议级可复现性难以替代标准 benchmark 的数据级可复现性。
- - **任务多样性与领域泛化性存疑**:基准构建自单一企业的“工作室会话”,任务类型、文件格式、工具调用模式可能高度同质化,例如集中于某种内部文档的处理范式。即使管线包含角色分类与技能子类,其多样性仍受限于源数据的业务范围。缺少多企业、多行业的样本,使得声称的“企业 agent 评估”可能退化为特定组织的环境过拟合,代理性能排名难以泛化到金融、医疗、制造等不同垂直领域。
- - **评估协议的主观性与可扩展性挑战**:任务采用语义化 rubrics 进行人工审计或 judge 模型评分,虽然能捕捉 artifact 视觉质量等“软”维度,但 rubrics 的设计和审计过程本身可能引入隐式偏见,且复现时需投入较大的人力校准成本。随着任务规模增长或新企业适配,人为细化 rubrics 与持续审计的可行性会迅速降低,长期维护和跨版本对比的稳定性不足,可能限制基准作为持续评测标准的生命力。