论文

TerminalWorld: 在真实终端任务中评估智能体的基准测试

TerminalWorld: 在真实终端任务中评估智能体的基准测试

我们提出 TerminalWorld,一个可扩展的数据引擎,能够从“野外”终端记录中自动逆向工程高保真评估任务。处理 80,870 条终端记录后,该引擎生成了一个包含 1,530 个验证任务的完整基准,覆盖 18 个真实类别,从短期日常操作到超过 50 步的工作流,涉及 1,280 个独特命令。从中我们精选出 200 个代表性、经人工审核的任务子集 TerminalWorld-Verified。 在 TerminalWorld-Verified 上对 8 个前沿模型和 6 个智能体进行全面基准测试表明,当前系统在真实终端工作流中仍然困难,最高通过率仅 62.5%。此外,TerminalWorld 捕捉到的真实终端能力与现有专家策划的基准(如 Terminal-Bench)显著不同,与其分数的 Pearson 相关系数仅为 0.20。 自动化引擎使 TerminalWorld 本质上具有真实性和可扩展性,能够随着开发者实践的发展而评估智能体在真实终端环境中的表现。数据和代码已在 https://github.com/EuniAI/TerminalWorld 开源。

论文精读

TL;DR TerminalWorld 从 8 万终端记录中自动构建 1530 个真实终端任务基准,评估 AI 智能体;最好模型通过率仅 62.5%,且与 Terminal-Bench 弱相关,揭示现有系统在真实终端工作流上的不足。

问题

问题背景

终端环境是 AI 智能体执行复杂软件操作的核心界面,随着 LLM 在推理和工具调用上的进步,自动化终端工作流成为关键应用方向,但真实场景下的系统化评测仍严重缺失

现有方法局限

目前主流基准(如 Terminal-Bench)完全依赖人类专家手工设计任务,存在三重局限:

  • 不可扩展:专家编写任务耗时巨大,难以覆盖日益丰富的命令行工具体系,更无法跟随开发者实践快速迭代。
  • 分布偏移:人工构思的任务往往简化或抽象了现实中的脏活累活,缺少真实录屏中常见的边缘情况(例如非标准输出格式、交互式 TUI、多步骤依赖故障恢复)。
  • 能力表征不足:本研究发现,模型在这些人工基准上的得分与在 TerminalWorld 上的表现仅呈弱相关(Pearson r=0.20),揭示人工评测无法真实反映终端智能体的实战能力。

为什么这个问题重要

真实终端任务具有长流程、多命令组合、环境依赖复杂的特点,要求智能体同时具备状态追踪、错误恢复和工具编排能力。当前最强模型在 TerminalWorld-Verified 子集上最高通过率仅 62.5%,证明距离可靠自动化仍有鸿沟。业界亟需像 TerminalWorld 这样能自动从 80,870 段真实录屏中逆向工程出 1,530 道高保真任务的数据引擎,它天然可扩展,并随着终端使用演变而不断更新,避免人工设计的滞后性。

类比

如同自动驾驶必须基于真实道路里程评测,而非仅依赖仿真场景;终端智能体也必须在 in-the-wild 工作流上证明自己,否则部署风险极高。

核心洞察

  • 自动化引擎从大量终端记录中逆向工程出高保真任务,使基准随开发者实践同步演化。不同于人工构建的静态基准(如 Terminal-Bench),这种数据驱动的方式天然避免了分布偏移和过时,确保评估始终贴近真实使用场景,为长期可维护的 agent 评估提供了新范式。
  • 在 TerminalWorld 上,前沿模型和 agent 的最高通过率仅 62.5%,且与 Terminal-Bench 得分几乎不相关(r=0.20),揭示了现有基准与实际任务间的能力差距。真实终端工作流包含噪声、长链依赖和意外情况,这些在人工基准中常被简化,导致评估结果虚高。该发现促使重新思考如何设计更加真实、可扩展的评估平台,以驱动 agent 在实用性方向上的进步。

方法

方法概览

TerminalWorld 的数据引擎采用“从真实终端录制中自动化构建任务”的流水线,将零散的操作历史转化为可复现、可评估的批量任务。

输入与处理流程

  1. 人类终端录制收集
    从公开来源获取 80,870 条真实的终端操作录屏(如 ttyrec 格式),覆盖开发者日常使用的各种命令与环境。

  2. 任务自动合成

    • 逆向解析:从录制中提取文件系统状态变化、命令序列及输出,识别任务边界。
    • 语义重构:将操作序列抽象为初始状态操作步骤目标状态 的通用任务描述,生成对应的自然语言指令。
    • 多样化筛选:保证任务长度从几步到 50+ 步的跨度,并涵盖 18 个类别(如文件管理、系统配置、网络诊断等)。
  3. 可执行环境重现
    为每一个任务自动构建沙盒环境(基于容器化技术),还原录制时的文件系统布局、依赖项和系统配置,确保任务可重复执行且不会污染宿主环境。

  4. 测试套件自动生成
    通过分析原始录制的最终状态,自动生成验证脚本(如检查特定文件是否存在、内容是否符合预期、进程是否退出等),作为任务成功的客观判定。

输出:基准数据集

  • 完整集:1,530 个经过自动校验的任务,使用 1,280 个独立命令。
  • 已验证子集TerminalWorld-Verified):200 个由专家手动审核的高质量任务,用于可靠评测。

与同类方法的差异点

与人工专家构建的 Terminal-Bench 不同,TerminalWorld 的数据完全自动化派生自真实操作记录,因此能捕捉到专家基准中缺失的真实行为模式,且能随开发者实践持续扩展,两者评测分数仅存在弱相关(Pearson r=0.20)。

实验

实验设计

  • 论文提出 TerminalWorld 数据引擎,从 80,870 段真实终端录制中自动逆向生成 1,530 个验证任务,覆盖 18 个类别、1,280 个独立命令。
  • 精心筛选出 TerminalWorld-Verified 子集,包含 200 个人工审核的代表性任务。
  • 在 Verified 子集上评估了 8 个前沿模型和 6 个终端智能体,对比 Terminal-Bench 基准,并进行人类基线测试。

关键发现

  • 当前系统在真实终端工作流上表现有限:最高通过率仅 62.5%,表明即使是最强模型也难以可靠完成多步终端操作。
  • TerminalWorld 所衡量的终端能力与现有专家策划基准 Terminal-Bench 存在本质差异:两者得分的皮尔逊相关系数仅为 r=0.20,弱相关说明现有基准无法有效反映真实世界终端任务需求。
  • 自动化引擎保证了基准的可扩展性和真实性,能随开发者实践演进持续更新,避免静态基准的过时问题。

基线对比与工程启示

  • Terminal-Bench 的弱相关揭示了一个重要问题:依赖手工设计的评估可能过分简化任务,导致模型在真实环境中的泛化能力被高估。
  • 本文提出的 逆重构数据引擎 提供了一种数据驱动的可扩展评估范式,对需要可靠终端自动化的工程团队具有直接价值——团队可基于自身终端录制构建特定领域的评测,更准确地估计模型在生产环境的表现。
  • 未来工作可结合更细粒度的过程奖励和交互式调试,进一步提升智能体在复杂终端任务中的成功率。

行业影响

落地场景

TerminalWorld 为自动化终端操作的 AI Agent 提供了高保真、可扩展的评测基准,直接赋能以下场景:

  • DevOps 与 SRE 智能助手:自动执行部署脚本、环境配置、日志排查等复杂工作流,替代人工反复输入命令。
  • 云服务平台:在用户执行 CLI 命令前,由 Agent 预演并校验状态变更,减少误操作带来的生产事故。
  • IDE 与代码助手插件:在 VS Code、终端模拟器中集成 Agent,根据自然语言描述自动生成并执行多步 shell 命令,完成项目构建、依赖安装等日常任务。
  • 安全响应自动化:针对入侵检测或漏洞修复的标准操作流程(SOAR),利用 Agent 在隔离环境中自动执行取证、隔离、修复终端命令。

商业价值

  • 降本:将熟练工程师从重复性终端操作中释放,1,530 个真实任务覆盖了 18 个常见类别,可直接用于 Agent 调优,减少人工构建评测集的时间与成本。Agent 在执行 git 操作、包管理、文件处理等任务中逐步成熟,可显著降低运维人力开销。
  • 体验提升:面向终端新手的智能助手可提供实时、可信的命令建议与错误恢复,降低学习曲线,提升开发者工具的用户黏性。
  • 风险控制:通过 Verified 子集 的 200 个手工审核任务,企业可严格验证 Agent 在真实环境中的可靠性,避免因错误命令导致的数据丢失或服务中断。

与现有产品/工作流的接口

TerminalWorld 作为数据引擎与评测套件,可无缝嵌入现有研发与运维流水线:

  • CI/CD 质量关卡:将 TerminalWorld-Verified 作为 Agent 能力卡点,只有通过率达标(如 > 80%)的 Agent 版本才能部署到生产环境。
  • Agent 微调数据源:利用引擎自动生成的 1,530 个任务及对应黄金轨迹,结合 RLHF 或 SFT 训练企业内部的终端 Agent 模型。
  • 与 Terminal-Bench 互补:鉴于两者相关性低(Pearson r=0.20),可同时使用以全面评估不同维度的终端能力,避免单一基准的过拟合。

具体落地用例

  1. 电商平台运维 Agent:大促期间,服务器集群需快速统一修改配置、重启服务并校验健康状态。Agent 根据自然语言指令(“将所有 web 服务器的 nginx 超时设为 30 秒并重载”)在 TerminalWorld 类似环境中预执行,验证成功率后再推送到真实集群,将操作时长从数小时压缩到分钟级。
  2. 金融交易系统回测 Agent:量化团队需反复执行数据拉取、清洗、因子计算、回测运行的终端脚本。Agent 自动编排这些步骤,并通过 TerminalWorld 评估其正确处理异常退出的能力,确保回测结果可信,加速策略迭代。

局限

  • **自动逆向工程引入的噪声与偏差**:TerminalWorld 依靠从终端录屏中自动重建任务指令和预期状态,这个过程依赖启发式规则和模式匹配,可能无法准确还原原始用户的真实意图,尤其是对于多步、高度上下文依赖的复杂工作流。由此生成的任务可能包含歧义或与开发者实际操作逻辑不符的步骤,影响对代理能力的有效评估。
  • **数据来源和分布的代表性未充分验证**:论文利用 80,870 条录屏构建基准,但并未详细披露这些录屏的来源广度、涉及的开发环境与工具链分布。如果数据主要来自特定平台或开发者群体,那么任务的类型与难度分布可能无法反映终端使用的全貌,导致基准在跨场景泛化能力上的评估价值受限。
  • **评估指标的覆盖面较窄**:当前主要基于命令序列精确匹配或最终环境状态的一致性来判断任务是否通过,未能捕获代理在真实终端使用中的交互效率、错误恢复能力、资源占用以及面对意外输出时的鲁棒性。这种简化使得基准分数难以直接映射到实际生产力提升上。
论文Zhaoyang Chu2026-05-21原文

相关内容