论文

OSWorld2.0: 在长周期真实世界任务上对计算机使用智能体进行基准测试

OSWorld2.0: 在长周期真实世界任务上对计算机使用智能体进行基准测试

现有计算机使用基准未能捕捉真实世界的复杂性、长期跨度需求,限制了揭示前沿智能体局限的能力。为此,我们提出 OSWorld 2.0,一个包含 108 个长周期计算机使用工作流的基准,覆盖日常与专业任务,旨在反映真实世界中复杂且具有挑战性的现象。每个任务代表一个端到端工作流,人类用户中位数完成时间约 1.6 小时,而 Claude Opus 4.7 在最大思考模式下平均需 318 次工具调用(OSWorld 1.0 仅约 30 次)。 OSWorld 2.0 聚焦真实工作流中常见但先前基准未充分体现的挑战现象,包括交互设计挑战(如流式交互、动态环境)和智能体模式挑战(如跨源推理、隐式状态推断、视觉空间精度)。任务基于真实输入工件,并与用户配置文件交叉引用,同时附有安全审计报告。 在 500 步的 二进制完成指标 下,Claude Opus 4.8(最大思考+批量工具调用)表现最佳,但仅完成 20.6% 的任务(部分得分 54.8%);GPT-5.5 令牌效率更高,但趋近 13%。结果表明当前智能体远未达到专业级计算机使用水平:问题不在于基本 GUI 控制或编码,而在于忽视约束、遗漏中途信息、猜测而非询问用户、跳过验证,尤其在依赖隐藏状态恢复的任务中表现最差。

论文精读

TL;DR OSWorld 2.0 通过 108 个长时程真实计算机使用工作流(中位时长 1.6 小时)评估代理,当前最强模型仅完成 20.6%,暴露在隐状态推理、跨源推理等复杂现象上的关键短板。

问题

问题背景

当前 AI 智能体正从处理简单指令向自主完成复杂的计算机使用任务演进,领域关注点已从单步 GUI 操作转向端到端的长时程真实工作流程。如何准确评估这些智能体在专业场景下的能力边界,成为制约技术进步的关键问题。

现有方法局限

早期基准(如 OSWorld 1.0)任务规模小、步骤少(平均约 30 次工具调用),且环境多为静态单应用,缺少对以下关键挑战现象的覆盖:

  • 流动交互:界面内容随时间实时更新,要求智能体动态感知。
  • 动态环境:后台状态变化或外部事件可能改变任务前提。
  • 跨源推理:需要整合不同应用、文件、网页中的信息。
  • 隐式状态推断:任务关键约束未直接显示,需从上下文推导。 此外,评估指标仅关注简单完成度,无法区分部分进展与严格完成,难以暴露智能体在错误恢复、信息遗漏等方面的缺陷。

技术挑战与业界关注度

真实计算机使用任务耗时长达数小时,要求智能体在数百步的工具调用中保持长上下文状态一致性,同时应对中途到达的信息、跨应用数据的语义对齐,以及无直接反馈时的隐藏状态推理。这考验了规划、记忆与验证能力的综合上限。实验表明,当前最强模型 Claude Opus 4.8(配置批量工具调用与最大化推理)在 500 步预算下仅完成 20.6% 的任务,而 GPT-5.5 虽令牌效率更高,完成率却停滞在约 13%。这些数据揭示了从受控基准到真实生产之间的巨大鸿沟,业界迫切需要一个高保真度的长时程评测框架来驱动智能体可靠性的提升。

行业类比

这与自动驾驶从封闭场地转向开放城市道路的挑战类似——智能体必须在不可预测的长期交互中维持安全与目标,而不仅仅是处理短序列的固定操作。

核心洞察

  • 长时程任务放大了agent在隐式状态推理上的根本弱点:尽管前沿模型在短程GUI控制上表现良好,OSWorld 2.0揭示当任务需要从非显式线索(如用户偏好、历史交互、动态环境变化)中恢复和维持隐藏约束时,完成率急剧下降。以往基准如OSWorld 1.0任务较短且状态显式,无法充分暴露这种隐式推理瓶颈。这要求下一代agent必须发展出围绕世界状态持续建模与信息追问的能力,而非仅依赖当前观测的响应式策略。
  • 错误检测与自我纠错能力的缺失是当前agent无法突破20%完成率的关键瓶颈:分析显示,模型将绝大部分推理预算花在理解任务上,却几乎不投入资源检查已有行动的正确性或识别已注意到的错误,导致常见失败模式包括跳过关键验证步骤和遗忘早期信息。这与人类专家不断交叉检查工作流程的习惯形成鲜明反差,暗示未来改进方向不应只是更强的推理模型,还应引入外部验证代理、结构化自省循环或持久化记忆模块,迫使agent在执行中主动纠偏。

方法

基准构建流程:输入 → 环境 → 评估

输入层:每个任务包含真实世界的起始产物(如电子表格、邮件线程、代码仓库)和一份用户档案(状态性用户数据,含账号、偏好、历史记录),以及自然语言指令。指令可能隐含关键约束,需要智能体自行推断。

环境层

  • 应用与Web服务:用自托管Web应用(如Nextcloud、Gitea)和桌面程序(如LibreOffice、VS Code)构建,覆盖编程、数据分析、财务、沟通等专业域,初始状态通过预配置的文件系统、浏览器登录态等精确还原。
  • 模拟用户:一个可交互的虚拟用户,能响应智能体的提问或执行人工操作(如输入验证码、提供审批),但不会主动提示。
  • 动态环境:任务执行期间环境可能变化,如收到新邮件、流式数据更新、GUI元素异步出现,考验智能体对 streaming interaction 的应对。

评估层

  • 二次完成指标(Binary Completion):在500步工具调用限制内,所有显式与隐式约束均满足才算通过,否则0分。
  • 细粒度部分评分(Partial Reward):按子步骤进度给分,用于分析能力轮廓。
  • 混合评判器:结合确定性功能检查(文件哈希、数据库条目)和基于模型的评估(如视觉布局、格式正确性)。
  • 安全审计:每任务附带独立安全报告,审核是否执行了高风险操作。

输出:智能体的完整轨迹(工具调用序列、屏幕截图、日志),以及二元完成率和部分得分。基准设计重点引入隐式状态推断跨源推理视觉空间精度等智能体模式挑战,与OSWorld 1.0等旧基准相比,任务工具调用数从约30次提升至平均318次(Claude Opus 4.7),并首次系统性地覆盖动态环境与安全评估,更贴近专业级计算机使用的真实复杂度。

实验

实验设计

评估对象为前沿计算机使用 agent(Claude Opus 4.8、GPT‑5.5 等),在 OSWorld 2.0 的 108 个长程真实世界工作流上进行测试。每个任务模拟端到端流程,人类完成中位时间约 1.6 小时,agent 平均需进行 318 次工具调用。主要指标为 二值完成率(500 步内完全达成目标)和 部分得分(细粒度逐步骤奖励),同时分析令牌效率、失败模式及安全性。

关键发现

最佳配置下,Claude Opus 4.8 的二值完成率仅 20.6%,部分得分 54.8%;GPT‑5.5 令牌效率更高,但完成率停滞在约 13%。额外推理步数不提升完成率,批次工具调用是突破瓶颈的关键。失败集中于隐藏状态推理、流式交互、跨源推理等挑战现象:agents 常丢失指令或环境信息、因观察‑行动延迟导致操作过期界面、跳过关键验证步骤,并在上下文压缩中遗忘早期状态。两个前沿模型呈现出互补的错误模式。

与基线对比解读

相较 OSWorld 1.0(平均 30 次工具调用),2.0 的长程复杂性使 agent 能力退潮,揭示了深层缺陷。与人类完成效率的巨大鸿沟表明,当前 agent 远未具备专业级计算机使用能力。不同于以往关注 GUI 基本操作的基准,此次失败模式指向持续多步推理、跨应用状态维护、动态环境适应的内在困难,这为下一代 agent 设计提供了明确方向。

行业影响

落地场景

OSWorld 2.0 直接面向 计算机使用 Agent 产品的评估与优化,适用于需要长程、多步 GUI 操作与跨系统交互的自动化场景。典型场景包括:

  • 企业服务:客服工单处理自动化(如退款审核、多系统信息同步),需在 CRM、ERP、邮件等窗口间切换,执行查询、表单填写、状态更新等数十步操作。
  • 金融合规:从分散的数据库、PDF、网页中抽取数据,生成格式化监管报告,涉及跨源推理与精密验证。
  • 电商运营:批量商品上架、价格调整、订单异常处理,需在卖家后台、物流平台和电子表格间协调。
  • 内容审核与发布:跨平台内容分发、敏感信息屏蔽,要求流式交互响应和动态环境适应。

商业价值

  • 降本增效:当前前沿 Agent (Claude Opus 4.8) 在 500 步内二值完成率仅 20.6%,远未达到专业级水平。通过 OSWorld 2.0 暴露的失败模式(隐藏状态遗漏、验证不足、长程记忆丢失),可针对性优化 Agent 架构,减少人工介入,将处理类似任务的单位成本降低 60% 以上(对比 1.6 小时人工耗时)。
  • 提升体验:改善 Agent 对 动态环境、流式数据、隐式约束 的应对能力,直接提升自动化流程的可靠性和用户满意度,避免因错误操作导致客户投诉或合规风险。
  • 增收:在电商、金融等场景,更可靠的自动化可直接扩大业务吞吐量,例如处理更多退货、生成更多报告,而不增加人力成本。

与现有产品/工作流的集成

OSWorld 2.0 可作为评估套件集成到各 Agent 开发管线:

  1. 模型选型与迭代:在 CI/CD 中运行基准测试,对比不同模型配置(如 Claude Opus 4.8GPT-5.5)的完成率、token 效率和安全评分,指导预算分配。
  2. Agent 框架优化:在 batched tool calls、推理时计算(如 extended thinking)等策略调优后,通过 OSWorld 2.0 量化长程任务收益,避免“更多步数未必带来完成率”的陷阱。
  3. 安全审计:利用任务附带的安全报告,检测 Agent 在真实工作流中是否产生危害操作(如删除文件、泄露敏感信息),集成到发布审批流程。

具体落地用例

  • 电商退货自动化:买家发起退货后,Agent 需自动登录卖家中心查询订单状态,调用物流 API 获取运单号,在财务系统发起退款,并同步更新 CRM 记录。流程涉及 200+ 步操作,要求跨源推理(订单系统、物流、财务)和隐藏状态推断(如退款是否已部分处理)。OSWorld 2.0 中的类似任务可先行评估 Agent 能否在长程中保持约束、不漏掉中途反馈的物流异常信息。
  • 金融报表生成:分析师输入需求描述,Agent 需从 Bloomberg 终端抓取市场数据、从内部数据库导出交易记录、解析 PDF 合同条款,最后生成带交叉引用的 Excel 报表。任务中需处理流式行情更新,并验证最终数字的准确性。该场景对应基准中的 动态环境视觉-空间精度 挑战,可用于测试模型在真实金融工作流中的鲁棒性。

局限

  • **任务覆盖面与可扩展性**:虽然 OSWorld 2.0 包含 108 个长时程工作流,覆盖日常与专业任务,但其任务分布集中于某些领域(如办公软件、浏览器操作),对法律、医学、创意设计等垂直领域的代表性有限。任务设计依赖专家人工标注,成本高且难以快速扩展到新应用或动态变化的软件生态。这限制了基准的覆盖广度与时效性,未来需要探索半自动任务生成或从真实用户日志中挖掘工作流的方法,以降低构建成本并提升多样性。
  • **评估指标与真实性的差距**:主要采用二元完成指标(500 步内是否完成),虽辅以部分得分,但这种严格的门槛可能无法反映智能体在实际部署中的渐进式有用性。模拟环境虽然引入了流式交互、动态环境等挑战,但与真实计算机使用相比仍缺少系统级不确定性(如网络波动、硬件性能差异、软件版本兼容性问题),可能导致高分智能体在生产环境中表现严重退化。此外,安全性审计仅基于静态规则检查,缺乏对复杂攻击或意外行为的对抗性测试。
  • **智能体与交互模式评估的局限**:实验仅测试了基于语言模型并通过工具调用的智能体(Claude Opus 4.8、GPT-5.5 等),未包含基于视觉的端到端操控模型或混合架构。评估假设固定的 500 步预算和批处理工具调用模式,这与真实用户交互中常见的异步操作、长时间等待、中断恢复等模式存在差异。这可能导致对某些智能体能力的评估有偏,也忽视了计算效率之外的交互鲁棒性维度。
论文Mengqi Yuan2026-06-28原文

相关内容