论文

RecreationWorld:面向混合计算机使用智能体的可扩展且可验证环境

RecreationWorld:面向混合计算机使用智能体的可扩展且可验证环境

计算机使用智能体(CUAs) 此前沿两条独立路线发展:图形界面交互,以及通过代码与命令行进行软件开发。然而真实的数字工作需要两者交错进行,而非端到端堆叠。本文研究混合 CUA:它能自主决定何时探索界面、编写软件,并运行与视觉验证其产物。 我们提出 RecreationWorld,一个围绕「复刻」构建的五平台框架:给定一个正在运行的参考程序,智能体必须自行发现其行为并构建忠实实现,全程无预设工作流。RecreationWorld 在 Ubuntu、macOS、Windows、Android 与 Web 上提供可复现环境,并配有统一 harness,支持原生 GUI 控制与编码工具。运行中的参考程序充当隐藏行为测试的 oracle,提供以执行为基础的奖励。 我们利用高质量开源应用规模化生成轨迹。在这些轨迹上训练的模型在五个分布外编码与混合计算机使用基准上均有提升,并更频繁地验证渲染输出,表明能力可迁移至复刻之外。 为进行留出评估,我们提出 RecreationBench,包含跨领域与平台的 250 个多样任务。基于参考的程序化与视觉断言覆盖多交互深度下的动作条件结果,每条断言均先在参考程序上验证并经人工审核,之后测试套件才冻结用于自动评分。GPT-6 Astra 以 58.1% 总体成绩领先,但仅在 2.8% 的任务上通过全部程序化测试。智能体复现静态界面结构比复现交互与计算结果更可靠,而生成的应用程序相较参考仍更小、更单体化。我们开源该基准、环境与测试套件。

论文精读

TL;DR RecreationWorld 让智能体观察运行中的参考应用并自主完成复刻实现,通过执行级验证奖励和跨平台环境训练,显著提升混合计算机使用与编码任务的泛化能力。

问题

问题背景

computer-use agents 长期沿两个独立方向演进:图形界面交互(GUI grounding)与基于代码/命令行的软件工程。真实数字工作往往需要 agent 在观察 UI、编写实现、运行产物并目视验证之间动态切换,单一范式的模型难以胜任。

现有方法局限

  • 单一交互范式:GUI-only 模型无法生成或修改源代码,代码模型无法直接感知运行时界面状态,导致无法形成“探索-实现-验证”闭环。
  • 奖励信号缺失:多数环境只提供稀疏的成功/失败标签,缺少执行接地(execution-grounded)的中间奖励,使 agent 难以学习何时该查看界面、何时该写代码。
  • 评测可扩展性与复现性不足:现有 GUI benchmark 依赖固定网页或虚拟机快照,跨平台一致性差,难以规模化生成高质量混合轨迹。
  • 任务定义割裂:程序化测试与视觉断言往往分离,且未验证 action-conditioned 多交互深度结果,agent 可能仅复制静态结构而忽略动态行为。

为什么这个问题难/重要

技术挑战在于 agent 必须维护跨界面与代码的联合状态,执行长期 horizon 决策,并在 Ubuntu/macOS/Windows/Android/Web 五个平台上保持环境一致和隔离。同时,需要双重断言(程序化 + 视觉)并经过 reference 与人工校验,防止 reward hacking。业界关注度体现在最高分模型 GPT-6 Astra 总体仅 58.1%,通过所有程序化测试仅 2.8%,表明混合 computer-use agent 仍有很大提升空间,是通向通用数字助理的关键瓶颈之一。

行业类比

类似 AI 自主 QA 工程师:给定一个运行中的参考应用,agent 需要探索功能、编写实现并验证重建效果,可类比 CI/CD 中由 AI 从观测到回归测试的全自动闭环。

核心洞察

  • **重建范式** 将 hybrid computer-use agent 的任务定义为“给定运行参考应用,重建忠实实现”,迫使 agent 在探索、编码、运行与视觉验证之间自主切换。与 SWE-bench 依赖人工编写测试、OSWorld 只评 GUI 操作结果不同,RecreationWorld 的参考应用本身作为隐藏行为测试的 oracle,测试生成自动且可扩展,奖励直接对齐真实执行结果。这种设计使得大规模生成高质量训练轨迹成为可能,模型在五个 OOD 基准上的提升表明重建任务学到的技能可以迁移到通用编码与 GUI 操作。
  • **RecreationBench 揭示能力断层**:即使最强模型 GPT-6 Astra 总体得分 58.1%,通过全部程序化测试的比例仅 2.8%,且模型复制静态界面结构的能力远强于复现动态交互与计算输出。该基准覆盖 Ubuntu/macOS/Windows/Android/Web 五平台,测试包含动作条件化结果的多深度验证,暴露出 agent 在长期自主决策中的薄弱环节——final-loop closure 低、GUI 调用比例与得分正相关但模型缺乏持续验证。工程启示:未来 hybrid CUA 应强化视觉验证循环和交互深度,例如在每次代码修改后自动运行并与参考行为比对,而非仅依赖一次性生成。

方法

RecreationWorld 以复刻(recreation) 为核心任务,输入是一个已启动的参考应用及其运行平台,输出是 agent 生成的复刻实现代码与交互轨迹。关键模块如下:

  1. 统一执行基础设施
    在 Ubuntu、macOS、Windows、Android、Web 五类平台上提供可复现环境,harness 同时暴露原生 GUI 控制(点击、键入、截图)与编程工具(文件读写、命令行、代码执行),agent 可在探索界面与编写代码之间自主切换。

  2. 行为 oracle 与自动化奖励
    参考应用作为隐藏行为测试的 oracle,测试套件包含programmatic 断言和visual 断言,覆盖多个交互深度下的动作条件结果。测试先在参考应用上验证、经人工审核后冻结,评分时对复刻实现运行测试,得到 execution-grounded reward,即只有真实运行通过才得分,杜绝伪成功。

  3. 轨迹生成与训练
    利用高质量开源应用批量生成 agent 的探索、实现与验证轨迹,用上述奖励信号优化模型,使其学会在“查看界面 → 写代码 → 运行并视觉验证”之间动态决策。

与同类单平台 GUI agent 或纯编码 agent 的差异在于,RecreationWorld 通过复刻任务强制混合使用图形交互与软件开发技能,并以可执行的隐藏测试作为统一评判标准,从而同时考察界面理解和代码实现能力。

实验

实验设计

RecreationWorld 提供 Ubuntu、macOS、Windows、Android、Web 五个平台的统一环境,agent 需观察运行中的参考应用,自主决定何时探索界面、编写代码、运行并视觉验证产物。隐藏行为测试以参考应用为 oracle,提供执行级奖励。训练轨迹来自高质量开源应用,规模可扩展。评估分为两部分:在 RecreationBench(250 个跨域跨平台任务,参考验证 + 人工审核后冻结)上测试,以及在五个 OOD 基准(ProgramBench、GameCraft-Bench、Vision2Web、OSWorld 2.0、WeaveBench)上检验迁移。

关键发现

  • GPT-6 Astra 在 RecreationBench 上总体得分 58.1%,居首位,但仅 2.8% 任务通过全部程序化测试。
  • 静态界面结构的复现可靠性高于交互和计算输出;生成的实现通常比参考更小、更monolithic。
  • 训练后的模型在五个 OOD 基准上均有提升,且更频繁验证渲染输出,显示超越重建任务本身的迁移能力。

与基线对比

相较其他模型,GPT-6 Astra 分数领先但绝对值偏低,说明 hybrid computer-use agent 在端到端可验证任务上仍有巨大差距。与纯 GUI 或纯代码基准不同,execution-grounded reward 和跨平台可验证环境提供了更贴近真实数字工作的中间信号,促进探索与实现行为的融合。

行业影响

落地场景

RecreationWorld 的混合代理能力(GUI + 代码 + 命令行自主切换)可落地于:

  • 跨端应用自动化测试:在 Ubuntu / macOS / Windows / Android / Web 五平台一致地驱动界面、编写脚本并视觉验证结果;
  • 企业级 RPA 升级:从固定流程自动化转向“探索式自动化”,代理自主发现旧系统行为并编写兼容实现;
  • 自主软件迁移与重构:给定运行中的参考系统,代理发现行为、重写代码并回归测试,适用于遗留系统现代化。

商业价值

  • 降本:减少手工 UI 测试、跨平台兼容性验证和重复性重构的人力投入;
  • 增收 / 加速:缩短从需求到可验证原型的周期,使产品迭代更快;
  • 质量提升:执行 grounding 奖励和隐藏行为测试,降低“能打开界面但逻辑错误”的静默缺陷。

与现有工作流接口

  • 可作为 CI/CD 插件:将 RecreationBench 风格的 reference-grounded 断言嵌入流水线,自动生成回归测试;
  • 通过 MCP / tool-call API 对接现有 IDE(VS Code / JetBrains)、测试框架(Playwright / Appium)和云真机平台;
  • 开放的环境 harness 与测试套件可直接作为 评测层 接入自研 agent 框架,用于迭代训练或上线前门禁。

具体落地 use case

  1. 电商平台:跨 Web / iOS / Android 自动重现商品详情页、下单流程的交互行为,并编写等效回归测试,替换人工跨端验证;
  2. 企业服务:对遗留内部工具(如报表门户)进行行为克隆和现代化重构,代理先探索旧系统,再实现 Web 版并自动核对程序化断言。

局限

  • - **通过率极低且缺乏细粒度反馈**:GPT-6 Astra 整体得分 58.1%,但仅 2.8% 任务通过全部程序化测试,说明现有混合 CUA 距离可靠完成 recreation 任务差距很大。智能体对静态界面结构复现优于交互与计算输出,意味着测试可能过度奖励表面相似性。该基准难度过高,自动评分虽可复现,但难以定位失败的具体阶段,不利于迭代改进;实际工程中需拆分任务或引入中间检查点。
  • - **生成应用规模与结构偏差**:论文指出复现应用通常更小、文件更集中且更 monolithic,暗示 agent 为了通过测试而简化实现,可能过拟合静态 UI 或避免复杂交互。这种行为会导致评估偏差:隐藏测试可能未充分覆盖参考应用的行为复杂度,agent 可投机取巧。与 SWE-bench 等代码基准相比,RecreationBench 长期依赖和跨平台特性更贴近真实,但行为断言的有效性和对抗性未经充分验证,存在测试强度不足的风险。
  • - **平台与领域覆盖有限**:虽然框架支持 Ubuntu、macOS、Windows、Android、Web 五平台,但训练数据来源于高质量开源应用,偏向轻量级 GUI 工具,缺少复杂企业软件、多模态交互和系统级权限场景。同时,强制网络隔离与本地权限限制虽保证评估完整性,却阻止 agent 使用包管理器和在线文档等常规开发手段,降低了任务生态真实性。与 OSWorld 等真实操作系统基准相比,环境噪声和不可预测性较低,限制了向生产环境的直接迁移。
论文Shuai Bai2026-09-18原文

相关内容