MyPCBench: A Benchmark for Personally Intelligent Computer-Use Agents
当前计算机使用代理(computer-use agents)的基准测试在非个性化环境中评估模型。这导致了评估与部署之间的差距,因为个人助理需要跨越用户的整个数字生活,包括其上下文、历史数据和已登录账户。这一差距在Web任务上最为明显,因为实时Web评估无法处理需要登录或个人信息的网站——而这正是真实个人助理必须驱动的网站。 我们提出MyPCBench,该基准测试在配有17个模拟真实Web应用及完整桌面栈的Linux桌面环境中,将计算机使用代理作为个人助理进行评估。所有环境为《办公室》中的Michael Scott这一经典角色预设数据。我们在该环境中定义了184个任务,每个任务灵感来自OpenClaw社区的真实请求,并使用统一的计算机+bash工具界面基准测试六个闭源和开源权重模型。 实验发现,最佳模型Claude Opus 4.6完全解决了55.4%的任务,是唯一超过50%的模型。模型失败集中在涉及多个应用程序的任务和长轨迹上,此时个性化对助理的挑战最大。我们已在 https://mypcbench.com 公开环境、任务集和代理工具。
论文精读
TL;DR MyPCBench 构建了首个模拟真实个人数字生活的桌面环境,将 AI 助手评测从通用任务推进到需要理解用户上下文与历史数据的个性化场景。
问题
计算机使用代理(computer-use agents) 近年来成为自动化数字任务的热点方向,业界期望 LLM 驱动的代理能像人类助手一样操控桌面与浏览器,完成复杂工作流。
然而,现有基准如 OSWorld、WebArena 大多在非个人化环境中评测,使用通用沙箱或静态网页,不包含用户特定数据、登录状态及历史操作记录。这导致评估与真实部署之间出现显著差距:真实个人助理需要访问受登录保护的个人网站(如邮箱、社媒、日程管理),而现有基准无法覆盖此类实时、需鉴权的网页任务,从而无法暴露代理在上下文感知、跨应用协同方面的弱点。此外,代理缺乏对用户长期行为模式的模拟,难以体现连续交互中的记忆连续性。
该问题的核心难点在于:个性化场景要求代理跨多个应用(如邮件、日历、文件系统)协同工作,并在长时间轨迹中保持状态一致,这对长程规划、状态跟踪和错误恢复能力提出极高挑战。同时,真实用户数据涉及隐私,构建可复现的个性化评测环境工程成本极高。业界正从通用基准转向更贴近实际部署的场景,OpenAI、Anthropic 等发布的计算机使用产品已凸显个性化能力的迫切需求。
这类似于自动驾驶系统不仅需要在封闭场地测试,还需在包含个性化路线与实时交通的开放道路中验证,才能真正解决用户日常出行需求。
核心洞察
- 个性化是计算机使用智能体从评测走向部署的核心缺口。现有基准在无关用户的干净环境中测试,无法触及需要登录、历史数据和用户上下文的网站,而这正是个人助理真实工作的主要场景。MyPCBench 通过为规范角色(Michael Scott)预植入 17 个模拟网络应用的完整个人数据与登录态,让评测首次覆盖跨应用的上下文依赖、用户身份持久性和隐私敏感操作。这一设计暴露了模型在无状态 API 模式下未显现的失败模式——例如在多个应用间传递用户偏好、查阅历史记录来规划下一步,这些恰是真实助手必须可靠处理的,揭示了当前智能体在“读懂一个人”层面上的根本短板。
- 长轨迹与多应用协同构成当前智能体的能力瓶颈。实验表明,即便是最强的 Claude Opus 4.6,在需要跨越 3 个以上应用或超过 20 步的任务上成功率锐减,且完美完成率比评分下降更快——模型往往“做对一部分但整体跑偏”。这反映出模型缺乏对任务结构的整体规划和对自身探索的预算意识,倾向于迷失在无关 UI 中或遗漏关键子目标。这一发现直接指向:仅靠扩大上下文窗口不足弥合差距,必须在智能体架构中内建层次化记忆、子任务模块与步骤级验证,才能应对真实个人助理面对的长周期、多数源任务。
方法
MyPCBench 的构建遵循**“环境 → 任务 → 交互 → 评估”流水线,将个人化计算机使用代理的评测从无状态环境推向以用户为中心的多应用长期任务**。
环境构建与角色注入
- 模拟桌面:基于 Linux 桌面,集成 17 个仿真 Web 应用(如邮件、日历、文档编辑、购物),每个应用均由合成生成器填充角色专属数据。
- 角色引擎:选取《办公室》的 Michael Scott 作为规范角色,生成其数字足迹——包括邮件历史、日历事件、登录凭据、个人文件等,形成有状态的个人信息环境。
- 基础设施:所有应用均运行在本地沙箱中,允许代理通过截图和 Bash 命令自由交互,避免真实网站登录限制。
任务定义与质量保证
- 灵感来源:从 OpenClaw 社区收集真实个人助手请求,转化为 184 项任务,覆盖多应用协调、信息检索、内容创作、事务执行等类型。
- 领域平衡:任务设计保证日历、邮件、文档、电商等领域的分布,并约束每个任务涉及的应用数量,以探测跨应用规划能力。
- 质量控制:通过人工审核与可执行性验证,确保任务明确、环境状态可复位,消除歧义。
代理交互与工具界面
- 统一工具面:代理提供**计算机操作(鼠标、键盘)**和 Bash 命令双通道,不依赖模型特定的自定义函数,保证模型间公平对比。
- 观察空间:代理接收当前桌面截图和 Bash 输出,经由模型生成下一步动作;动作空间包括点击、输入、滚动、执行脚本等。
评估与指标
- 分级评分:采用及格线类判断,任务完全正确完成才算“解决”,避免部分得分带来的模糊;同时记录轨迹长度、应用跳数等过程指标。
- 失败分析:按步骤预算和应用数量拆解性能,揭露长程规划和跨应用跳转是核心瓶颈。
与现有计算机使用基准(如 MiniWoB++、WebArena)不同,MyPCBench 首次为代理注入持久化个人状态和跨会话上下文,使评测更贴近真实个人助手场景,而非孤立的、无状态网页操作。
实验
实验设计
MyPCBench 在一个填充了 17 个模拟真实 Web 应用 的 Linux 桌面上,以 《The Office》剧集角色 Michael Scott 的完整数字生活数据(上下文、历史、登录会话)作为统一 persona,构造 184 个个人助手任务,这些任务均来自 OpenClaw 社区的真实用户请求。评估覆盖 六个闭源与开源模型(含 Claude Opus 4.6),所有模型使用统一的 计算机 + bash 工具接口,通过像素观察空间和操作动作空间执行任务。主要指标为完全解决任务的比例(fully solved task rate),配合部分得分的 rubric 分数进行细粒度分析。
关键发现
- Claude Opus 4.6 以 55.4% 的完全解决率一骑绝尘,是唯一超过 50% 的模型,其他模型均未突破这一门槛。
- 模型失败显著集中于 多应用任务(>2 个应用) 和 长轨迹任务(>10 步):随着应用数量和步骤数增加,性能快速下降,表明跨应用上下文切换与长期状态维护是个性化场景的 核心瓶颈。
- 部分模型在失败模式中表现出 bash 脚本快捷方式(跳过 GUI 直接操作数据),但这种行为在需处理个性化账户与敏感信息时 极易出错,揭示工具面设计对精细化操控的重要性。
与基线对比的深度解读
此前主流的计算机使用基准(如 WebArena、OSWorld)均采用 非个性化(impersonal)环境,无法评估智能体利用用户历史数据和登录状态执行真实个人任务的能力。MyPCBench 首次引入个性化维度,填补了评估与部署间的关键空白。
在引入个性化约束后,各模型表现与同等规模的非个性化基准相比 大幅下降 —— 即便最强的 Claude Opus 4.6 也仅解决半数任务,说明 仅仅提升通用能力不足以解决个人助手问题。深度对比显示,长上下文理解和多步规划 是拉开差距的关键,但当前所有模型仍离可靠实用的个人助手有巨大差距,尤其在需要跨应用协调记忆与偏好的任务上。该基准为未来 个性化智能体架构(如记忆增强、持久化用户模型) 的设计提供了明确的方向指引。
行业影响
落地场景
MyPCBench 直面个人化代理落地缺口,模拟了用户在桌面环境中跨多应用的真实任务。典型的可落地产品包括:
- 操作系统级个人助理 (如 Windows Copilot、macOS 自动化代理),能访问用户文件、日历、邮件和浏览器登录态,执行跨应用指令。
- 浏览器代理 插件,集成于 Chrome、Edge 等,在已登录的 Web 应用上代劳预订、填表、比价等操作。
- 企业 RPA 增强,将代理嵌入员工工作流,自动处理需个人上下文的多步骤任务(如 HR 系统录入、费用报销)。
商业价值
- 降本: 个人代理可减少员工在重复性跨应用操作上的时间(如数据搬运、文档整理)。即使当前最高完成率仅 55.4%,在人类监督下仍能覆盖大量简单子任务,降低人工成本。
- 体验提升: 产品能提供“懂你”的智能服务(理解偏好、历史数据),成为用户数字生活入口,增强用户粘性与付费意愿。
- 增收: 在电商或内容平台,代理可自动完成个性化推荐后续操作(如加购、下单),直接提升转化率。
与现有产品/工作流的接口
代理可对接已成熟的自动化工具栈:
- 通过 Playwright 或 Selenium 驱动浏览器,实现网页任务;利用系统级 API(如 AppleScript、Bash)操作桌面应用。
- 集成现有身份认证体系 (如 OAuth、企业 SSO),安全地获取用户上下文,避免明文账号。
- 与任务管理与审计平台 结合(如 Jira、ServiceNow),人工可审核并接管代理失败轨迹,形成 human-in-the-loop 工作流。
具体落地场景
电商比价与采购: 一位企业采购员说“帮我在京东和亚马逊上找到 Canon 打印机的全网最低价,存成表格”。代理需登录各站点,利用同一下单地址和支付偏好,跨站比价并生成报表。MyPCBench 中的多应用任务(如跨越购物、邮件、表格)正好对应此场景。
企业知识管理: 员工通过自然语言指令“整理我上周所有会议记录和邮件附件,生成项目周报”。代理遍历邮件客户端、日历、云盘,提取文件并整合成文档,全程基于个人账户和授权数据。该场景考验代理的长程规划与个人上下文理解能力,正是 MyPCBench 强调的挑战。
局限
- **模拟环境的保真度受限**:MyPCBench 使用本地合成的 17 个仿真实 Web 应用,但无法完全复现真实 Web 服务的动态性(如页面布局变更、反爬虫机制、CAPTCHA 等)。所有任务均基于单一虚拟角色 Michael Scott,这限制了评估结果对不同用户背景、行为模式和隐私偏好的泛化能力。此外,环境仅构建在 Linux 桌面系统上,未覆盖 macOS 或 Windows 等常见平台,可能高估或低估代理在跨操作系统场景下的实际表现。
- **任务集覆盖面与偏置**:184 个任务虽从 OpenClaw 社区真实请求中采样生成,但无法穷尽个人助理的全部使用场景(如多设备同步、实时通信、金融交易等高风险操作)。任务复杂度分布可能偏向中等长度轨迹,对需要超长时间跨度和数十步操作的多应用组合任务测试不足。同时,任务难度受限于生成管道和人工审核,部分任务可能因角色设定过于“戏剧化”而与典型办公场景存在偏差。
- **评估指标与模型覆盖**:评分仅采用二元完成率(完全解决与否),未对部分完成或中间步骤正确性给予细粒度反馈,可能遗漏代理的渐进能力信号。基准测试仅涵盖了 6 个当前主流闭/开源模型(如 Claude Opus 4.6、GPT 系列等),未纳入新兴的基于强化学习或混合规划的方法。另外,模拟环境中使用的自动化评分流程依赖规则和 LLM 判断,可能存在误判,影响结论的可靠性。