Multi-Agent Computer Use
当前计算机使用智能体(Computer Use Agent, CUA) 主要以单智能体串行方式部署,这在需要任务分解、并行执行和基于新信息持续重规划的复杂长时任务中表现欠佳。本文提出转向构建和评估多智能体计算机使用(Multi-Agent Computer Use, MACU) 系统,通过规划与并行执行缓解单智能体的不足。 MACU 采用通用多智能体架构:一个管理者模型(manager model) 将计算机使用任务分解为有向无环图(Directed Acyclic Graph, DAG),编码子任务间的依赖与目标。每轮迭代中,管理者从 DAG 的 ready 前沿(ready frontier) 派遣并行 CUA 子智能体执行节点,并根据子智能体返回的新发现动态修订 DAG(增、删、改写节点)。该设计将部分可观察环境视为首要挑战:下游智能体无法重新观测的信息通过管理者和 DAG 结构保留并传递。 在桌面(OSWorld)和网页导航(Online-Mind2Web、WebTailBench、Odysseys)基准上,MACU 较强大单智能体基线稳定提升 3.4%–25.5%,展现出更优的测试时扩展性,并能解决单智能体 CUA 卡壳的复杂长时任务。在长时网页导航基准 Odysseys 上,MACU 将平均任务完成时间加速约 1.5 倍,证实了多智能体协调在扩展计算机使用智能体高效长时工作方面的潜力。
论文精读
TL;DR 多智能体计算机使用将任务分解为有向无环图,由管理者动态调度并行子智能体执行,在桌面与网页导航长周期任务中大幅超越单智能体,并加速任务完成。
问题
问题背景
当前计算机使用代理(Computer Use Agents, CUAs)主要采用单代理串行执行模式,即单个模型按顺序逐步完成操作。该模式在复杂、长周期任务中暴露明显短板:任务难以分解、无法并行加速、缺乏动态重规划能力,导致执行效率低且易陷入死循环。
现有方法的局限
单代理 CUA 面临三大技术瓶颈:
- 串行瓶颈:所有子任务只能顺序执行,无法利用任务间的独立性实现并行,导致整体耗时线性累积。
- 环境部分可观测性处理不足:浏览器或桌面环境具有强动态性,单代理在长周期操作中容易丢失上下文信息,而现有方法缺乏显式的信息留存与传递机制,下游步骤常因缺失关键观测而失败。
- 静态规划僵化:缺乏根据中间结果动态调整任务拓扑的能力,一旦初始计划失效,代理容易陷入重复无效操作,难以自主重规划。
技术挑战与重要性
计算机使用场景天然是部分可观测环境,代理需在大量动态页面中保持长程依赖,且任务往往可切分为多个并行子任务。并行执行不仅能大幅缩短完成时间,还可通过多路试错提高鲁棒性。然而,并行调度带来新的挑战:任务依赖管理、子代理间信息同步、动态取消与重调度等。业界对通用型计算机代理的需求持续升温,如自动表单填写、多页面数据提取、复杂软件操作等均要求系统具备任务分解与协调能力。
行业类比
这类似于从单线程程序演进到多线程并发编程——单线程按顺序执行所有逻辑,而多线程通过拆分任务、利用并行性大幅提升吞吐量,但必须处理同步、死锁等复杂协同问题。在 AI 代理领域,多代理协作将成为释放通用计算机使用能力的关键路径。
核心洞察
- 将计算机使用任务建模为有向无环图(DAG)打破了单智能体串行执行的限制,天然支持任务分解与并行执行。与传统的单智能体顺序循环或简单的多智能体并行调用不同,MACU通过管理器动态维护DAG,并依据依赖关系调度子智能体同时处理就绪节点,显著缩短长时任务的端到端延迟。这种图结构化的任务表示让系统能够在获取新信息时随时增删或重写节点,实现真正的在线重规划,而不仅是固定管线的流水线并行。
- 显式管理部分可观察性让MACU区别于依赖单一智能体记忆或完整环境回溯的方案。管理器将下游智能体可能无法重新观察的关键信息封装在DAG节点中并向前传递,避免了因任务分支或时序乱序导致的信息丢失。这种设计首次将计算机使用的部分可观察环境作为系统架构的一等挑战,而非仅通过改进单智能体的感知或决策来处理,为需要跨多个交互阶段保持上下文的复杂任务提供了更鲁棒的解决方案。
- 多智能体协调是扩展计算机使用代理生产力的有效轴,而非仅靠模型规模或训练数据堆叠。MACU在多个桌面与网页导航基准上对强单智能体基线的提升达到3.4-25.5%,且在Odysseys长时基准上平均任务完成时间加速约1.5倍。更关键的是,MACU展现出更优的测试时计算扩展性,并能解决单智能体陷入停滞的长期任务,表明系统架构层面的并行协调设计能释放比单纯提升单体模型能力更高的效率增益。
方法
核心方法:MACU (Multi-Agent Computer Use)
MACU 将复杂计算机操作任务建模为多智能体协作问题,通过有向无环图(DAG) 实现动态任务分解与并行执行。
输入:用户的自然语言任务描述(如“在 Excel 中整理数据并发送邮件”)与当前计算机环境状态(屏幕截图、DOM 树等)。
关键模块:
- Manager 智能体:基于强语言模型(如 GPT-4)的规划器,负责将任务分解为 DAG。图中每个节点表示一个子任务(如“打开浏览器”、“登录邮箱”),边表示依赖关系。Manager 持续维护一个就绪边界(ready frontier),即所有前置节点已完成、可并行调度的节点集合。
- CUA 子智能体:独立的单步执行单元,接收 Manager 分发的具体子任务与当前环境状态,执行键鼠操作、API 调用等,并返回观察结果(新的截图、执行状态)。每个子智能体运行在独立的线程或进程中,实现真正的并行执行。
- 动态重规划:Manager 收集子智能体返回的新信息后,会修订 DAG(添加、取消或重写节点),以应对部分可观测环境带来的意外发现。例如,子智能体发现登录需要验证码,Manager 可插入一个新的“处理验证码”节点。
- 上下文传递:Manager 将上游子智能体获取的关键信息(如产生的临时文件路径、已设置的配置)编码到后续子任务中,显式解决单智能体因环境不可回溯而导致的信息丢失问题。
输出:最终任务完成状态的反馈,以及完整的操作轨迹。
差异点:相比传统单智能体 CUA 串行执行,MACU 通过 DAG 分解与 Manager 的全局调度,将任务级并行性与环境不确定性管理解耦,显著提升长周期任务的执行效率与成功率,同时保留了子智能体的模块化与可复用性。
实验
实验设计
本文在四个覆盖桌面与网页导航的基准上评估 MACU:OSWorld(桌面操作),Online-Mind2Web、WebTailBench 和 Odysseys(长程网页导航)。基线为当前主流的单智能体串行计算机使用代理(CUA),性能指标包括任务完成率与墙钟时间。MACU 使用一个 manager 模型将任务分解为有向无环图 (DAG),在每次迭代中将就绪节点并行分派给多个 CUA 子代理,并根据新发现动态修订 DAG。
关键发现
- MACU 在所有基准上一致超越强单智能体基线,任务完成率绝对提升 3.4%–25.5%。
- 在长程导航 Odysseys 上,墙钟时间缩短至单智能体的约 1/1.5,即加速约 1.5 倍。
- MACU 展现出更优的测试时扩展性,并在单智能体频繁陷入困境的复杂长程任务上成功求解。
与基线对比的深度解读
单智能体串行执行在部分可观测环境中面临两大结构性缺陷:无法并行探索导致长耗时,以及下游无法重新获取已流失信息导致卡死。MACU 通过 DAG 驱动的任务分解与并行派遣,将经理模型作为“副驾驶”持续修正计划,并显式前向传递关键状态——这相当于引入了一层结构化记忆。该设计使系统天然适应长程决策中的常见挑战:新信息出现后需要重规划、子任务之间需保留顺序依赖等。因此,性能增益并非简单来自并行,而是来自对计算机使用中部分可观测性 的有效建模。这一结果提示,将规划与执行解耦,并采用多代理协作,是走向更可靠、更快速的自主计算机使用系统的关键路径。
行业影响
落地场景
多智能体计算机使用 (MACU) 直接适用于需要长时间、多步骤、跨系统交互的自动化场景。典型的落地产品包括:
- RPA 平台:将传统机器人流程自动化升级为动态可重规划的智能体集群,处理客服工单自动填写、供应链信息跨系统同步等长链路任务。
- 浏览器自动化服务:面向电商、旅行、金融等行业,通过并行抓取、表单提交与动态决策,大幅缩短端到端执行时间。
- 企业内部智能助手:集成到企业工作台,自动完成费用报销、多源数据报表生成、竞品监控等需要同时操作多个应用的场景。
商业价值
MACU 的核心价值在于 降低长周期任务的延迟与人工介入成本,同时提升任务成功率。
- 降本:并行执行使相同硬件资源下的吞吐量提升,实测端到端时间可缩短约 1.5 倍;减少失败重试,降低计算与运营开销。
- 增收:更可靠的任务完成率(在 OSWorld 上提升 3.4-25.5%)直接增加自动化流程的覆盖范围,例如电商中自动处理退货退款可减少依靠人工的订单流失。
- 体验提升:动态 DAG 重规划让系统能应对中途出现的新信息或环境变化,避免单智能体在长任务中卡住,最终用户感知的响应速度与准确度均得到改善。
与现有产品 / 工作流的接口
MACU 的设计天然符合模块化分层架构,可无缝集成进现有 AI agent 技术栈:
- Agent 框架对接:manager 与 subagent 可基于 LangGraph、AutoGen 等多智能体编排库实现,DAG 结构可直接映射为状态图。
- 执行环境适配:subagent 仍使用单智能体的计算机使用后端(如 Playwright、Selenium、OS 遥感),无需改动现有工具链。
- 可观测性集成:通过 DAG 节点状态与前端可视化,可以插入到已有监控、日志系统,便于工程师调试和优化。
具体落地 use case
电商退货自动化:客户发起退货后,MACU 系统并行调用子智能体:一个查询订单系统获取物流状态,另一个访问库存系统确认可接收,第三个与支付网关通信准备退款。manager 根据各子智能体返回的结果动态调整流程(如物流异常则先触发人工介入),将原本需跨多个小时、多次页面的流程压缩至分钟级,提升退货处理效率与买家满意度。
金融研报自动化生成:投资机构需要定期生成覆盖多市场的宏观报告。MACU 将任务分解为数据抓取(并行爬取多家央行网站、财经数据终端)、数据清洗、图表生成与文字撰写。manager 监控各节点,当某个数据源不可用时即时替换备选源或重试,确保端到端流程不中断。相比单智能体顺序执行,并行架构使报告生成时间减半,且动态规划避免了因单个站点失效导致整个任务失败的风险。
局限
- **协调开销与任务分解质量**:论文承认多 agent 架构引入 manager 与 subagent 间的通信成本,且任务分解依赖 manager 模型的规划能力。当 DAG 构建不够精确时,可能产生冗余并行或依赖遗漏,反而延长端到端延迟。在短程简单任务上,多 agent 的额外协调可能超过其收益,但论文未充分分析该方法对任务复杂度的敏感阈值,也未给出失败案例中分解错误的定量分析。
- **实验对比范围有限**:评测仅覆盖桌面操作(OSWorld)和网页导航(Online-Mind2Web 等)两类环境,未涉及代码编辑、软件测试或企业软件自动化等更广泛的计算机使用场景。与已有单 agent CUA 基线相比,未能对比其他多 agent 框架(如 AutoGen、CrewAI)在同等 LLM 条件下的表现,使得“多 agent 协调”这一机制的增益与通用框架自然带来的并行能力的差异难以区分。
- **环境部分可观测性处理尚浅**:论文强调将部分可观测性视为首要挑战,manager 通过 DAG 传递下游不可重观测信息。然而,该方法假设 subagent 返回的观察摘要足够完整,并未设计显式的主动信息请求或不确定性管理机制。当 subagent 遗漏关键视觉线索时,manager 的 DAG 修订可能滞后,且实验未评估在这种信息丢失下的鲁棒性退化程度。