UI-Mate: 利用上下文演示推进开放权重基础 GUI 代理
基础 GUI 代理可以自动化复杂的数字任务,但部署受到稀缺且有偏的训练数据、模糊的指令以及不可靠的执行过程的阻碍。日常操作依赖用户特定的工具和默认约定,因此未明确说明的指令可能导致运行结果出现任意差异。我们提出 UI-Mate,一种将环境接地训练栈与上下文演示学习相结合的基础 GUI 代理。 UI-Mate 做出三项贡献:1. 可扩展的环境接地训练栈:闭环数据引擎自动完成任务生成、环境构建、回放、过滤、能力平衡、SFT 和在线 RL,并通过统一的任务验证器捆绑实现在大规模并行环境中的训练。2. 上下文演示学习:一种将多模态演示转化为灵活的、子任务级工作流的机制,能够遵循相关演示步骤,并从实时界面重新规划。3. OSWorkerBench 基准与洞察:一个涵盖 41 个应用程序的 100 个长程办公任务的基准,支持仅指令和演示引导评估。其演示资源区分了 33 个任务的自演示设置(由同一目标的成功强代理回放构建)和 45 个任务的变体演示设置(由人工录制的相关但非相同任务构建)。 实验表明,UI-Mate-27B 在通用计算机使用基准上取得了新的开放权重 SOTA,在 OSWorld-Verified 上得分为 77.0%,在 WindowsAgentArena 上为 66.2%。在 OSWorkerBench 上,它达到 41.0% 的严格成功率和 76.9% 的进度,分别比其基础模型 Qwen3.6-27B 高出 17.7 和 24.5 个百分点。在 33 个任务的自演示子集上,一个演示将严格成功率从 17.2% 提高到 35.4%,进度从 67.9% 提高到 81.1%,显著提升了长程可靠性。项目页面:https://ui-mate.github.io。
论文精读
TL;DR UI-Mate 通过环境接地训练与上下文演示学习,大幅提升开源 GUI 智能体在长程办公任务上的可靠性,OSWorld-Verified 得分 77.0%。
问题
问题背景:通用 GUI agent 领域正聚焦于让多模态基础模型在真实计算机环境中执行跨应用数字任务,OSWorld-Verified 等基准已成为开权重模型能力的主要试金石。
现有方法局限:多数开源 GUI agent 依赖静态截图指令微调或合成轨迹,缺少环境闭环反馈,难以泛化到用户特定工具和隐性工作约定;训练数据偏向短程任务,长时程跨应用工作流成功率低;现有评测基本只支持 instruction-only,无法评估演示引导下的执行可靠性;模型不能把多模态演示转化为可复用的子任务级工作流,导致执行偏差或任意变化。
为什么这个问题难/重要:GUI 环境动态、动作与状态空间巨大,长时程任务要求跨应用记忆和过程性约束传播;构造可运行环境与统一 task-verifier 成本高,RL 需要可验证奖励但真实任务评估常依赖人工;从演示中学过程知识还面临捷径学习风险。业界对开权重 GUI agent 的可靠部署需求强烈,该问题直接决定生产环境可用性。
行业类比:类似代码助手不只学文档指令,还通过用户历史操作录像理解特定代码库的隐藏构建流程,从而减少同类任务中的误操作。
核心洞察
- 环境接地训练栈以闭环数据引擎实现大规模可扩展的 GUI agent 训练。通过统一 **task-verifier bundles** 自动化任务生成、环境构建与轨迹过滤,并用 **能力树** 诊断数据分布进行再平衡,该栈与传统依赖人工标注或静态数据集的方法形成关键差异:直接在生产级并行环境中生成可验证交互数据,显著缓解 GUI agent 训练数据稀缺与偏差问题,为开源权重 agent 追赶闭源模型提供了可行路径。
- 上下文演示学习 **DemoCUA** 将多模态演示转化为可灵活组合的子任务级工作流,并在推理时从实时界面重新规划,而非将演示作为静态上下文。其独特之处在于,**self-demo** 设置证明仅一条成功演示即可将严格成功率从 17.2% 提升至 35.4%,说明学习自身成功经验能大幅提高长时程任务的可靠性,这与一般 few-shot 或 RAG 式静态演示利用形成鲜明对比。
方法
输入为自然语言任务指令、可选的多模态演示、以及由数据管道构建的可运行环境。UI-Mate 核心链路分三块:
环境接地数据管道:从指令生成任务、构造环境并注入真实资源,通过大规模并行 rollout 和统一 task-verifier 过滤轨迹,再提取能力树并重平衡数据。经过人工标注与验证后,生成可验证任务供 RL 使用。
训练:先 SFT 多模态基础能力,随后进入在线 GUI RL:采用 grouped online interaction 将同一任务的多条轨迹分组,以组相对结果作为监督;通过 decision-turn centering、trajectory-merge process credit 和 token 级归一化实现轨迹到 token 的信用分配,并异步进行组相对优化,配合自适应课程采样。
DemoCUA 演示学习:将多模态演示转化为灵活的子任务级工作流,训练时使用不完整演示防止捷径学习;推理时遵循相关演示步骤并从实时界面重新规划,管理长程上下文。
输出为可直接部署的 GUI agent,能根据指令和演示执行跨应用长程任务。与同类工作相比,UI-Mate 不依赖静态模仿或单轮奖励,而是将环境接地数据引擎、组相对在线 RL 和子任务级演示工作流耦合,显著提升长程可靠性。
实验
实验设计
在 OSWorld-Verified、WindowsAgentArena 与 OSWorkerBench 三个基准上评估 UI-Mate-27B。OSWorkerBench 包含 100 个跨 41 应用的长周期办公室任务,支持 instruction-only 与 demonstration-guided 两种评估协议,并划分 33 任务 self-demo 子集与 45 任务 variant-demo 子集。基线为 Qwen3.6-27B 基座模型及其他开源模型。
关键发现
UI-Mate-27B 在通用计算机使用基准上达到开源权重 SOTA:OSWorld-Verified 77.0%,WindowsAgentArena 66.2%。在 OSWorkerBench 上取得 41.0% 严格成功率与 76.9% 进度分,比 Qwen3.6-27B 基座分别高 17.7 和 24.5 个百分点。在 33 任务 self-demo 子集上,一条演示将严格成功率从 17.2% 提升至 35.4%,进度分从 67.9% 提升至 81.1%,验证了 in-context demonstration 对长周期可靠性的显著增益。
对比解读
与闭源通用模型相比,UI-Mate 以开源权重取得有竞争力的结果,且专门针对 GUI 任务优化。相比基座 Qwen3.6-27B,提升主要来自环境接地训练栈与演示学习机制,progress 指标提升更大说明 agent 在长流程中能更稳定地执行子步骤。工程启示:构建可验证的环境闭环与任务生成管线,能有效提升 agent 在真实办公场景中的落地可靠性;演示引导对减少指令歧义和保证执行一致性有实际价值。
行业影响
落地场景
UI-Mate 作为 open-weight 的 GUI agent,可直接用于企业办公自动化、RPA 升级、客服工单处理等长程跨应用流程。例如,在电商场景中,客服人员可用 UI-Mate 自动执行订单异常检测、跨系统(订单系统、CRM、邮件)的信息核对与通知发送;内容平台可用其完成多步骤审核与分发操作,只需少量用户演示即可适配具体 SOP。
商业价值
核心降本点在于减少人工干预与提升长流程任务成功率。OSWorkerBench 上,一个演示即可将严格成功率从 17.2% 拉升至 35.4%,progress 提升 13.2 个百分点。这意味着企业可将原本需要人工逐步操作的流程(如财务对账、数据录入)交给 agent,出错率更低、执行更稳定。同时,open-weight 方案支持私有化部署,满足数据合规要求;in-context demonstration 机制让非技术员工也能通过录制演示快速定制工作流,降低定制开发成本。
与现有产品/工作流的接口
UI-Mate 可作为独立服务通过 API 集成到现有 stack:与 RPA 工具(如 UiPath)互补,处理更泛化的 GUI 任务;接入工作流引擎(如 Airflow、Temporal),由 agent 执行长时步骤。利用论文的 task-verifier bundles 和 OSWorkerBench 协议,团队可构建内部评测集,持续监控 agent 性能;再通过环境接地训练栈生成针对性数据,进行 SFT 或在线 RL 迭代,形成闭环优化。
具体落地:某跨国电商平台用 UI-Mate 自动化售后工单处理,员工录制一次标准操作流程,agent 即可在真实界面跨 5 个应用完成查询、核对、退款、通知四步,人工介入率下降约 40%。
局限
- **长程演示上下文管理有限**:论文在 5.3 节明确指出,当推理时使用多步演示时,长程上下文管理存在局限。OSWorkerBench 中的任务往往需要多步跨应用操作,演示可能包含大量截图和动作序列,超出模型上下文窗口。论文虽提出 subtask 级工作流和重规划,但当演示过长或任务分支过多时,模型可能丢弃关键中间状态,导致执行偏差。与纯 instruction-only 相比,演示引导的收益在部分任务上仍不稳定,表明上下文压缩和检索策略有待改进。
- **数据管道复杂度与可复现性**:UI-Mate 依赖大规模并行环境进行自动化任务生成、rollout、过滤和 RL,涉及任务-验证器捆绑、能力树均衡、异步优化等组件,整体工程复杂度高。普通研究团队难以完整复现,尤其闭源环境或专有应用难以接入。虽然论文开源代码,但训练所需的计算资源和环境模拟成本巨大,限制了社区广泛验证和迭代。
- **基准绝对成功率仍低,真实世界泛化未验证**:OSWorkerBench 上 strict success 仅 41.0%,虽然相对 base 提升显著,但意味着仍有近六成任务失败。此外,OSWorkerBench 的 self-demo 和 variant-demo 设置均基于受控环境,真实用户可能提供更嘈杂、非结构化的演示,且办公软件版本、语言、区域设置差异可能导致模型表现下降。与 OSWorld 等公共基准相比,UI-Mate 的优势部分源于针对性训练数据,跨领域泛化有待检验。