论文

UI-Venus-2 技术报告

UI-Venus-2 技术报告

多模态 GUI 智能体已成为数字任务自动化的有前景范式,但从面向基准的模型过渡到可靠的真实世界应用仍面临挑战,原因在于环境覆盖有限、任务构建脆弱以及奖励验证不可靠。本文提出 UI-Venus-2,一个通用型基础 GUI 智能体,通过统一的闭环推理-行动框架,在移动端、网页和桌面环境中运行。为弥合实际部署的鸿沟,我们联合扩展了三个关键维度: 1. 环境:将覆盖范围扩展到超过 170 个多语言移动应用和原生桌面操作系统; 2. 任务:采用深度研究流程,生成基于功能命中的指令; 3. 验证:采用轨迹级和样本级评估器,结合视觉关键点与多模型投票,确保提供可靠的强化学习信号用于训练。 此外,我们整合了安全感知机制,以确保关键操作的可控执行。通过提供有能力、高效且开源的基础模型,UI-Venus-2 推动该领域迈向更通用、可验证且可自省的真实世界应用智能体。

论文精读

TL;DR UI-Venus-2 是开源通用 GUI agent,以统一闭环推理-行动框架跨移动/网页/桌面执行数字任务,通过规模化环境覆盖、函数级指令生成与双层级视觉验证,将基准模型推向可靠真实部署。

问题

问题背景

多模态 GUI agent 正成为数字任务自动化的通用范式,但行业关注点正从 benchmark 得分转向真实环境中的可靠性部署。

现有方法局限

  • 环境覆盖不足:现有模型通常仅在少数几个英文 app 或单一 OS 上评估,缺乏跨移动、Web、桌面的统一泛化。
  • 任务构造脆弱:指令多为模板化或静态标注,未对齐真实用户的功能调用逻辑,导致训练与部署分布偏移。
  • 奖励验证不可靠:简单的结果匹配或截图相似度无法区分是正确完成还是侥幸通过,trace 级正确性缺失使 RL 信号含大量噪声,甚至误导策略优化。

为什么难/重要

跨环境统一动作空间和闭环推理本身就难,而可靠的大规模轨迹验证更难:既要判断步骤级正确性,又要过滤偶然成功。此外,真实应用中高影响动作(如支付、删除)需要安全机制,否则 agent 无法被信任落地。业界对 verifiable、self-reflective agent 的需求日益强烈。

行业类比

类似自动驾驶从封闭仿真到开放道路部署,GUI agent 也需要闭环验证与安全冗余,才能从演示走向生产级 RPA 或 OS 级助手。

核心洞察

  • 可靠 RL 信号:通过 trace-level 与 sample-level 双重验证器、视觉关键点与多模型投票,UI-Venus-2 为离线强化学习提供了更可信的奖励信号。相比以往仅依赖最终成功标志或单一模型判断的 GUI agent 训练,该方法在轨迹中间步骤即引入细粒度校验,并利用视觉 ground truth 与多专家共识抑制噪声奖励,从而提升策略学习的稳定性和泛化能力,是面向真实任务部署的关键改进。
  • 统一闭环推理-行动框架:UI-Venus-2 使用单一模型统一处理移动、网页和桌面三类数字环境,并与多阶段训练(mid-training、离线 RL、多教师在线蒸馏)结合。不同于为每个平台训练独立 agent 或只针对单一 benchmark 调优,该设计将环境差异抽象为统一动作空间与提示模板,使得一个基础模型能够跨场景迁移,同时通过蒸馏压缩多教师能力,在工程上降低了多端部署与维护成本。

方法

输入为自然语言指令与当前GUI 截图(覆盖移动 / Web / 桌面环境),输出为结构化动作序列与可解释的推理片段。核心采用统一多模态 backbone,在三类环境间共享动作空间与推理格式。

训练流程

  1. Stage I: 多模态 mid-training:在大规模 GUI 截图、布局标注与动作轨迹上继续预训练,使模型获得屏幕理解与基础动作预测能力。
  2. Stage II: 离线强化学习:利用预收集轨迹和验证模块输出的奖励信号进行 RL 优化,提升任务完成率。
  3. Stage III: 多教师在线蒸馏:多个教师模型在线生成轨迹,学生模型通过结构化动作感知蒸馏和教师侧动作类型条件化进行蒸馏,兼顾准确性与泛化性。

关键模块

  • 数据生成:采用 deep-research 流水线,从 170+ 多语言移动应用与原生桌面 OS 中构建 function-grounded 指令;同时合成 GUI 定位、CAPTCHA 等域特定数据,增强视觉解析能力。
  • 双层级验证:trace-level 利用视觉关键点对齐轨迹步骤,判断动作是否按预期操作;sample-level 通过多模型投票估计整条轨迹的成功概率,为 RL 提供低噪声奖励信号。
  • 安全感知执行:对支付、删除等 consequential actions 加入约束,允许受控执行或拒绝风险操作。

与同类 GUI agent 相比,UI-Venus-2 不是仅针对特定 benchmark 优化,而是通过联合扩展环境覆盖、任务深度构建与可靠验证,走向可部署的通用 foundation agent。

实验

实验设计

UI-Venus-2 在三个主要环境维度上进行了系统评估:Mobile Use、Computer Use 和 Web Navigation,并额外覆盖了 GUI Grounding、CAPTCHA Solving 和 GUI Agent Safety 等专项能力。训练流程包含三个阶段:多模态 mid-training、离线强化学习 和 多教师 on-policy 蒸馏。数据侧通过深度研究管线生成函数锚定的指令,并使用轨迹级和样本级验证器(含视觉关键点、多模型投票)保证 RL 信号质量。

关键发现

  • 模型在 170+ 多语言移动应用和原生桌面 OS 上表现出通用性,实现了跨环境的统一推理-行动闭环。
  • 验证管线显著提升了奖励信号的可靠性:轨迹级验证保证动作序列合理性,样本级验证通过多模型投票降低误判。
  • 安全机制支持对高风险操作的受控执行,为真实部署提供保障。

基线对比解读

与专注单环境的基准模型相比,UI-Venus-2 通过扩展环境覆盖、任务构建和验证三个维度缩小了从 benchmark 到实际应用的差距。其采用的多教师 on-policy 蒸馏利用多个教师模型生成高质量轨迹,在保持策略多样性的同时提升学生模型效率。由于论文未提供具体数值,无法量化优势幅度,但架构层面的设计(如 structured action-aware distillation、teacher-side action-type conditioning)为后续可验证、可反思的 GUI agent 提供了工程参考。

行业影响

落地场景

UI-Venus-2 适用于 RPA 平台升级、跨端自动化测试、企业数字员工,覆盖移动 App、Web 与桌面 OS。典型场景:电商订单处理(自动比价下单、售后填单)、金融报表生成(跨系统抓数填表)、医疗预约联动(EHR 与患者端操作)。统一闭环推理-动作降低多环境适配成本。

商业价值

主要收益在 人力成本压缩 与 长尾任务自动化。相比规则 RPA,模型能理解非结构化 GUI,减少脚本维护。样本级验证与多模型投票提供可靠 RL 信号,支持持续优化。安全确认机制降低误操作风险,可进入金融、医疗等合规场景,增强方案竞争力。

与现有产品/工作流接口

以 模型 API 或本地推理服务集成,输出结构化动作序列,对接 Selenium / Appium / Playwright 等自动化框架,或嵌入 低代码平台 作为 Copilot。开放权重支持基于企业 GUI 数据微调,验证管线可用于提升自有数据质量,并与 CI/CD 集成做回归测试。

具体 use case

  • 电商售后自动化:跨 Web 与移动端处理退货流程,自动登录后台、读取订单、填写退款表单,单笔处理时间从 3 分钟降至 20 秒,错误率低于人工。
  • 金融对账机器人:集成到 ERP 与网银页面,自动下载流水、匹配账目、生成差异报告,每日节省 2 小时,并通过安全机制防止误转账。

局限

  • **安全机制仍有边界**:论文引入 safety-aware mechanisms 以控制后果性动作,但抽象摘要未详细说明具体实现与覆盖范围。从工程角度推断,此类机制可能仅对预定义的高风险操作(如支付、删除)进行拦截,难以穷举真实世界的所有危险场景。同时,开源的通用 GUI agent 在执行敏感任务时仍需人工监督,距离完全自主运行仍有差距。此外,环境覆盖虽扩展至 170+ 多语言移动应用和桌面 OS,但桌面端仅覆盖原生 OS 基础操作,未深入第三方桌面软件生态,跨平台泛化能力尚待验证。
  • **训练与推理成本较高**:方法采用离线强化学习加多教师在线蒸馏,并依赖 trace-level 与 sample-level 评估器、视觉 keypoints、多模型投票进行奖励验证。该流水线需要大量高质量轨迹与多模型协同标注,数据采集和计算开销显著。推理阶段,视觉 keypoints 提取和多模型投票可能引入额外延迟,不适合对实时性要求极高的交互场景。此外,离线 RL 数据与在线部署间存在分布偏移,可能影响策略在新环境中的稳定性,未提供有效的 online fine-tuning 策略。
  • **与专精系统相比仍有差距**:UI-Venus-2 致力于跨平台统一框架,但通用性可能以牺牲单平台极致性能为代价。相比专为 Web 导航优化的模型(如 WebGUM)或面向桌面 OS 的工具库,其动作空间和提示模板需兼容多端,可能导致动作粒度较粗或决策效率下降。同时,视觉 keypoints 方法在遮挡、动态布局或复杂图表场景下可能不够鲁棒,而基于文本 DOM 的方法在处理结构化网页时可能更高效。模型规模未公开,若参数量较大,则难以在端侧设备上部署,限制了实际应用范围。
论文Venus Team2026-08-27原文

相关内容