ProCUA-SFT 技术报告
训练计算机代理(CUAs)需要在大规模桌面环境中收集多样化轨迹数据。现有最大的公开数据集 AgentNet (2.25万条人类轨迹) 在监督微调(SFT)时会导致负迁移:在 AgentNet 上继续训练 UI-TARS 7B 后,OSWorld 成功率从 26.3% 降至 8–10%。 我们提出 ProCUA-SFT,一个包含 310 万步级 SFT 样本的数据集,从 93K 条合成轨迹中蒸馏而来,覆盖 2,484 种应用组合。数据通过全自动流水线生成,该流水线:(1) 在真实桌面环境中合成有根任务,种子数据包括 SpreadsheetBench 的 912 个电子表格、Zenodo10K 的约 1 万个开源演示文稿和多应用 OSWorld 配置;(2) 通过二元前提检查验证每个任务的可行性。单个视觉语言模型 Kimi-K2.5 同时充当目标生成器、前提判断器和轨迹执行器,消除了规划器与执行器的能力差距。每条轨迹被扩展为步前缀样本,精确复现推理时的上下文布局。 对 UI-TARS 7B 在 ProCUA-SFT 上微调一个 epoch,OSWorld 得分达 45.0%——比基模型提升 18.7 个百分点,比 AgentNet 训练版本高 35% 以上。ProCUA 的子集已被纳入 Nemotron 3 Nano Omni 模型的训练数据,增强了其计算机使用能力。
论文精读
TL;DR ProCUA-SFT 通过全自动流水线合成 3.1M 步骤级 SFT 样本,结合可行性预检验,将 UI-TARS 7B 在 OSWorld 上的成功率从 26.3% 提升至 45.0%,解决了 AgentNet 的负迁移问题。
问题
问题背景
计算机使用代理(CUAs)正成为自动化桌面操作的关键技术,需要大规模、多样化的轨迹数据来进行监督微调(SFT)。由于真实环境交互轨迹收集昂贵且受限于隐私与许可,现有开源数据集难以支撑模型在复杂桌面基准(如 OSWorld)上的性能提升。
现有方法局限
最大公开资源 AgentNet(22.5K 人类轨迹)在 SFT 中引发负迁移:基于 UI-TARS 7B 继续训练后,OSWorld 成功率从 26.3% 跌至 8–10%。根本原因在于:(1) 人类轨迹数量有限且应用组合单一,无法覆盖广泛的真实任务;(2) 轨迹中可能包含不可执行步骤,缺乏任务可行性验证;(3) 数据分布与推理场景不匹配,导致策略退化。
为什么这个问题难/重要
合成训练数据的关键挑战在于任务生成的真实性与可执行性。
- 技术难点:需自动化生成贴近真实工作流的任务(如跨应用操作、文件处理),并确保每个任务的前提条件可被满足(如文件存在、窗口状态正确)。任意环节的虚假信号都会污染训练。
- 业界关注度:随着 VLM 驱动的桌面代理走向产品化,训练数据的质量直接影响其决策可靠性。缺乏高质量合成管线将限制代理在开放桌面环境的泛化能力,因此该方向成为 RLHF 之外的另一个数据规模化引擎。
行业类比
这一挑战与自动驾驶中利用合成数据增强感知与规划相似:在桌面代理领域,若无法通过受控合成生成大量多样化且可验证的场景,模型将永远受限于稀缺、噪声大的人类演示。
核心洞察
- 合成数据流水线通过「任务可行性前提检查」保障轨迹质量,解决了人类演示数据引发的负迁移问题。AgentNet 作为最大规模开放 CUA 数据集,直接用于 SFT 会导致 UI-TARS 7B 在 OSWorld 上的成功率从 26.3% 暴跌至 8–10%,显示了跨收集条件的数据分布偏移会严重损害策略。ProCUA-SFT 在任务生成前用同一个 VLM 作为判决器,二进制化验证目标的执行前置条件,自动剔除不可行或模糊的任务,确保每条轨迹都对应一个真正可完成的目标。这种从源头控制数据质量的做法,比事后过滤更彻底,为大规模自动化构建可靠的 agent 训练数据提供了范式。
- 单一 VLM 同时扮演目标生成器、前提判决器与轨迹执行器三重角色,消除了传统规划器-执行器之间的能力鸿沟。以往的工作常将高层规划与底层动作割裂,使用不同模型或策略,导致生成的目标在后续执行中不可达或偏离预期分布。ProCUA 让同一模型(Kimi-K2.5)全程闭环运作,规划与执行共享表征,使得提出的任务天然匹配模型自身的操作能力边界,产出的轨迹更加一致且可复现。这种统一性还简化了数据缩放流程,无需对不同模块进行额外的对齐或蒸馏,为“单模型全链路合成”在 agent 训练数据生产中的可行性提供了有力证据。
方法
ProCUA-SFT 的方法核心是 全自动化合成与验证管道,将真实桌面内容转化为大规模、高质量的 step-prefix SFT 样本。管道按输入 → 关键模块 → 输出流程组织:
输入:真实世界内容种子
管道从三类许可宽松的真实数据启动:
- SpreadsheetBench 中的 912 个电子表格
- Zenodo10K 中约 10K 个演示文稿
- OSWorld 的多应用配置
这些内容被部署到活动桌面虚拟机中,形成任务生成的“沙盒”。
关键模块:Grounded Task Synthesis 与单模型执行
管道由三个核心阶段构成,均由单一 VLM(Kimi-K2.5) 驱动,消除传统分离式 planner–actor 架构的能力差距:
目标生成与前提条件验证
VLM 作为 目标生成器,为每个桌面内容合成具有可验证需求的 grounded task(如“在表格中计算总和并插入图表”)。随后 VLM 切换为 前提条件裁判,执行 binary precondition checking:在 rollout 前验证所需文件、应用状态是否齐全。若缺失,verdict-conditioned retry 会重新生成目标直到通过。单模型 Rollout 与自终止
通过验证的目标交由同一 VLM 作为 轨迹执行器 在桌面执行。轨迹(截图-动作序列)遵循 context windowing 策略,完全匹配后续 SFT 格式所需的上下文布局;模型根据观察自主决策动作,并在任务完成或无可行步骤时自终止轨迹。轨迹到 SFT 样本的扩展
每条成功轨迹被分解为多个 step-level 样本:每个步骤之前的完整交互历史(截图与动作)作为输入前缀,下一步动作作为标签。这种 step-prefix 设计确保训练时的上下文布局与推理时完全一致。
输出:3.1M Step-Prefix SFT 样本
最终数据集包含 310 万条样本,覆盖 93K 条合成轨迹和 2,484 个应用组合。得益于解耦的推理与环境、可插拔 VM 后端和面向吞吐的编排,整个管道可高效横向扩展。
与同类方法的差异:相比基于人类收集的 AgentNet 数据(导致 UI-TARS 性能下降的负迁移),ProCUA-SFT 通过自动化合成与严格可行性验证,实现了与基础模型相同分布的任务轨迹,避免分布漂移,并证明了单模型统一范式的有效性。
实验
实验设计
基于 UI-TARS 7B 作为基础模型,研究对比三种监督微调(SFT)配置:不使用额外 SFT(原始模型)、在 AgentNet(22.5K 人类操作轨迹)上继续训练、以及在 ProCUA-SFT 上训练一个 epoch。ProCUA-SFT 包含 3.1M 步骤级样本,从 93K 条合成轨迹中蒸馏而得,轨迹覆盖 2,484 种应用组合。合成流水线完全自动化:用单个 VLM(Kimi-K2.5)生成可验证的桌面任务、通过二元前置条件检查保证任务可执行、然后执行完整轨迹并转换为 step-prefix 样本以严格复制推理时的上下文布局。评估统一在 OSWorld 基准上以任务成功率衡量。
关键发现
- 原始 UI-TARS 7B 的 OSWorld 成功率为 26.3%;用 AgentNet 继续训练后骤降至 8–10%,出现明显的负向迁移。
- 经 ProCUA-SFT 微调后,成功率跃升至 45.0%,相对基础模型提升 18.7 个百分点,相对 AgentNet 训练模型高出超过 35%。
- 成功归因于三个要素:(1) 合成任务的可行性由前置条件检查保证,无效轨迹极少;(2) 真实内容(电子表格、演示文稿)增强了环境多样性;(3) 统一 VLM 消除了规划器与执行器之间的能力差距,而 step-prefix 设计确保了训练–推理一致。
基线对比解读
AgentNet 作为最大公开人类轨迹数据集,其环境分布与 OSWorld 偏差较大,导致微调后模型反而过度拟合到窄分布而泛化崩溃。ProCUA-SFT 则通过合成数据的规模与多样性(93K 轨迹 × 2,484 应用组合)提供了更鲁棒的训练信号。统一 VLM 管线还避免了多模型(如独立的规划器、执行器)引入的兼容性问题。结果印证了在大规模桌面交互任务中,精心设计的合成数据可以大幅超越人类示范数据的训练效果,且前置条件检查是防止低质量轨迹腐蚀模型能力的关键机制。
行业影响
落地场景
ProCUA-SFT 训练的 计算机使用智能体 (CUA) 可直接嵌入任何需要跨桌面应用自动化的业务。典型场景包括:
- 企业办公自动化:处理跨 Excel / PowerPoint / 邮件客户端的多步长尾任务,如月度报表生成、演示文稿制作。
- 软件测试与 QA:在图形界面中执行回归测试,通过截图和键鼠操作验证 UI 逻辑,替代部分手工测试。
- 金融与电商后台运营:自动从交易终端、后台管理系统抓取数据,完成报表填充、订单处理等重复性操作。
商业价值
- 降本:面向 OSWorld 的 45.0% 成功率(较基线 +18.7pp)表明单轮任务可能实现无人介入,大幅减少人工桌面操作成本。
- 增收:CUA 可 7×24 小时运行,提升长尾任务吞吐(如批量处理 SpreadsheetBench 中的千级表格),直接转化为业务容量增长。
- 体验升级:将自然指令映射为键鼠流,非技术用户可通过对话完成复杂软件操作,降低工具使用门槛。
| 指标 | 基座模型 | 使用 AgentNet 微调 | 使用 ProCUA-SFT 微调 |
|---|---|---|---|
| OSWorld 成功率 | 26.3% | 8–10%(负迁移) | 45.0% |
与现有产品/工作流的接口
该方案输出的是标准 SFT 数据集 和微调范式,集成路径清晰:
- 模型供应商 可将 ProCUA-SFT 混入通用 VLM 训练,输出具备桌面操作能力的一体化模型(如 Nemotron 3 Nano Omni 已部分使用)。
- RPA 平台 可将微调后的模型作为执行引擎,替换或增强现有规则脚本,通过 screenshot-action API 驱动本地或云端虚拟机。
- 企业私有化部署 下,合成流水线可针对内部软件闭环生成本领域轨迹,持续迭代模型。
具体落地 Use Case
- 电商运营自动化:某平台运营团队需每日汇总多店铺销售数据,在 Excel 中清洗后生成 PowerPoint 周报。ProCUA-SFT 训练的智能体能跨 Chrome / Office 操作,自动完成数据导出、图表生成、邮件分发,端到端准确率显著优于单一应用的 AI 插件。
- 金融分析助手:分析师通过自然语言要求“从 Bloomberg 终端提取 AAPL 历史波动率,在 Excel 中拟合 GARCH 模型,将结果图表插入 幻灯片 并标注风险提示”。CUA 在真实的桌面环境中按步骤操作,避免手动切换窗口和格式错误,使非量化人员也能高效完成复杂分析。
局限
- **依赖单一 VLM 的管道脆弱性**:整个 ProCUA-SFT 管道的核心——目标生成、前提条件判断和轨迹执行——全部由单个 VLM(Kimi-K2.5)承担。虽然这消除了规划器与执行器之间的能力差距,但也意味着数据质量和多样性高度绑定于该特定模型的能力边界,未验证替换为其他 VLM(如 GPT-4V、Gemini)时管道的可迁移性。如果换用不同的基础模型,需要重新进行提示工程、校准和验证,增加实际应用时的切换成本。此外,该 VLM 自身的局限性(如对特定 UI 控件的识别偏差)会系统性地传导至合成数据中。
- **评估基准单一,泛化证据不足**:所有实验仅在 OSWorld 基准上报告性能,尽管 OSWorld 涵盖多种桌面任务,但计算机使用领域还包括网页交互、多模态对话框、移动界面等场景。模型在其他主流基准(如 MiniWob++、WebArena 或 AndroidEnv)上的表现未经验证,无法判断 ProCUA-SFT 带来的提升是否局限于 OSWorld 特有的任务分布。数据集构建时使用的应用组合多来自 OSWorld 配置,可能引入过拟合风险,导致训练后的策略在未见过的桌面环境或应用布局中性能下降。
- **合成轨迹的真实性与覆盖偏差**:任务生成依赖的种子内容(SpreadsheetBench、Zenodo10K 等)虽为真实世界数据,但来源固定且规模有限,可能无法代表真实用户任务的多样性和多步推理复杂度。二进制前提检查只能验证任务的可执行性,不能保证任务在语义上的合理性或与用户意图的高相关性,可能产生表面可行但实际无意义的交互序列。合成轨迹通常遵循规划-执行模式,缺乏人类演示中常见的试错、回溯和探索行为,导致学到的策略在遇到意外状态时鲁棒性不足。