Workflow Gym 新基准:GUI Agent 在专业软件任务中成功率仅 30%
Workflow Gym用专业软件的长流程任务揭示了GUI Agent的真实水平,最强模型也仅勉强及格。
字节Seed团队推出Workflow Gym基准,测试GUI Agent在FreeCAD、剪映等56款专业软件上的338个真实工作流。平均操作超100步,最强模型Gemini 3.1 Pro单次通过率仅30.67%,而它在简单基准上超70%。这揭示了当前Agent在复杂任务上的真实能力。
正文摘录
.jpg)  你可能已经在各种 benchmark 榜单上看过 GUI Agent 的 "大胜" 了。 OSWorld 上 70%+ 的成功率、网页操作几乎封神、连写个邮件发个文件都不成问题。各家发布会 PPT 一片飘红,仿佛 AI 马上就要接管你的电脑。 但我最近读到一篇论文,感觉它把这层滤镜狠狠摘掉了。 当有人把赛场从 “Chrome + Office” 搬到 FreeCAD、QGIS、剪映、KiCad、Blender 这些真正干活的软件里,结果一下子变得非常诚实:56 款专业软件、338 个真实工作流、平均 100 步以上的操作链条,就连最强的 Gemini 3.1 Pro 和 Kimi K2.6,pass@3 成功率也只有 41% 左右,单次平均通过率只有 30% 出头。 这场考试的名字叫 Workflow Gym,来自字节 Seed 评测团队,于 6 月上旬公开。