行业新闻

Workflow Gym 新基准:GUI Agent 在专业软件任务中成功率仅 30%

Workflow Gym用专业软件的长流程任务揭示了GUI Agent的真实水平,最强模型也仅勉强及格。

字节Seed团队推出Workflow Gym基准,测试GUI Agent在FreeCAD、剪映等56款专业软件上的338个真实工作流。平均操作超100步,最强模型Gemini 3.1 Pro单次通过率仅30.67%,而它在简单基准上超70%。这揭示了当前Agent在复杂任务上的真实能力。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/1a559b6d-bc68-45a3-8aea-9a6fe5f5847e/027(2).jpg) ![图片](https://mmbiz.qpic.cn/mmbizjpg/5L8bhP5dIqFg0WfYlyqqeepLD4C3TibGpjf6FOH7EVuKjibcnDe74qjAU9XhgHylI3WghS7ricbx1ckkNhJHaQ2AnGqG5ZmOdwHJQLl99bxYHU/640?wxfmt=webp&from=appmsgimgIndex=0) 你可能已经在各种 benchmark 榜单上看过 GUI Agent 的 "大胜" 了。 OSWorld 上 70%+ 的成功率、网页操作几乎封神、连写个邮件发个文件都不成问题。各家发布会 PPT 一片飘红,仿佛 AI 马上就要接管你的电脑。 但我最近读到一篇论文,感觉它把这层滤镜狠狠摘掉了。 当有人把赛场从 “Chrome + Office” 搬到 FreeCAD、QGIS、剪映、KiCad、Blender 这些真正干活的软件里,结果一下子变得非常诚实:56 款专业软件、338 个真实工作流、平均 100 步以上的操作链条,就连最强的 Gemini 3.1 Pro 和 Kimi K2.6,pass@3 成功率也只有 41% 左右,单次平均通过率只有 30% 出头。 这场考试的名字叫 Workflow Gym,来自字节 Seed 评测团队,于 6 月上旬公开。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-07-23原文

相关内容