CADWorld:面向长时程计算机辅助设计的计算机使用基准
计算机使用智能体越来越多地在真实桌面环境中被评估,但现有基准对专业工程工作流的覆盖有限,这类工作流的产出是持久化的结构化工件。机械 CAD(计算机辅助设计)尤其苛刻:智能体必须在长交互时程中操控几何与约束,并交付尺寸、构造结构与下游工程状态仍然有效的原生工程文件。 我们提出 CADWorld,一个面向 FreeCAD 长时程计算机使用的基准。它包含 200 个任务,覆盖 11 类 机械 CAD 工作流,包括草图、零件建模、装配、CAM、FEM、测量、网格处理与技术制图。智能体通过截图与 GUI 操作执行任务,而成功与否由针对保存的 FreeCAD 工件与辅助输出的任务专属可执行校验判定,覆盖几何属性、参数化结构、约束、制造状态与仿真结果。 - 在完整基准上评测七个现有智能体,最强智能体成功率仅 17.5%,而专家参照通过率为 87.0%。 - 较弱智能体往往在生成有效工件之前就失败,较强智能体则更多在结构、几何与构造流程要求上失败。 因此,CADWorld 揭示了通用 GUI 能力与可靠执行持久、可验证工程工作流之间的差距。项目主页:https://cad-world.github.io 。
论文精读
TL;DR CADWorld 提供基于 FreeCAD 的 200 项长时程机械 CAD 任务,覆盖 11 类工作流,评估计算机使用代理生成可验证工程产物的能力;最强代理仅 17.5% 成功率,暴露通用 GUI 操控与专业工程执行间的差距。
问题
问题背景
Computer-use agents 在桌面 GUI 自动化上取得快速进展,基准如 OSWorld、WindowsAgentArena 评估通用任务完成能力,但专业工程工作流仍缺乏系统覆盖,尤其是输出为持久化、结构化产物的场景。
现有方法局限
现有 GUI 基准主要针对网页导航、文件操作或短周期应用,任务完成后以屏幕状态或脚本判断成功,很少验证生成 artifact 的几何、参数结构与下游工程有效性。具体局限包括:
- 缺少对 CAD 软件中参数化特征树、约束求解器、制造输出(CAM/FEM)等核心状态的检查,仅凭界面快照无法判断模型是否可编辑、可制造。
- 任务多为单步或短会话,无法暴露长周期操作中的错误累积和不可逆偏差。
- 通用 agent 在 CAD 中缺乏空间推理与约束感知,常在前几步就因无效操作失败,而即使产生文件,其几何尺寸、构造顺序也可能不满足要求。
为什么这个问题难/重要
CAD 任务要求 agent 在长时间内正确操作 FreeCAD 这类专业软件,既要理解二维草图约束,又要维护三维模型特征树与装配关系,最终输出必须通过可执行检查(几何属性、参数结构、制造状态等)。任何一个早期错误都可能污染后续设计历史,导致 artifact 整体失效。实验显示最强 agent 仅 17.5% 成功率,对比专家 87.0%,说明通用 GUI 能力远不足以支撑可靠工程执行。业界对 AI 辅助设计自动化有强烈需求,但当前 agent 在结构、几何与构建过程要求上的失败,直接限制了其在真实产品研发中的可用性。
行业类比
如同代码智能体在软件工程中必须通过单元测试与 CI 检查,CAD 智能体需要跑通 FreeCAD artifact 的几何与制造验证,才能从“能点击界面”进阶为“能交付可制造设计”。
核心洞察
- CADWorld 首次将计算机使用代理评估从“操作 UI 完成预设流程”扩展到“生成图形化 CAD 项目并满足可验证的几何、约束和制造状态”。与现有 GUI 基准(如 OSWorld、WindowsAgentArena)主要关注点击按钮、提交表单等瞬态任务不同,CADWorld 要求代理在长期交互中构建持久化 FreeCAD 文件,最终成功由任务专用可执行检查对保存文件中的参数结构、草图约束、FEM 结果等进行验证。这种工件可验证性评估迫使代理理解设计的参数化依赖与工程意图,而不仅仅是界面导航。这种差异将计算机使用能力与专业设计推理区分开来,为后续研究提供了更严苛但更有工程价值的测试场景。
- CADWorld 揭示了当前代理在长程结构化任务中的过程性失败模式:弱代理卡在“生成有效工件”之前,强代理则频繁在构造历史、几何约束等过程性要求上失分。实验显示最强代理仅 17.5% 成功率,而专家为 87.0%。进一步分析发现,出错分布随能力变化:较弱模型往往无法保存合法文件或任务未完成,能力较强的模型虽然能产出外观合理的模型,却因参数丢失、约束错误或构建顺序不当而失败。这说明现有视觉-语言-动作模型的短板不仅在于操作精度,更在于缺乏设计历史语义和过程正确性的意识。未来 agent 需要融入参数化建模的逻辑推理或利用 CAD 领域工具反馈,才能提升这类持久工程工作流的可靠性。
方法
基准构建流程
CADWorld 面向 长程计算机辅助设计 (CAD) 场景,以 FreeCAD 为宿主环境,构建了 200 个任务,覆盖 11 类机械 CAD 工作流(草图、零件建模、装配、CAM、FEM、测量、网格处理、技术绘图等)。
输入:每个任务包含自然语言指令、初始 FreeCAD 项目状态(可能为空或预置几何),以及可选的参考文件。智能体通过 截图观察 桌面 GUI,并输出 键鼠动作序列(点击、拖拽、键盘输入)操纵 FreeCAD。
关键模块:
- 任务生成与分类:由 CAD 专家按真实工程流程设计,每个任务附带明确的 可执行检查器,而非仅靠文本匹配或截图对比。
- 交互接口:采用 stateful 输入组合,支持长时程动作序列,模拟人类操作 CAD 软件的方式。
- 工件级评估 (artifact-grounded evaluation):任务结束后,系统自动运行针对保存的 FreeCAD 文件(
.FCStd)及辅助输出(如 G-code、FEM 结果)的检查脚本,验证 几何属性、参数化结构、约束、制造状态、仿真结果 等维度。成功条件是所有检查通过。
输出:二元成功/失败,以及细粒度失败原因(例如“未生成有效工件”“几何尺寸错误”“约束丢失”)。基准同时报告 专家参考通过率 87.0%,确保任务可解性。
实验显示,最强的智能体仅达 17.5% 成功率,且失败模式随能力提升从“无法产出有效文件”转向“结构/几何/构建过程不达标”,说明评估必须深入 CAD 原生数据。
与同类差异:不同于现有 GUI benchmark 侧重网页或通用桌面操作,CADWorld 首次在 持久化、结构化工程工件 上执行可执行校验,直接度量 CAD 领域的长程建模可靠性。
实验
实验设计
CADWorld 基准包含 200 个任务,覆盖 11 类机械 CAD 工作流(草图、零件建模、装配、CAM、FEM、测量、网格处理、技术绘图)。代理通过截屏与 GUI 操作交互,成功判定基于对保存的 FreeCAD 工件 和辅助输出的可执行检查,涵盖几何属性、参数结构、约束、制造状态和仿真结果。在 7 个当前代理 上评估完整 benchmark,并设 专家参考通过率 作为上界。
关键发现
- 最强代理取得 17.5% 成功率,而专家参考通过率为 87.0%。
- 较弱代理通常在生成有效工件前就失败;较强代理的失败集中在结构、几何和构建过程要求上。
- 结果揭示通用 GUI 能力与可靠执行持久化、可验证工程工作流之间存在明显差距。
基线对比解读
与通用计算机使用基准相比,CADWorld 强调长期交互与可验证的工程产物。专家与最强代理之间 69.5 个百分点 的差距表明,当前的 GUI 代理虽能处理常见桌面操作,但缺乏 CAD 所需的 几何推理、参数化约束理解 和跨步骤状态维护能力。失败模式从“无法产出工件”迁移到“工件不符合规范”,指向后续应重点提升代理的结构化推理与领域知识嵌入。
行业影响
落地场景
CADWorld 直接服务于 机械 CAD 智能体 的研发与评估,可落地于以下场景:
- 设计自动化助手:在 FreeCAD 等参数化建模环境中部署 GUI 智能体,自动完成草图绘制、零件建模、装配约束、CAM 加工路径生成等工作流。
- 教育评测与培训:在线 CAD 教育平台可用该基准自动评估学生作品的结构与几何正确性,提供即时反馈。
- 制造仿真集成:将 FEM 分析、网格处理、技术图纸生成等步骤交给智能体,减少工程师重复操作。
商业价值
当前最强智能体仅 17.5% 成功率,而专家参考为 87.0%,差距意味着巨大的改进空间与商业机会:
- 降本:自动化长链路、重复性 CAD 操作,可显著降低人工设计工时,尤其是参数化变体设计与图纸生成。
- 增收:为 CAD 软件厂商提供 AI Copilot 增强订阅价值;为智能制造企业提供按次计费的自动化设计服务。
- 体验提升:智能体可实时校验约束与工程状态,减少设计错误造成的返工。
与现有产品/工作流的接口
CADWorld 基于 FreeCAD 的截图与 GUI 动作交互,天然适合与以下 stack 集成:
- Agent 开发框架:将基准任务作为回归测试集,嵌入 LangGraph / AutoGen / CAMEL 等智能体流程中,持续评估 GUI 操作策略。
- CI/CD 流水线:厂商可在每次模型或提示词更新后自动运行 CADWorld 子集,监控成功率、几何有效性等指标。
- 商业 CAD 插件:通过 API 封装将评估逻辑迁移至 SolidWorks/Onshape 等工具,复用
artifact-grounded evaluation的可执行检查。
具体 use case:某 跨境电商平台 的定制化机械零件设计,用户上传草图后,智能体自动完成参数化建模并输出可制造文件;某 工业 SaaS 公司将 CADWorld 用作模型选型基准,筛选出擅长长程结构约束的视觉-语言模型。
CADWorld 通过将评估从“界面操作正确性”提升到“工程产物有效性”,为工业级 computer-use 智能体提供了可落地的质量门禁。
局限
- **范围与生态绑定**:CADWorld 仅基于 FreeCAD 构建,任务总数为 200,虽然覆盖 11 个类别,但每类样本量有限,且 FreeCAD 与商业 CAD 软件(如 SolidWorks、NX)在交互逻辑、默认参数和 API 上存在明显差异,代理在 FreeCAD 上的表现未必能迁移到实际工业环境。此外,评估依赖保存的 FreeCAD 项目文件和辅助输出,但真实工程中大量中间决策和临时草图不会被持久化,因此基准可能无法完全反映代理对真实长时程工作流的适应能力。
- **评估深度与主观性缺失**:当前 artifact-grounded 检查聚焦于几何尺寸、约束、参数化结构和仿真结果等可量化属性,忽略了设计意图、可制造性美学、操作效率等软性指标。专家参考通过率仅为 87.0%,表明部分任务的验收标准可能存在定义歧义或过严,影响基准的稳定性。同时,检查器只验证最终状态,不评估代理的操作序列是否合理、是否遵循最佳工程实践、以及错误恢复能力,可能高估了仅靠暴力尝试完成任务但过程混乱的代理。
- **交互模式单一与区分度问题**:基准仅提供 GUI 截图与鼠标键盘操作,没有开放 FreeCAD 的 Python 脚本接口或结构化 API 输入,无法测试代理利用程序化交互的能力,而实际工程师常混合使用 GUI 与脚本。另外,七个代理中除最强者外成功率普遍偏低,弱代理接近 0,导致基准对中等水平模型缺乏细粒度区分,不利于后续迭代。相对于 OSWorld 等通用桌面基准,CADWorld 更专业但场景更窄,代理在通用任务上已具备的视觉理解和 GUI 操控能力可能无法直接迁移,限制了基准对通用计算机使用能力的完整评估。