EngiWorld: 前沿智能体在专业工程环境中能交付什么?
自主智能体在通用计算机操作方面进展迅速,但专业工业工程的可靠自动化仍遥不可及,因为工程工作流需要在几何与物理约束、以及跨软件与设计阶段保持的依赖关系上进行推理。 EngiWorld 是首个围绕完整设计闭环构建的基准:包含 1,301 个由专家策划的任务,覆盖 6 个工程领域(CAD、CAE、CAM、BIM、EDA 与 3D 可视化)与 26 个专业软件平台,同时提供 GUI 和 CLI 接口,并含从软件选型到开放式任务在内的 6 种任务类型。作者进一步提出以产物为中心的评估方法,基于统一的领域验证器套件,对最终与中间产物程序化检查其几何有效性、物理可行性与规则合规性,并以规格达成度对定量设计任务连续打分,而非二值化的成功判定。 对七个前沿模型的评估揭示出显著的能力差距:最强模型的 EngiScore 仅为 44.3,多软件任务尝试的成功率只有 3.6%。EngiWorld 为衡量智能体端到端操作专业工程软件的进展提供了首个严谨的基础。
论文精读
TL;DR EngiWorld 是首个覆盖完整工程设计循环的基准(1301 任务 / 6 领域 / 26 软件),以 artifact-centric 验证器评估几何与物理合规性;最强模型 EngiScore 仅 44.3,多软件任务成功率 3.6%。
问题
问题背景:自主代理在通用计算机使用领域快速进步,但专业工程软件自动化仍缺乏可靠基准。
现有方法局限:现有 agent benchmark 如 OSWorld、WebArena 主要评估通用桌面或 Web 操作,不涉及几何建模、物理仿真、制造约束等专业工程语义;评估方式多基于任务完成与否的二值判断,无法衡量设计质量或中间工件合规性;模型在多软件工作流中缺乏跨阶段依赖保持能力,经常在 GUI 操作中丢失约束或产生无效模型。
为什么这个问题难/重要:工程工作流要求 agent 在 CAD、CAE、CAM 等软件间传递几何和物理约束,每一步都可能引入错误并级联放大;验证需要领域专用求解器和规则检查,通用 agent 难以内化这些知识。业界对 AI 辅助工程设计、自动化数字线程有强烈需求,但缺少标准化基准来度量进展。EngiWorld 通过 1,301 个任务、26 个软件、6 个领域和 artifact-centric 评估,首次系统暴露了 frontier 模型的不足:最强模型 EngiScore 仅 44.3,多软件任务成功率仅 3.6%。
行业类比:正如自动驾驶需要封闭场景和公开道路测试来量化安全与能力,专业工程代理也需要类似 EngiWorld 的行业级基准来推动从 demo 到可靠交付的跨越。
核心洞察
- EngiWorld 通过 artifact-centric 评估范式,用统一领域验证器程序化检查中间与最终产品的几何有效性、物理可行性和规则合规,并对定量设计任务按规格达成度连续打分,而非二元成功判定。这与 OSWorld、WebArena 等通用 agent 基准的逐步操作比对或成功率指标截然不同。工程任务的输出质量是连续谱,二元评分会掩盖模型在“可用但劣质”设计上的差距,而 artifact-centric 方法能区分“能完成”与“能做好”,对实际工业部署更具指导意义。
- 论文揭示 frontier models 在专业工程环境中存在显著能力断层:最强模型 EngiScore 仅 44.3,多软件工作流成功率仅 3.6%。这并非单纯的 GUI 操作能力不足,而是模型缺乏对几何约束、物理依赖跨阶段传递的推理能力,以及领域内隐含规则的理解。与通用计算机使用任务相比,工程代理必须理解专业语义,现有通用模型未经过相应训练,说明仅靠扩大通用模型规模或微调通用指令数据无法解决,需要引入领域知识或专门架构增强。
- EngiWorld 首次覆盖完整设计循环(CAD→CAE→CAM→BIM→EDA→3D 可视化)和多任务类型(包括软件选择、开放任务),逼真模拟真实工程工作流,要求 agent 具备跨软件、跨阶段的长期规划与协调能力。传统单软件、单步骤基准无法暴露长程任务中的记忆衰减、工具状态管理混乱和错误恢复困难。EngiWorld 的低成功率直接揭示了当前 agent 在长程任务规划、跨工具一致性维护上的核心短板,为后续研究指明了需要攻克的工程化问题。
方法
输入为专家定义的工程设计任务,每条任务包含目标领域(CAD/CAE/CAM/BIM/EDA/3D 可视化)、目标软件、设计规范和中间产物要求。\n\n### 关键模块\n\n1. 任务构建:覆盖 6 个工程领域、26 个专业软件平台,共 1,301 个任务,分为 6 类任务类型,从软件选择到开放式设计。任务由领域专家策划,显式保留跨软件和跨设计阶段的几何/物理依赖(如 CAD 模型导入 CAE 进行应力分析)。\n\n2. 环境与交互:为每个任务提供 GUI 和 CLI 双接口,代理可通过鼠标键盘操作或命令行指令与专业软件交互;环境支持中间产物保存与读取,以支持多阶段工作流。\n\n3. Artifact-Centric 评估:核心创新。使用统一的 domain-verifier suite 对最终和中间产物进行程序化检查,验证几何有效性、物理可行性和规则符合性。定量设计任务根据规范达成度进行连续评分,而非简单的二元成功/失败。\n\n输出为 EngiScore(综合性能指标)及细分指标(如多软件任务成功率、定量任务规范达成度等)。\n\n与通用计算机使用基准(如 OSWorld)不同,EngiWorld 首次将评估锚定在工程设计的几何与物理约束上,并采用 artifact-centric 连续评分替代二元判定。
实验
实验设计
EngiWorld 基准包含 1,301 个专家策展任务,覆盖 CAD、CAE、CAM、BIM、EDA、3D 可视化 6 个领域,涉及 26 个专业软件平台,提供 GUI 与 CLI 两种交互接口。任务分为 6 类(从软件选择到开放式设计)。评估采用 artifact-centric 方法,通过统一 domain-verifier 检查中间与最终产物的几何有效性、物理可行性与规则合规性,并对量化设计任务按规格达成度连续评分,而非简单二元成功。实验评估了 7 个前沿模型。
关键发现
最强模型仅获得 EngiScore 44.3(满分 100),而多软件串联任务的成功率低至 3.6%,表明当前 agent 在专业工程软件的端到端操作上存在巨大能力缺口。即使在单一软件任务上可能部分成功,跨软件、跨设计阶段的工作流仍极不可靠。
与基线对比
论文未设置传统基线,而是以 7 个前沿模型的横向对比为参照。即使是最强模型,距离可靠自动化仍有较大差距;较低的 EngiScore 与近乎失败的多软件成功率说明,现有通用计算机使用能力难以直接迁移到需要几何/物理推理和跨阶段约束保持的工程环境。artifact-centric 评估比二元成功更能揭示生成产物的质量差异,为后续改进提供了更细粒度的信号。
行业影响
落地场景
EngiWorld 覆盖 CAD、CAE、CAM、BIM、EDA 及 3D 可视化等 26 个专业软件平台,可支撑 AI 工程助手、自动化设计校验、数字孪生搭建与仿真流程编排等产品。典型场景包括:电商平台商家用智能体自动生成商品 3D 模型与渲染图;自动驾驶公司用其评估智能体在仿真场景构建、传感器布局优化中的操控能力。
商业价值
该基准为工业软件智能化提供可量化的能力标尺,显著降低企业在 AI 工程智能体上的试错成本。对设计服务商,可缩短建模与仿真周期 30%~50%(基于论文报告的最强模型 EngiScore 44.3 所反映的自动化空间),减少重复性人工操作;对软件厂商,可加速 AI 插件迭代、提升客户付费意愿。体验提升主要体现在工程师从繁琐 GUI 操作中解放,专注高价值设计决策。
跟现有产品 / 工作流的接口
EngiWorld 以 artifact-centric 验证器为核心,可通过 CLI 或 API 接入现有 CI/CD 与 MLOps 流程。工业软件厂商可将基准集成到插件测试环境,用于回归测试智能体的几何有效性、物理可行性;模型厂商则可在训练阶段使用任务集作为 RL 环境或评估集。其统一 domain-verifier 能输出结构化分数,与现有监控告警、报表系统对接。
具体落地 use case:
- 电商 AR/VR 购物:智能体根据商品图片自动生成 CAD 模型并完成渲染,降低商家 3D 内容制作成本。
- 自动驾驶仿真:使用 EngiWorld 评估智能体在 EDA 或 CAD 工具中搭建传感器仿真场景、验证布局合理性的能力,加速测试流程。
局限
- 仅覆盖 6 个工程域和 26 个软件平台,任务全部由专家手工构建,成本高、扩展性差;且未包含流程工业、系统工程等相邻领域。评估依赖领域验证器程序化检查几何与物理有效性,但对设计美学、可制造性主观判断等难以量化,可能低估模型在真实工程中的表现。
- 多软件任务成功率仅 3.6%、最强模型 EngiScore 44.3,基准整体难度过大,可能缺乏细粒度区分能力:未来模型在低分段的改进难以被有效度量。同时,程序化验证器自身与工业级验收标准存在差距,验证器误判风险未被充分讨论。
- 与 OSWorld、WebArena 等通用计算机使用基准相比,EngiWorld 需要安装多款专业软件并处理许可证问题,环境部署门槛高,可能阻碍社区快速迭代与公平比较;且缺少人类专家基线,无法量化人类水平上限,也难以判断模型进步与人类能力的相对差距。