OSWorld-Science: 面向学习与使用科学软件的计算机使用 Agent 基准
科学软件对基于 VLM 的 computer-using agents 提出了严苛考验:完成科研流程需要解读专用界面、操作科学对象,并产出可验证的结果。为此,我们提出 OSWorld-Science,一个把具有科学意义的任务、基于产物的评测与高效 agent harness 结合起来的基准与评测环境。 该基准包含 12 个 VLM 与 146 个高质量任务,覆盖分子绘制与逆合成、病理图像分析、统计计算、物理仿真等流程,横跨多个科学领域与软件配置。任务由专家提案与迭代式 human–AI co-design 共同产出,并以科学价值与难度为筛选依据。 评测方面,任务专用的执行式评测器会检查应用状态与生成的产物——包括分子结构、分割掩码、图表与数值结果——并对未完成的结果给予部分分数。专用 harness 集成 model adapters、interaction-loop control 与 trajectory logging,支持比较不同模型与交互策略。 结果显示,当前 SOTA VLM 即便配合强 harness,在回答科学领域关键问题上仍面临挑战。我们还从多语言、reasoning effort、上下文长度等因素出发分析评测结果,得出若干重要结论与发展方向。总体而言,我们提供了一个连接专家定义的科学目标与可验证软件产物的整合框架,可系统评估科学工作流中的 agent 能力与 harness 设计。
论文精读
TL;DR OSWorld-Science 构建科学软件计算机使用智能体基准,含 146 个跨领域任务,用执行评估器验证产物并给部分得分,揭示当前 VLM 仍难完成科学工作流。
问题
问题背景
计算机使用智能体(computer use agents) 基于 VLM 在通用软件操作上取得进展,但科学发现场景中,如何系统评估智能体学习并使用专业科学软件仍是空白。
现有方法局限
现有 benchmark 主要关注通用 GUI 操作(如网页导航、办公软件),或采用 API / 纯文本交互 简化任务。这些方法存在明显局限:
- 科学软件界面高度专业化,通用操作评测无法反映真实工作流;
- 任务多为端到端成功/失败判定,缺乏对中间产物(如分子结构、分割 mask、统计结果) 的精细评分;
- 缺少统一 harness 支持多模型适配、交互循环控制和轨迹记录,难以公平对比。
为什么这个问题难/重要
科学软件任务要求智能体同时理解视觉界面和领域知识,例如在 PyMOL 中操作分子、在 ImageJ 中分析病理图像。挑战在于:
- 界面复杂性:多窗口、工具栏、菜单层级深,视觉解析易出错;
- 结果可验证性:科学结论需要符合领域规则,而非仅完成任务步骤;
- 效率与成本:真实科研流程长,推理开销大,当前 SOTA VLM 仍难应对。
该方向受到 AI for Science 和自动化科研社区的广泛关注,若能突破,将显著加速实验设计、数据分析与模拟验证。
行业类比
类似自动驾驶中的高保真仿真测试——只有将真实环境中的关键变量和验证标准纳入闭环,才能可靠推动系统从演示走向实用。
核心洞察
- OSWorld-Science 将评估焦点从“界面操作正确性”转向“最终科学产物的可验证性”。与通用 GUI agent benchmark 相比,该基准以领域专家定义的科研工作流为核心,通过检查分子结构、分割掩码、数值结果、图表等 artifact 来判定任务完成度,使得评估更贴近真实科研价值产出,而非仅仅模仿点击路径或界面导航。
- 引入部分分机制与任务特定执行器,允许对不完整结果进行量化评分。现有 agent benchmark 多采用二元成功/失败判定,而科学任务常需多步渐进产出,部分分能更精确区分模型能力差异,也鼓励 agent 在局部失败时继续探索可交付的中间产物,从而更符合真实科研迭代过程中的容错需求。
- Harness 设计被提升为与模型能力并列的系统性变量。论文构建的集成 harness(模型适配、交互循环控制、轨迹日志)不仅可公平比较不同 VLM,还通过消融分析上下文长度、推理努力、多语言等因素,揭示当前 SOTA VLM 在科学软件交互层的大量失败,为后续 agent 工程提供了可复现的实验基线与诊断工具。
方法
输入
OSWorld-Science 接收一个由**视觉语言模型(VLM)**驱动的 computer use agent,并为其提供一组科学软件环境与任务描述。每个任务包含自然语言指令、软件初始状态和可执行环境。任务覆盖分子绘制与逆合成、病理图像分析、统计计算、物理仿真等,软件包括常用科研工具。
关键模块
- 任务构建管线:通过领域专家提案,结合人机协同设计迭代生成任务。候选任务依据科学价值与难度筛选,最终保留 146 个高质量任务,分布于 12 种 VLM 配置。
- 执行环境与交互控制:基准提供一个统一的 agent harness,集成模型适配器、交互循环控制(如操作步数上限、动作空间)和轨迹记录。agent 通过 GUI 操作软件,产生界面操作序列。
- 基于产物的评估器:每个任务绑定一个执行时评估器,直接检查应用状态和生成的文件(分子结构、分割掩码、图表、数值结果)。评估器支持部分得分,即对不完整但正确的中间结果给予分数。
- 多因素分析:对结果进行跨语言、推理努力、上下文长度、历史窗口等维度的消融分析,定位失败原因。
输出
输出为每个任务的自动化得分(0–1 或离散等级),以及轨迹日志、交互统计。最终提供系统性的模型能力对比和 harness 设计建议。
差异点
与现有 computer use benchmark(如 OSWorld)相比,OSWorld-Science 首次将科学软件中的产物级验证(分子结构、分割掩码)与部分评分引入通用 agent 评估,并且通过专家参与的任务设计保证科学合理性,而非仅依赖操作成功与否。
实验
实验设计
OSWorld-Science 包含 146 个高质量科学软件任务,覆盖分子绘图与逆合成、病理图像分析、统计计算、物理模拟等领域;评估 12 个基于 VLM 的 computer use agents。任务经专家提案与人类-AI 协同设计筛选,执行器检查应用状态与生成产物(如分子结构、分割掩码、图、数值结果)并给予部分信用。特殊 harness 集成模型适配器、交互循环控制与轨迹日志,支持模型与交互策略对比。
关键发现
当前 SOTA VLM 即使在强 harness 下仍面临科学领域关键问题挑战。多语言、推理努力、上下文长度等因素分析表明:
- 不同领域表现差异大,交互层失败与方法失败是主要瓶颈;
- 终端作为默认工具在某些科学应用中带来明显界面开销;
- 部分信用评价能更细致区分部分完成度,而非只给二元成功。
对比解读
与通用 computer use 基准(如 OSWorld)相比,该基准侧重科学意义任务与 artifact-based 评估,连接专家定义的科学目标与可验证软件输出。这提示评估应从端到端成功率扩展到产物精度与部分完成度;harness 设计对结果影响显著,模型适配器与交互控制可帮助 SOTA VLM 缩短差距,但仍有大量空间。
行业影响
落地场景
OSWorld-Science 面向 科学软件自动化,适用于需要代理操控 GUI 并产出可验证结果的场景:
- 药物研发与化学信息学:分子绘图、逆合成分析等任务,代理生成的结构文件可直接供下游模拟或合成使用。
- 病理与生物医学影像:在 ImageJ 等软件中执行分割、量化分析,输出 segmentation mask 供诊断或研究。
- 统计计算与教学辅助:代理操作 R、SPSS 等完成统计检验并生成图表,降低非编程用户门槛。
- 物理仿真与工程:Ansys Fluent、OpenFOAM 等 CFD 工具操作,需理解网格、边界条件与结果验证。
商业价值
- 降本:自动化重复性科学软件操作(如批处理病理切片、生成分子库),减少人工操作时间,尤其适用于 CRO 或研发外包机构。
- 增收:可作为 垂直领域 agent 产品的核心能力评估标杆,帮助厂商验证模型在专业软件上的可靠性,支撑产品定价与差异化。
- 体验提升:科研人员用自然语言驱动专业软件,降低学习曲线,提升实验记录与复现效率。
与现有产品/工作流的接口
- 评估套件集成:OSWorld-Science 提供 harness、模型适配器与日志记录,可嵌入现有 agent 开发流水线(如 LangChain、AutoGen)作为回归测试集。
- RPA/桌面自动化升级:结合 PyAutoGUI、Selenium 等工具,其 artifact-based evaluator 可校验 GUI 操作结果(文件、图像、数值),比传统像素比对更可靠。
- LIMS/ELN 系统集成:通过 API 将代理执行任务的结果写入电子实验记录本,形成闭环工作流。
具体 use case:
- 生物医药企业:部署基于 VLM 的 agent 自动完成 PyMOL 蛋白质可视化操作与结构比对,产出报告,供结构生物学家复核。
- 在线教育平台:提供“AI 助教”帮学生完成 SPSS 统计分析,自动生成规范图表和结果解读,提升课程互动性。
局限
- **任务规模与领域覆盖有限**:该基准仅包含 146 个任务和 12 个 VLM,覆盖分子绘图、病理图像分析、统计计算与物理模拟等少数几个科学领域,软件配置也难以穷举科学计算生态中多样化的工具(如命令行工具、脚本接口、HPC 环境)。任务数量少、领域狭窄,可能导致评估结果高度依赖特定软件界面和交互模式,无法充分泛化到更广泛的科研软件使用场景,限制了对通用科学 agent 能力的判断。
- **评估方法侧重产物而忽略过程合理性**:任务采用 artifact-based evaluator 检查应用状态和生成的文件(如分子结构、分割掩码、图表、数值结果),虽然能验证最终结果,但无法评估 agent 在过程中的推理正确性、操作效率或可解释性。可能奖励了通过错误方法偶然得到正确产物的 agent,或惩罚了方法正确但界面操作失误的情况,导致分数不能完全反映科学推理能力,且部分任务的自动评分器可能存在漏判或误判。
- **与同类工作的差异化不足且社区采用度低**:相比 OSWorld 等通用计算机使用基准,OSWorld-Science 主要贡献在于领域任务和 artifact 评估,但未对科学软件操作特有的语义理解、长程规划、多步回溯等能力进行深入拆解;实验只比较了有限的闭源与开源模型,缺少对推理增强、微调或小型多模态模型的系统分析。此外,该基准发布初期 GitHub stars 仅 5,尚未获得社区验证,长期有效性、可复现性和任务维护成本有待观察。