面向科学领域的终端环境自监督扩展
终端 agent 正越来越多地部署到软件工程之外的科学与专门领域。构建训练环境需要可执行的参考行为,以及能区分语义正确与表面合理产物的领域特定验证器;为每个任务手工编写这些组件需要反复工程,且难以复用。 本文提出 software-in-the-loop reconstruction(SWR),一种自监督框架:从已有软件工作流(把结构化输入映射为输出的可执行程序)中获取参考输出与验证目标。对每个工作流执行多种输入配置,将案例划分为公开观测与隐藏评估。给定指令、输入 schema 与公开输入-输出观测,agent 在无法访问源工作流的前提下构建可编辑程序,并在隐藏配置上对照工作流输出进行评估。层次化验证器 结合领域特定语义比较、结构有效性与反捷径检查,公开反馈支持迭代修订。该构建方式无需为每个任务编写参考解即可纳入更多工作流与配置。 实验以 500 个工作流、六个领域的 46 个软件家族实例化 SWR。每任务三次尝试中,Qwen3.8-Max 解决 838 个任务并产生 1,422 条验证轨迹,过采样为 3,000 条仅重建的训练样本。对 Qwen3.8-27B 的监督微调在三个随机种子下把 Terminal-Bench 2 平均性能从 47.94% 提升到 53.56%,并在全部四项报告评估上取得四个匹配 token 语料对照中最高的平均值。 结果表明,现有科学软件可为终端 agent 提供可扩展、行为可验证的监督信号。
论文精读
TL;DR SWR 从科学软件工作流自动生成可验证终端 agent 训练任务,免人工参考解;用 500 个工作流生成 3000 条轨迹微调 Qwen3.8-27B,使 Terminal-Bench 2 从 47.94% 提至 53.56%,匹配 token 控制中最佳。
问题
问题背景 终端智能体正从软件工程向科学计算、材料模拟等专业领域扩展,此类环境必须提供可执行参考行为与领域特定验证器,才能生成可靠的行为监督。
现有方法局限 传统做法为每个任务手工编写参考解决方案和验证逻辑,重复工程量大且难以跨任务复用;验证器常仅做表面比对,无法区分语义正确与看似合理但错误的输出;同时缺乏足够的高质量训练轨迹,限制了智能体在专业领域的泛化能力。
为什么这个问题难/重要 科学软件工作流虽然可执行且覆盖丰富,但其隐藏行为无法直接观测,需要从公开输入输出样例重构可编辑程序并在隐藏配置上验证,这本质是程序归纳与语义验证的结合。层次化验证需融合领域知识、结构检查和反捷径机制,同时支持迭代修订,工程复杂度高。业界对自主智能体在真实科学任务中的可靠性高度关注,能否让智能体从已有软件自动获得行为监督,是降低环境构建成本、实现规模化扩展的关键瓶颈。
行业类比 类比图像掩码模型从像素信号中自监督学习视觉表征,该方法从软件工作流输入输出对中自监督生成终端智能体监督,类似代码智能中利用既有仓库自动合成任务与测试。
核心洞察
- SWR 的核心创新在于将终端 agent 训练环境的构建从手工编写参考解与验证器,转化为从现有软件工作流自动抽取行为监督信号,实现环境生成的自监督规模化。其独特性体现在:与 SWE-bench 等依赖人工收集任务和测试用例的基准不同,SWR 直接利用领域软件本身作为 oracle,通过执行多个输入配置并划分公开/隐藏集,自动生成可验证任务,无需为每个任务编写参考解,显著降低了环境扩展成本,并支持跨软件家族复用。
- SWR 引入的分层语义验证器通过结合领域语义比较、结构有效性和反捷径检查,解决了传统执行匹配难以区分表面合理但语义错误程序的问题。与仅用精确匹配或单元测试的终端 agent 评测相比,该验证器针对科学领域输出的多样性(文件、图、结构化数据)进行多级校验,能更可靠地筛选出真正可泛化的程序行为,避免模型通过记忆或捷径通过验证,从而保证收集的轨迹具备行为真实性。
- 从 SWR 生成的 verified trajectories 中抽样构建 SFT 语料,有效提升终端 agent 在 Terminal-Bench 2 上的性能(47.94%→53.56%),证明从科学软件工作流蒸馏出的行为监督具有训练价值。与传统使用通用代码语料或人类收集轨迹做 SFT 相比,SWR 通过行为验证保证轨迹质量,且 matched-token 控制实验显示同等 token 规模下其增益最优,表明提升来自行为特性的针对性而非数据量,为领域 agent 训练提供了可复用的自监督数据生成范式。
方法
方法概览
软件在环重建(SWR) 是一种自监督框架,从现有科学软件工作流中自动生成可验证的终端智能体训练任务。
输入与任务构造
- 对每个工作流(可执行程序),执行多个输入配置,产出结构化输入-输出对。
- 将执行案例划分为 公开观察(指令、输入 schema、部分输入-输出样例)和 隐藏评估 用例。
- 智能体仅依据公开信息尝试重建一个可编辑程序,不能访问原始工作流源码。
关键模块:层次化语义验证
候选程序在隐藏配置上运行,输出与工作流真实输出进行比对。验证器采用三层设计:
- 领域特定语义比较:检查输出是否在领域语义上正确,而非表面匹配。
- 结构有效性检查:验证输出格式和结构符合领域约束。
- 反捷径检查:识别并惩罚仅利用统计表面特征、未真正建模工作流行为的候选。
公开反馈支持智能体迭代修订,提升重建质量。
输出与训练信号
通过多次采样(每任务三次尝试)收集 成功验证轨迹,并过采样至重建专用 SFT 语料。最终用于微调终端智能体,提升终端基准(如 Terminal-Bench 2)上的平均性能。
该方法的核心在于将科学软件本身作为可执行的行为规范,无需为每个任务手工编写参考解或验证器。
与同类方法的差异:不同于需要领域专家逐任务构造执行环境和验证逻辑的既有终端智能体训练范式,SWR 直接复用现有软件工作流作为自监督信号源,实现了环境规模化与行为验证的自动化。
实验
实验设计
SWR 从 500 个科学软件工作流(46 个软件族、六个领域)中自动生成任务:对每个工作流执行多种输入配置,划分为公开观察与隐藏评估;代理基于指令、输入 schema 和公开输入输出对合成可编辑程序,由层次化语义验证器(语义比较 + 结构有效性 + 反捷径检查)判定。用 Qwen3.8-Max 对每个任务尝试 3 次,共解决 838 个任务、获得 1,422 条验证轨迹;过采样至 3,000 条 reconstruction-only 样本后,对 Qwen3.8-27B 进行 SFT;最终以 Terminal-Bench 2 全量评估。
关键发现
SFT 后 Terminal-Bench 2 平均性能从 47.94% 提升至 53.56%(三个种子平均),提升约 5.6 个百分点。在四个匹配 token 的语料控制组上,SWR 训练模型在所有四项报告评估中均取得最高均值,表明其轨迹质量优于同 token 预算的其他合成数据。此外,SWR 无需为每个任务人工编写参考解,具备工作流级可扩展性。
与基线对比
- 相对预训练基线:提升 5.6 个百分点,属于中等但稳定的增益,证明科学软件工作流能提供行为可验证的监督。
- 相对匹配 token 控制:四个控制语料未披露具体构成,但 SWR 始终领先,说明语义验证 + 隐藏评估过滤掉了表面正确的捷径轨迹,是提升关键。
- 局限:提升幅度有限,可能受工作流覆盖、验证器严格度与 SFT 数据规模制约;未来需扩大工作流数量和输入配置多样性。
行业影响
落地场景
software-in-the-loop reconstruction(SWR)可快速为科学计算与专业工具自动化生成终端 agent 训练环境。真实用例:
- 生物信息学:基于
GATK、samtools等现有命令行工作流,自动生成变异检测任务,训练 agent 操作基因组数据流水线。 - 金融量化:利用
QuantLib等定价库的工作流,构建期权定价与风险计算的终端任务,让 agent 生成可执行估值脚本。
商业价值
核心降本来自消除每任务人工编写参考解与验证器的重复工程。SWR 从现有软件执行中自动获取 reference outputs 和层级验证目标,将新领域终端 agent 的训练数据制作成本大幅降低。实验显示 Qwen3.8-27B 经 SWR 生成轨迹 SFT 后,Terminal-Bench 2 均值从 47.94% 提升至 53.56%,带来更可靠的专业任务自动化,可减少人工干预、缩短交付周期,提升咨询与科研服务型产品的利润率。
与现有产品/工作流的接口
- 训练数据管线:SWR 可作为合成数据生成器,接入现有 LLM SFT 流程(如
Hugging Face数据集、OpenHands等 agent 框架),输出 verified trajectory。 - 验证与评估:层级语义验证器可作为独立模块嵌入终端 agent 评估系统(如 Terminal-Bench),提供行为级 grounded 反馈。
- 部署集成:开发者只需打包可执行工作流为容器或 CLI,SWR 自动划分 public/hidden 配置并生成任务,可挂载到
Airflow/Kubeflow等调度系统,持续扩增训练语料。
整体上,SWR 让“软件定义终端环境”成为可规模化的数据飞轮,尤其适合具备大量成熟 CLI 工具的科学与工程软件生态。
局限
- **依赖现有软件工作流**。SWR 假设每个科学领域存在可执行程序化工作流,能产生结构化输入输出和可验证参考行为。对于缺乏此类工作流的任务,或工作流内部逻辑复杂、输入输出映射不清晰的情况,难以直接应用。论文使用 46 个软件家族、500 个工作流,覆盖六个领域,但真实科学计算中大量任务以非结构化脚本或交互式 GUI 形式存在,无法自动提取。此外,工作流的不同配置仅代表设计空间中的有限采样,训练出的 agent 在面对未见工作流家族时泛化能力未知,构建新领域环境仍需额外工程投入。
- **验证器可靠性风险**。层次语义验证结合领域特定语义比较、结构有效性和反捷径检查,并通过变异压力测试降低误判,但语义比较本身可能存在偏差,尤其对于复杂科学输出(如图形、多维数组、概率分布)难以完全自动判等。验证器在极端情况下的错误反馈会污染训练数据,影响 agent 行为。公开输入输出观察与隐藏评估的划分虽有反捷径检查,仍可能泄露部分评估模式,导致 agent 通过表面特征匹配而非真实理解完成任务。论文对验证器进行了独立审计,但审计范围有限,无法覆盖所有领域和输出类型。
- **实验范围有限**。主要微调 Qwen3.8-27B,并在 Terminal-Bench 2 上评估,未在其他基础模型(如 Llama、GPT 系列)或更广泛的终端任务基准上验证。微调数据仅 3000 条,且由 Qwen3.8-Max 采样生成,可能继承该模型的输出分布偏差。虽然相比 matched-token controls 有提升,但绝对性能仅 53.56%,距离实用仍有较大距离。此外,训练数据仅包含 reconstruction-only 任务,未涵盖终端代理所需的规划、多步工具使用等综合能力,泛化到真实科学工作场景的有效性待进一步检验。