论文

Terminal-Universe: 将智能体轨迹转化为可扩展的终端环境

Terminal-Universe: 将智能体轨迹转化为可扩展的终端环境

随着终端智能体(terminal agents)的普及,智能体轨迹(agent trajectories)已大规模积累,然而真实、可执行的环境仍然稀缺。但环境恰恰是智能体后训练所必需的:每个环境都能被反复查询以生成大量可验证的任务,并提供执行反馈;而轨迹仅仅是单次的静态演示。我们并未从头生成环境,而是观察到现有轨迹中的工具执行历史揭示了其运行环境的结构与内容,因此可以从轨迹本身重建这些环境。为此,我们提出 Terminal-Universe,一个将每条轨迹转化为可复用环境并对其进行探索以合成新任务和持续交互的框架。 具体而言,Terminal-Universe 重放轨迹中记录的文件操作,在智能体修改前恢复每个文件,从而得到部分工作区(partial workspace);再由一个完成智能体(completion agent)补全缺失的文件与依赖。在恢复的工作区上,我们既重建原始意图任务,也合成全新任务。此外,我们沿两条互补方向扩展任务:广度上,挖掘相关环境间的有向依赖关系,合成跨代码库的跨工作区查询(cross-workspace queries),正如开发者在真实开发中常做的那样;深度上,将初始的单轮查询扩展为多轮会话(multi-round session),通过用户智能体捕获迭代式用户反馈与需求细化。 应用于公开的终端智能体轨迹,Terminal-Universe 生成了 37.3k 个任务充分的环境。基于该语料对 Qwen3.5-27B 进行监督微调,在 Terminal-Bench 2.1 上单轮性能提升 11.9 分,在 EvoCode-Bench v2 MT@4 上多轮性能提升 13.8 分。

论文精读

TL;DR Terminal-Universe 将终端 agent 轨迹回放为可执行环境,并扩展跨工作区与多轮任务,生成大规模可验证训练数据,SFT 后 Qwen3.5-27B 在 Terminal-Bench 2.1 提升 11.9 点、EvoCode-Bench v2 MT@4 提升 13.8 点。

问题

问题背景

终端代码智能体(terminal-based code agents)后训练的核心矛盾正在凸显:轨迹数据 已随 agent 运行大规模积累,但可执行环境 依然稀缺,而环境才是后训练真正需要的——每个环境可重新查询出多个可验证任务,并提供执行反馈;轨迹只是一个冻结的演示。

现有方法局限

  • 从零生成环境:现有工作用 LLM 直接合成文件系统与依赖,但这类环境往往不真实、依赖不全,且生成成本随任务复杂度剧增。
  • 直接使用轨迹:将轨迹作为 SFT 数据,仅提供单轮、单意图的静态演示,无法产生新的查询,不包含执行时反馈,也无法覆盖真实开发中的跨仓库、多轮需求变化。
  • 任务扩展受限:缺少从已有环境沿广度(跨代码库查询)和深度(多轮交互)扩展任务的机制,导致后训练数据多样性不足。

为什么这个问题难且重要

技术挑战:从轨迹逆向重建可执行工作区,需要重放文件操作恢复修改前状态,并补齐缺失的文件与依赖;验证环境可执行性本身需要可运行的 agent 交互。此外,挖掘环境间依赖关系以生成跨工作区查询,以及模拟用户多轮反馈,都增加了复杂性。

业界关注度:post-training 规模化需要海量可验证任务,环境复用能显著降低数据成本,同时提升模型在单轮与多轮场景下的泛化能力。终端 agent 的评测与训练目前严重受限于环境构建瓶颈,该方法为利用已有轨迹增量构建训练基座提供了新路径。

行业类比:类似于从自动驾驶路测日志重建仿真场景,将一次性记录转化为可反复注入扰动和交互的训练环境,从而放大数据价值。

核心洞察

  • **可执行环境的价值高于冻结轨迹**:Terminal-Universe 的核心思路是回放轨迹中的文件操作以恢复 agent 修改前的 workspace,再利用 completion agent 补齐缺失文件与依赖,将单条轨迹转化为可重复查询的环境。与直接使用轨迹作为 SFT 样本相比,环境可将每个 workspace 重新询问为多个可验证任务,并提供 execution feedback,使训练数据从静态演示升级为动态交互来源,显著提升数据效率。
  • **双轴任务扩展模拟真实开发模式**:框架沿 breadth 和 depth 两个维度扩增任务:breadth 挖掘环境间方向性依赖并合成跨 workspace 查询,depth 引入 user agent 将单轮查询扩展为多轮迭代反馈。这种设计与以往只做单 workspace、单轮合成的数据增强不同,更贴近实际开发中跨代码库检索与需求逐步细化的过程,有助于模型学到更通用的 agent 行为。
  • **以验证为中心的自动化数据生产闭环**:Terminal-Universe 在重建 workspace 上通过 verifier 过滤任务,确保生成样本的 execution feedback 正确可靠,形成“重建-重查询-验证”的闭环。相比依赖人工标注或简单重放,该框架利用可执行环境的反馈信号自动筛选高质量 SFT 数据,支持大规模、低成本且可复用的训练语料构建,为终端 agent post-training 提供了可扩展方案。

方法

输入与重建

Terminal-Universe 的输入是已有终端智能体的历史轨迹,每条轨迹包含一系列工具调用与文件操作记录。方法先回放轨迹中的文件操作,将每个文件恢复到智能体修改前的状态,得到一个部分工作区;随后由一个 completion agent 补齐缺失的文件与依赖,形成可执行的完整环境。该过程不对环境做从零生成,而是利用轨迹中暴露的结构与内容进行重建。

关键模块

  1. 环境重建:基于轨迹回放得到部分工作区,再用 completion agent 根据现有文件结构、错误信息等补全缺失项,最终产出任务充分环境。
  2. 再查询与任务合成:在恢复的工作区上,既重建原始任务意图,又生成全新任务。任务扩展沿两个轴向:
    • 广度扩展:挖掘不同工作区之间的定向依赖关系,合成跨代码库查询任务,模拟真实开发中多仓库联调场景。
    • 深度扩展:将单轮查询扩展为多轮会话,用一个 user agent 模型产生迭代的用户反馈与需求细化,模拟实际开发中的持续交互。
  3. 验证与过滤:通过 verifier 对生成的任务与环境进行可执行性、正确性校验,过滤掉低质量样本,保证训练语料可靠性。

输出与差异

最终输出为 37.3k 个任务充分环境,可直接用于 SFT 训练。与从零生成环境或在固定 benchmark 上采样轨迹的方法不同,Terminal-Universe 复用现有轨迹中的隐式环境信息,以低成本重建可查询、可验证的多样环境,并通过广度/深度两个轴向系统化扩展任务分布。

实验

实验设计

Terminal-Universe 从公开终端 agent 轨迹重构出 37.3k 个 task-sufficient 工作区,再通过意图恢复、单工作区新任务合成、跨工作区查询、多轮用户查询四类方式生成 SFT 语料。使用 Qwen3.5-27B 进行监督微调,在 Terminal-Bench 2.1 上评估单轮性能,在 EvoCode-Bench v2 上以 MT@4 评估多轮性能。

关键发现

  • 在 Terminal-Bench 2.1 上,单轮性能提升 11.9 分;在 EvoCode-Bench v2 MT@4 上提升 13.8 分。
  • 广度扩展(跨工作区查询)和深度扩展(多轮会话)均带来额外增益,证明从轨迹重构环境比直接用轨迹作示范更有效。

与基线对比

基线为未做该 SFT 的 Qwen3.5-27B。提升不仅来自更多数据,还因为重构环境提供了可执行反馈,使训练样本可验证、可重新查询。相比将轨迹作为冻结演示,Terminal-Universe 把每个轨迹变成可复用环境,支持生成多样任务和持续交互,覆盖真实开发中的跨代码库与需求迭代场景。这种设计放大了 trajectory 的价值,为终端 agent 后训练提供了更可扩展的路径。

行业影响

落地场景

Terminal-Universe 可直接用于代码 agent 的训练数据生产线。企业可从 agent 交互日志(IDE 插件、CI/CD 部署记录、自动化运维脚本)中恢复出可执行 workspace,再合成带执行反馈的任务。适用产品包括智能 IDE、企业 DevOps 助手、开源模型微调数据供应商。对工程启示:利用已有轨迹逆向生成环境,成本远低于从零构建虚拟环境,且更贴近真实上下文。

商业价值

该方法大幅降低环境构建与标注成本。传统方式需人工复现代码库并编写验证脚本;Terminal-Universe 半自动重建 workspace,单条轨迹可扩展出多个任务。用此语料 SFT 后,Qwen3.5-27B 在 Terminal-Bench 2.1 提升 11.9 分,在 EvoCode-Bench v2 多轮 MT@4 提升 13.8 分。模型更可靠,可减少人工介入,转化为用户续费、降低 support 成本和加速交付。

与现有产品/工作流接口

可作为现有 agent 训练栈的环境生成层:

  • 对接 CI/CD 系统(GitHub Actions、GitLab CI),从构建日志还原测试环境。
  • 对接轨迹收集框架(LangSmith、AgentOps),将历史 session 转为可复用 workspace。
  • 产出数据可喂给 SFT/RLHF pipeline 或作为 reward model 的 sandbox。

具体落地场景

  1. 电商平台代码助手:从跨微服务修改促销逻辑、库存同步的 agent 轨迹恢复 workspace,合成跨仓库查询任务,训练 agent 自动完成“在订单服务和库存服务中同时调整满减规则”这类多步操作。
  2. 金融系统自动化测试:从交易系统终端调试记录重建沙盒环境,生成多轮“用户反馈→修改代码→验证”的训练任务,提升 agent 在受监管环境下的准确性。

局限

  • - **环境重建的完整性风险**:论文承认环境重建依赖 completion agent 补全缺失文件,可能引入错误或幻觉,导致重建后的 workspace 与原始环境存在偏差。虽然 verifier 进行过滤,但无法完全保证可执行性与正确性,尤其在依赖复杂或版本敏感的场景中。
  • - **任务扩展的泛化局限**:breadth 扩展依赖跨 workspace 的依赖关系挖掘,但实际依赖关系可能稀疏,限制了可扩展的环境数量;multi-round 用户代理模拟的反馈类型有限,难以覆盖真实用户需求的多样性和模糊性。此外,实验仅在 Qwen3.5-27B 上验证 SFT 效果,未探索不同模型规模或结合 RL 的收益。
  • - **与同类工作对比不足**:论文未与从零生成环境的强基线(如合成环境生成器)直接对比,难以评估重建路线的相对优势;数据构建流程涉及多个 agent 和 verifier,工程复杂度高,且未深入分析数据质量、多样性与模型性能之间的定量关系。
论文Jie Wu2026-09-03原文

相关内容