CLI-Universe:面向终端智能体的可验证任务合成引擎
问题:尽管基于LLM的终端智能体已展现潜力,但高质量、可执行的训练数据稀缺仍是关键瓶颈。现有合成流程通常通过改造表层人工制品来扩展任务,常导致指令模糊、执行路径浅显、测试脆弱,无法提供强学习信号。 方法:为此,我们提出CLI-Universe,一个原则性合成引擎,用于构造终端智能体任务。它通过多维能力分类体系(领域、技能类型、能力维度、工程支柱)采样组合生成候选任务,然后基于真实技术资料进行证据引导的深度研究来验证任务。通过验证的蓝图被实例化为Docker环境,并经过多阶段可执行验证流程,包括分项评分引导的测试构建、提示条件过滤、严格的失败-通过检查。整个流程约三分之二的候选任务被丢弃,仅保留真实、可验证且具有非平凡挑战的任务。 实验:我们实例化了一个高度精炼的数据集CLI-Universe-6K(含6,000条轨迹)。值得注意的是,在此数据集上微调Qwen3-32B模型,在Terminal-Bench 2.0上达到33.4%的准确率,创造了开源数据训练(32B及以下参数)的新最佳水平,并超越了多个规模大一个数量级的模型,展示了结构化、高保真合成数据的高效性。
论文精读
TL;DR CLI-Universe 通过能力分类、深度研究和严格可执行验证合成高质量终端代理任务,其 6K 蒸馏数据集让 Qwen3-32B 在 Terminal-Bench 2.0 上以 33.4% 超过更大模型,展示了结构化高保真合成的数据效率。
问题
问题背景
基于 LLM 的终端代理 (terminal agents) 展现出自动执行命令行任务的能力,但其性能高度依赖高质量可执行训练数据。当前该领域面临的核心瓶颈是此类数据的稀缺,限制了代理的可靠性与泛化能力。
现有方法局限
现有合成管道多采用表面级改装策略,即从已有文档片段或命令日志中拼凑任务,导致三个关键缺陷:
- 指令模糊:任务描述缺乏精确约束,代理无法准确理解目标。
- 执行路径浅:生成的环境与测试仅覆盖简单操作,无法体现真实工作流的复杂性。
- 测试脆弱:验证脚本仅做浅层匹配,容易通过错误执行,提供弱训练信号。 这些方法难以保证任务的可验证性与非平凡挑战性,致使基于合成数据的模型训练效率低下。
难点与重要性
构建高质量终端代理任务需同时解决多样性覆盖、环境真实度和严格验证三重挑战:
- 能力空间组合爆炸:需从域 (domain)、技能类型 (skill type)、能力 (capability)、工程支柱 (engineering pillar) 等多维分类中采样组合,确保任务分布全面。
- 从证据到环境的实例化鸿沟:必须依据真实技术资料 (如文档、手册) 进行证据引导的深度研究,将抽象意图转化为确切的 Docker 化环境与资产,防止环境虚构。
- 多阶段可执行验证:需通过评分卡把关的测试构建、提示条件过滤和失败-通过严格检查才能保留任务,任何环节的疏漏都会引入无效数据。 业界对终端代理的自动化能力日益关注,但若无可靠合成引擎,模型进步将受限,因此高效构造可验证训练数据成为关键突破口。
行业类比
与代码大模型训练中依赖可验证的单元测试保障指令-代码对齐类似,CLI-Universe 通过构建可执行、可验证的任务环境,为终端代理提供了如同 Kattis 或 Codeforces 般的高保真训练场。
核心洞察
- CLI-Universe 的核心洞察是:**高保真可执行验证** 带来的数据效率远超数据规模。该合成引擎通过 **rubric-gated test construction**、**hint-conditional filtering** 和 **fail-to-pass checking** 等多阶段验证,主动丢弃约三分之二的候选任务,仅保留真实、可验证且具有非平凡挑战的样本。这使得仅用 6K 条蒸馏轨迹微调 Qwen3-32B,就能在 Terminal-Bench 2.0 上达到 33.4%,超越多个参数量大一个数量级的模型。与常见合成管线通过表面模式扩增、引入大量弱信号样本不同,CLI-Universe 证明了在终端代理训练中,严格的可执行性和任务深度远比数据量重要。
- 从 **多维能力分类法**(domain, skill type, capability, engineering pillar)出发采样任务空间,并基于真实技术文档进行 **证据引导的深度研究**,是 CLI-Universe 区别于以往合成方法的关键设计。现有工作常通过 retrofitting 已有命令或表面信息构造任务,导致指令模糊、执行路径浅显。CLI-Universe 确保每个任务根植于真实世界的技术材料,覆盖更丰富的终端操作模式,从而提供多样的学习信号。这种从能力结构自上而下生成任务的方式,有效避免了分布偏差,让模型学到可迁移的推理和执行能力,而非记忆特定命令序列。
方法
方法概览
CLI-Universe 是一个原则性合成引擎,专为解决终端代理训练数据中“高质量可执行任务稀缺”的问题而设计。其核心流程为:从多维能力分类中采样生成候选任务 → 通过证据引导的深度研究进行蓝图构建 → 在 Docker 化环境中实现与组装 → 经过多阶段可执行验证过滤 → 输出高保真训练数据。
输入:多维能力分类采样
引擎首先定义了一个包含 Domain(领域)、Skill Type(技能类型)、Capability(能力)和 Engineering Pillar(工程支柱)的四维分类体系。通过跨维度组合采样,生成大量候选任务目标,确保覆盖从系统管理到开发运维的广泛场景。
任务蓝图构建(Task Blueprint Construction)
候选任务并非直接使用,而是经过证据引导的细化(Evidence-Guided Refinement):引擎对真实世界技术资料(如文档、手册、Stack Overflow)进行深度检索,将高层目标转化为具体的、上下文丰富的任务描述、操作步骤与预期行为。最终形成结构化蓝图,并通过验证器检查其合理性。
环境实现(Environment Realization)
验证通过的蓝图被实例化为 Docker 化环境。该阶段涉及资产物化(Asset Materialization,如安装特定工具、配置文件、模拟数据)和环境组装(Environment Assembly),确保每个任务都在隔离、可复现的环境中运行。
测试构建与可执行过滤(Test Construction and Executable Filtering)
这是保证数据质量的核心。引擎执行三个子阶段:
- 分级门控测试构建(Rubric-Gated Test Construction):基于任务蓝图生成多级评估标准,并自动生成覆盖成功/失败路径的测试用例。
- 提示条件过滤(Hint-Conditional Filtering):在任务中注入提示,若模型依赖提示才通过测试则丢弃该任务,确保任务本身可解且不含歧义。
- 失败到通过过滤(Fail-to-Pass Filtering):要求初始状态下的随机/基线策略必然失败,只有正确的解决方案才能通过,以此筛除非平凡挑战的任务。
输出
整套流程中大约三分之二的候选任务被丢弃,最终保留的是真实、可验证且具有足够难度的任务。基于此方法,论文构建了 CLI-Universe-6K 数据集。
与同类方法的差异点:现有合成管道多通过对表面工件(如命令序列)进行简单改造来扩充数据,常产生模糊指令和脆弱测试;而 CLI-Universe 通过基于深度研究的蓝图构建与严格的可执行验证流水线,从源头保证了任务的高保真度和训练信号的可靠性。
实验
实验设计
CLI-Universe 通过 多维度能力分类法(domain, skill type, capability, engineering pillar)采样候选任务,经 证据引导的深度研究 和 多阶段可执行验证(rubric-gated test construction, hint-conditional filtering, fail-to-pass checking)构建高保真训练集 CLI-Universe-6K(6000 条轨迹)。使用该数据集对 Qwen3-32B 进行微调,在 Terminal-Bench 2.0 基准上评估,并对比多种基于开源数据训练的模型,包括参数规模大一个数量级的前沿模型。同时进行了消融实验(组件效果、筛选策略、教师模型影响)与数据缩放分析。
关键发现
仅用 6K 条高质量合成数据,微调后的 Qwen3-32B 在 Terminal-Bench 2.0 上达到 33.4%,刷新了 ≤32B 参数、使用开源数据训练的模型的最佳成绩,并优于多款参数量大十倍的模型。这证明 结构化、高保真合成 能带来极高的数据效率,即使小规模数据集也能提供强训练信号。
基线对比深度解读
传统合成管线常通过拼凑表面现象生成任务,导致指令模糊、执行路径浅、测试脆弱。CLI-Universe 的核心差异在于:
- 严格的候选筛选:从候选生成到验证,约 三分之二 的候选被丢弃,只保留真正可验证且非平凡困难的任务。
- 证据驱动的环境构建:基于真实技术材料进行深入研究,确保环境具挑战性且可执行。
- 多阶段验证:通过评分卡、提示条件过滤、失败-通过检查等机制,保证每次训练的反馈信号坚实。
对比实验表明,这种“少而精”的合成策略让 32B 模型的表现超越了许多使用大规模低质数据训练的数百亿参数模型,突显了数据质量在终端智能体训练中的根本性作用。
行业影响
落地场景
CLI-Universe 合成的可验证终端操作任务,直接赋能 命令行智能助手、DevOps 自动化、云资源管理 与 安全审计 等产品。在 IDE(如 VS Code)集成智能终端,开发者以自然语言描述意图,Agent 自动生成多步 shell 脚本,完成环境搭建、依赖安装、日志分析等;云平台可嵌入该引擎,通过对话式交互管理容器、虚拟机与网络配置;安全团队可利用其生成渗透测试步骤,进行自动化漏洞验证。
商业价值
高质量合成数据显著降低 模型训练与推理成本:基于 6K 条精炼轨迹微调 Qwen3-32B 即超越多款大参数模型,使小模型私有化部署成为可能,保护企业数据隐私,同时推理延迟与硬件需求大幅降低。自动化合成管线替代人工编写验证用例,减少约 2/3 的低质候选,提升数据生产效率,实现 降本增效。对工具厂商而言,可构建差异化的终端智能层,提升开发者体验,增加产品粘性。
与现有产品 / 工作流的接口
该引擎可作为 数据工厂 输出标准轨迹数据集,直接微调开源 LLM;预训练的终端 Agent 模型可通过 插件 或 MCP (Model Context Protocol) 接入现有终端工具(如 Warp、iTerm2)或 DevOps 平台(Jenkins、GitLab CI),将自然语言指令翻译为可执行命令。在运维工作流中,可设置为监听告警并自动触发修复脚本,通过 API 与监控系统(如 Prometheus)联动。评测层面,整套验证管道可作为基准测试套件,用于筛选候选模型。
具体落地案例
- 云服务商的 AI 辅助 CLI:某全球云平台集成 CLI-Universe 微调模型,用户输入“创建一个跨可用区的 MySQL 集群并配置自动备份”,助手返回经过严格验证的 Terraform 或
gcloud命令序列,大幅降低用户学习曲线,减少误操作风险。 - 金融科技自动化运维:一家国际银行在私有云部署基于 CLI-Universe-6K 微调的 32B 模型,实时解析系统日志,当发现交易延迟异常时,自动执行缓存清理、服务重启等操作,并生成审计报告。小模型在本地低资源环境下运行,确保金融数据不离开内网,同时降低运维人力成本。
局限
- **合成管线计算成本高昂**:CLI-Universe 从候选生成到可执行验证的完整流程中,约三分之二的候选任务会被丢弃,以保证最终数据的真实性与非平凡性。这要求每个候选都经历证据引导的深度研究、Docker 环境实例化以及多阶段测试过滤,计算开销远超简单表面改写式合成方法。在大规模扩展时,筛选冗余度和资源消耗可能成为瓶颈,限制了数据集的快速迭代。
- **任务多样性受限于分类法与材料覆盖**:任务蓝本基于多维能力分类法(领域、技能类型、能力、工程支柱)的采样组合,并依赖现实世界技术材料进行实体化。尽管分类体系力图全面,但覆盖度仍受限于设计者的先验和可获取的文档资源,导致生成的任务可能集中在资料丰富的软件栈,对冷门或新兴工具涉猎不足,从而影响训练出的智能体在真实开放场景中的泛化能力。
- **验证环节对环境假设的依赖**:多阶段可执行验证假设目标任务可以被完全容器化,且通过 rubric 约束的测试和失败-通过检查能够完整判定任务成功。然而,某些终端操作可能依赖非容器化的系统状态或需要主观评估,导致漏检。此外,验证教师模型本身的偏见也可能传递至筛选标准,使得最终数据集的“正确性”分布带有教师倾向,而非纯粹的客观真值。