CalibForge: 面向可扩展可学习终端任务生成的对抗性求解器校准
训练终端智能体需要可执行且可验证的任务,这些任务不仅要可解,还要对学习过程构成适当挑战。可执行性验证确立了可行性,但并不能揭示任务在给定求解器设置下表现如何。本文提出 CalibForge,一种自主终端任务合成系统,它通过验证求解器行为来对抗性校准候选任务。 系统采用两种校准策略: 1. 多求解器校准 针对异构求解器池中的分歧进行优化; 2. 对比求解器校准 针对指定的强通过/弱失败关系进行优化。 两种策略均以可证明的可解性为基础,定义了一个求解器相关的 可学习区间。使用 CalibForge,我们构建了 5,431 个校准后的终端任务。消融实验表明,这两种策略比单独的人工编写和验证或普通单求解器反馈提供了更有效的监督。在完整数据集上训练的模型在 Terminal-Bench 2.0 上达到了 32.58% 和 47.57% 的成绩。对应的基础模型最大提升幅度在 Terminal-Bench 2.0 上达到 24.71 个百分点,在 SWE-bench Pro 上达到 27.68 个百分点,在 Doc2Repo 上达到 30.04 个百分点。这些结果共同支持将求解器相关的可学习性作为构建有效且可迁移的智能体训练数据的实用目标。
论文精读
TL;DR CalibForge 通过对抗性求解器校准自动合成终端任务,定义“求解器相对的可学习区间”,为终端智能体训练提供更具挑战性和迁移性的监督信号。
问题
问题背景
LLM 驱动的终端代理(terminal agent)正被用于执行复杂的计算任务,而高质量的训练数据成为提升代理能力的关键。当前,自动合成可执行、可验证的终端任务已取得进展,但任务设计不仅要保证可行性,更需匹配代理当前的学习区间。
现有方法局限
现有任务合成系统(如 TermiGen、Pi-Data 等)主要依赖可执行性验证(executable validation),仅确认任务能否被某个求解器(solver)成功完成。这种方法存在明显盲区:
- 无法判断任务在该求解器下的难度——若所有求解器都能通过,任务提供不了有效监督;若全部失败,则沦为噪声。
- 缺少对代理学习区间的量化:单个求解器的二值反馈无法划定“适学区域”,难以规模化产出梯度合理的训练样本。
- 静态验证并不反映任务在不同能力求解器之间的行为差异,导致合成数据在训练中带来的提升有限,且难以跨任务、跨基准迁移。
为什么这个问题难 / 重要
终端代理训练的核心矛盾在于:数据必须同时满足可执行、有区分度、且能推动能力边界。手动编写这类任务成本极高;自动合成若缺乏有效的难度校准,产出的任务分布易偏向“全通”或“全败”,浪费算力且模型学不到新策略。技术上,这要求系统能动态地根据求解器行为反馈修改任务描述、约束和验证逻辑,在多种能力级别的求解器之间建立对抗或对比关系,从而定位到真实的学习区间。业界对能自适应难度的数据合成方案需求强烈,因为直接关系到终端代理在 SWE-bench Pro、Terminal-Bench 等基准上的实际表现。
行业类比
这类似于软件测试中的变异测试(mutation testing)——不仅要求测试用例能运行,还要求它能区分正确实现与注入缺陷的变体,否则测试集的有效性便会存疑。
核心洞察
- **求解器相对可学习性**是任务设计的核心新维度。传统终端任务合成(如TermiGen)仅验证任务的可执行性(是否存在一条成功路径),这无法保证任务对特定模型具有合适的难度——太简单则无监督信号,太难则无法学习。CalibForge 通过对抗性求解器校准,显式建模“任务-求解器”交互:利用异构求解器池中的 pass/fail 分歧或指定强弱求解器的对比关系,锚定一个**可学习区间**,确保生成的任务既非平凡也非不可及,从而大幅提升训练数据的有效性。这从根本上超越了单纯的可执行性验证范式。
- **多求解器对抗校准**提供了一种自动化的能力边界采样机制。CalibForge 的校准循环不断修正任务提示(如移除线索、增加语义模糊性),直至弱求解器失败而强求解器通过,或是产生求解器间的不一致。这种过程相当于在目标模型的“最近发展区”密集采样,自动构造出课程式难度的训练实例。实验表明,仅靠这种校准生成的数据(无需人工)就能使模型在 Terminal-Bench 2.0、SWE-bench Pro 等不同基准上取得最高达 30.04 个百分点的提升,证明了以求解器行为为反馈的合成策略具有极强的数据效率和跨任务迁移性。
方法
输入
- 初始候选任务:由任务生成器(LLM)根据线索(clue)创作,经基础可执行验证确保格式正确且有解,但未评估难度与学习价值。
- 异构求解器池:包含多个能力不同的求解器(如不同配置的智能体或模型),用于探测任务的可解性分布与难度边界。
- 校准策略:选择多求解器校准或对比求解器校准,并指定强/弱求解器关系或分歧目标。
关键模块
- 执行反馈收集:池中每个求解器独立执行候选任务,记录通过/失败状态与执行轨迹(如错误日志、最终输出)。
- 对抗性校准循环:
- 多求解器校准:分析求解器行为是否出现分歧——部分通过、部分失败。若全部通过,任务偏易,生成器移除提示或增加约束;若全部失败,任务偏难或有歧义,生成器澄清语义或简化条件;仅当存在分歧时,任务处于“求解器相对可学习区间”,保留并可能微调以稳定分歧模式。
- 对比求解器校准:设定强求解器应通过、弱求解器应失败。若强求解器失败,则任务过难或存在误导;若弱求解器通过,则任务可能存在捷径或过于简单。生成器据此修订任务描述、测试用例或环境,直至对比关系成立。
- 任务修订器:使用LLM根据求解器反馈生成修订版任务,可修改问题陈述、增删文件、调整验证脚本等,确保校准目标达成。
输出
- 校准后的终端任务:每个任务附带求解器行为标签(如强通弱败、求解器分歧模式),确保对目标学习者具备适当挑战性与解法多样性。
- 校准元数据:记录任务修订历史与求解器反馈摘要,便于分析难度分布与数据质量。
与同类方法差异:相比仅验证可执行性的任务合成(如TermiGen),CalibForge 以求解器行为为校准信号,通过对抗式修订主动塑造任务的相对难度,生成处于“求解器相对可学习区间”的数据,从而显著提升训练有效性与跨任务迁移性。
实验
实验设计
CalibForge 首先通过多求解器校准(利用异构求解器池中的不一致性)和对比求解器校准(指定强求解器通过/弱求解器失败的配对)自动生成 5,431 个校准终端任务。消融实验对比了三种任务构造策略:
- 仅做自动生成与可执行验证(authoring+validation)
- 普通单求解器反馈
- CalibForge 的对抗求解器校准(分为多求解器与对比式两种)
训练时,使用这些数据集对基础模型进行监督微调,最终在三个下游终端基准上评估:Terminal-Bench 2.0、SWE-bench Pro 和 Doc2Repo。
关键发现
- CalibForge 的两种校准策略均显著优于仅依赖可执行验证或单求解器反馈的数据生成,能提供更有效的监督信号。
- 在Terminal-Bench 2.0 上,使用全量校准数据训练的模型分别达到 32.58% 和 47.57% 的准确率;相比预训练基础模型,最大提升达 24.71 个百分点。
- 模型展现出强迁移能力:在SWE-bench Pro 上提升 27.68 个百分点,在Doc2Repo 上提升 30.04 个百分点,表明 solver-relative learnability 作为训练数据构造目标具有泛化性。
与基线对比的深度解读
传统任务合成止步于“是否可执行”,而 CalibForge 引入了解算器相对可学习性这一维度:通过对抗性地校准任务难度,使任务恰好落入学习器的“可学习区间”——既非 trivial 也非 impossible。这种设计哲学与课程学习(curriculum learning)理念一脉相承,但通过自动化、多求解器交互的方式实现了规模化。
基线方法(仅验证有效性或单一求解器反馈)生成的训练数据往往使模型陷入过拟合或学到噪声信号;CalibForge 校准后的数据则迫使模型捕捉鲁棒的、与终端环境交互的核心技能,因此在跨基准迁移中表现突出。该框架提供了一种可复现的、以数据为中心的途径来提升终端智能体的性能,对后续研究如何高效合成 agent 训练数据具有参考价值。
行业影响
落地场景
CalibForge 提出的 solver-relative 可学习区域 校准方法,直接服务于终端代理(terminal agent)训练数据的自动化生成。典型落地场景包括:
- 代码智能与自动化开发:生成可执行、难度适配的 shell 脚本任务或代码修复任务,用于训练 AI 程序员(如 Cursor、Claude Code 等产品的底层模型)。
- 云基础设施运维:自动生成服务器配置、调试、部署类终端任务,校准后用于训练运维 Copilot,降低人工介入。
- 教育科技:动态生成难度分级的编程练习或 CTF 安全挑战,根据学习者能力校准任务,提供个人化学习路径。
商业价值
- 显著降低训练数据获取成本:传统人工编写或简单验证的任务常因难度不适配而浪费计算资源,CalibForge 的对抗校准将合格率提升至 50% 以上,直接减少数据筛选和标注的人力与算力开销。
- 提高模型性能与迁移能力:论文显示在 Terminal-Bench 2.0、SWE-bench Pro、Doc2Repo 等评测上提升 20-30 百分点,意味着训练出的终端代理更可靠、更通用,能应对复杂生产环境,从而提升付费产品竞争力。
- 加速产品迭代:CalibForge 作为自动化数据工厂,可无缝嵌入 MLOps 流程,持续产出高质量任务,推动终端代理的持续学习与快速上线。
与现有产品 / 工作流的接口
CalibForge 以模块化方式设计,可集成进现有 AI 开发栈:
- 数据层:产出标准化 JSONL 格式的任务-解决方案对,可直接用于主流微调框架(如 HuggingFace TRL、LLaMA-Factory)。
- 工具层:依赖 Docker 沙箱执行验证,与 CI/CD 平台(如 GitHub Actions)或基础设施即代码工具(Terraform)自然兼容,可将任务执行模块封装为 MCP Server 供 AI 代理调用。
- 评测层:已与 Terminal-Bench 2.0 基准对齐,便于企业在内部测试集上复现和改进。
具体落地用例
- 电商平台数据库运维:大型电商在促销期间需快速诊断和修复数据库锁竞争。使用 CalibForge 生成数百个不同难度和场景的 MySQL 故障诊断任务,校准后训练运维 AI,使其能自动执行
SHOW ENGINE INNODB STATUS等命令并修复问题,故障恢复时间从平均 15 分钟降至 3 分钟。 - 金融公司代码合规检查:金融服务公司需确保内部代码库符合安全规范。CalibForge 生成大量违反/符合规则的任务变体,通过校准保证任务兼具挑战性和可解性,训练出的终端代理可自动审查并修正数百个仓库中的不合规模式,每年节省 2,000+ 人时。
这些用例表明,solver-relative learnability 不仅是一个学术指标,更是构建生产级终端代理的关键数据工程原则。
局限
- **依赖异构求解器池的质量与多样性**:CalibForge 的校准有效性高度依赖于所用求解器的行为分布。若求解器池缺乏足够差异性,多求解器校准可能退化为单求解器反馈,无法定位可学习区;若求解器能力过强或过弱,对比校准中的 strong‑pass/weak‑fail 关系难以建立,导致任务要么全通要么全败,削弱对抗校准的意义。论文未对求解器选取策略做深入分析,也未评估不同求解器组合对数据质量的敏感性,这限制了方法的鲁棒性和可复现性。
- **合成过程计算开销大**:每个候选任务需经过多轮迭代,每轮调用多个求解器执行并收集反馈,同时还需运行大型语言模型进行任务修订,整体流程耗时显著。论文仅展示了最终数据集的规模,未报告合成的时间成本或算力消耗,也未讨论如何降低校准代价。对于希望快速扩展任务集或频繁更新数据分布的场景,这一成本可能成为瓶颈,影响实际落地。
- **绝对性能仍有较大提升空间**:尽管相对基模型有大幅提升,但训练后模型在 Terminal‑Bench 2.0 上最高仅 47.57%,说明任务难度可能已超出当前模型能力的上限,或者校准后的任务仍不完全适配学习。此外,跨任务集的增益虽显著,但未分析任务特性(如长度、复杂度、领域)对迁移效果的影响,无法判断性能改善是源于通用推理能力提升还是对特定模式过拟合。GitHub 星数仅 10 也可能反映社区验证尚不充分。