OpenThoughts-Agent: 面向智能体模型的数据配方
问题: 智能体语言模型极大拓展了AI应用,但如何为通用型智能体策划训练数据尚不明确。现有开源工作如SWE-Smith、SERA、Nemotron-Terminal通常针对单一基准,缺乏跨任务泛化能力。 方法: OpenThoughts-Agent (OT-Agent) 项目提出完全开源的数据策划流程。通过超过100项控制消融实验,系统探究流程各阶段,揭示了任务来源与多样性的重要性。 实验: 基于流程构建包含10万样本的训练集,并微调Qwen3-32B模型。在7个智能体基准上取得平均44.8% 准确率,较最强开源数据智能体模型Nemotron-Terminal-32B (40.9%)提升3.9个百分点。训练数据呈强扩展性:在计算控制比较中,各训练规模下均优于其他开源数据集。 结论: 代码、数据集及模型已在 openthoughts.ai 开源,支持未来智能体模型训练研究。
论文精读
TL;DR OpenThoughts-Agent 公开了一套经过 100+ 次消融实验验证的智能体训练数据配方流水线,用 100K 数据微调 Qwen3-32B 即达到 44.8% 平均准确率,超越最强开源模型 Nemotron-Terminal-32B,且数据缩放性质良好。
问题
问题背景
代理语言模型 (Agentic LM) 正推动 AI 从被动问答走向自主执行代码编辑、终端操作等复杂数字任务。业界期望通过有监督微调 (SFT) 和强化学习训练出能在多个基准上稳定迁移的通用代理模型,然而如何系统化地构建泛化能力强的训练数据仍是一个开放问题,公开知识体系中缺乏可靠的数据配方指南。
现有方法局限
- 单基准过拟合:现有开放数据集如 SWE-Smith、SERA、Nemotron-Terminal 主要围绕特定评测(如
SWE-bench)设计,训练出的模型在其他代理任务上泛化乏力,无法反映真实场景的多样性。 - 数据管护黑箱:多数流水线依赖人工启发式,未对任务来源、混合策略、增强方法、过滤标准等关键环节进行受控消融,方法难以复现或迁移。
- 任务覆盖狭窄:任务来源单一,缺少多步骤推理、长程依赖与工具组合的覆盖,导致模型在未见过的代理场景中性能骤降。
难点与重要性
代理任务分布广且结构复杂,构建通用训练数据需同时兼顾 任务多样性、难度梯度 与 样本质量。对每个环节(如任务源选择、混合比例、过滤阈值、教师模型选择)进行系统消融需海量计算资源,极少数团队有能力公开完整实验。业界对可泛化代理模型需求迫切,但优质训练数据配方的缺失成为瓶颈;解决该问题将直接降低代理人智能体开发门槛,并加速从聊天模型到可执行操作模型的范式迁移。
行业类比
如同训练通用代码助手——仅用 Python 单题数据无法培养出处理多语言、多仓库、多开发场景的编程能力,必须从数据源头和混合配比入手,才能获得稳健的跨任务泛化;代理模型的训练同样需要一份精心调配的 ``数据食谱''。
核心洞察
- 数据多样性是智能体泛化能力的第一驱动力:本文通过超过 100 项消融实验证明,任务来源的多样性与混合策略对模型在多个基准上的平均性能影响最大,其贡献远超简单地扩大单一来源的数据规模。这与以往面向单一基准(如 SWE-Smith、SERA)的数据集构建思路形成鲜明对比,表明追求 benchmark-specific 的数据集无法培养出跨任务的通用智能体能力,而多样化的任务分布才是实现 agentic generalization 的关键。
- 开放数据管线能够在同等算力下超越现有专有方案:完全开源的 OT-Agent 管线所产出的 100K 训练集,使 Qwen3-32B 在七个智能体基准上的平均准确率达到 44.8%,比最强的同类开源模型 Nemotron-Terminal-32B 高出 3.9 个百分点。更重要的是,在计算量控制实验中,该数据集在任何规模下均优于其他开源数据集,证明精心设计的开放数据配方可以打破“闭源数据带来性能优势”的既有认知,为业界提供了一个可复现、可迭代的基线。
方法
OpenThoughts-Agent (OT-Agent) 的数据整理流水线遵循 “来源 → 混合 → 增强 → 过滤 → 生成” 五阶段流程,旨在产出可泛化到多个智能体基准的高质量 SFT 数据。
流水线阶段
- 任务来源 (Task Sources): 从多样化的代码、命令行、GUI 操作等任务池中初始采集,确保覆盖不同交互模态与难度层级。
- 任务混合 (Task Mixing): 通过受控消融实验,确定不同来源的最优配比。实验表明,来源多样性比单纯增加数据量更关键,过度依赖单一来源会导致过拟合。
- 任务增强 (Task Augmentation): 对原始任务进行指令改写、环境参数扰动等变换,提升鲁棒性。研究比较了多种增强策略,发现适度变换能稳定提升下游分数,但过度变换会引入噪声。
- 任务过滤 (Task Filtering): 基于语法正确性、可执行性、奖励信号一致性等指标筛除低质量样本。特别关注长回合过滤 (filtering for longer episodes)——在固定计算预算下,延长 agent 执行步数比生成更多短回合样本更有效,这一发现直接指导了训练集构建。
- 教师模型与展开过滤: 选用强基座模型作为「教师」生成 rollout 轨迹,再通过答案正确性、轨迹逻辑连贯性等自动过滤,仅在最终成功轨迹上进行监督微调,避免了行为克隆中的错误累积。
输出与验证
- 最终产出 100K 条高质量样本,在 Qwen3-32B 上微调后,于 7 个智能体基准 (含代码修复、交互式命令行等) 取得平均 44.8% 准确率,全面超越 Nemotron-Terminal-32B。
- 通过 缩放性质实验 (scaling properties) 证明:在任意固定训练集大小下,该流水线产出的数据均优于现有开放数据集,且性能随数据量增长而稳定提升。
核心差异:与 SWE-Smith、SERA 等面向单一基准的数据方案不同,OT-Agent 通过系统性多阶段消融实验,首次揭示了「来源多样性 > 任务混合策略 > 长回合过滤 > 教师模型选择」的优序关系,为训练通用智能体模型提供了可复现的数据配方。
实验
实验设计
为了构建通用智能体模型的训练数据,作者设计了一个完整的 SFT 数据管理流水线,包含六个关键阶段:
- 任务源收集 (sourcing tasks):从多个异构任务集合中汇聚种子任务
- 任务混合 (mixing):确定各类任务的比例以形成初始训练池
- 任务增强 (augmentation):通过重写、变体生成等方式扩展任务多样性
- 任务过滤 (filtering):基于启发式规则和模型反馈筛除低质量或不适合的任务
- 教师模型选择 (teacher model):为轨迹生成选择合适的基座模型
- 智能体轨迹筛选 (filtering agent rollouts):从由教师模型产生的多步环境中过滤掉无效或过长轨迹
通过超过 100 次受控消融实验,系统性地研究了每个阶段对最终模型性能的影响。随后组装了一个包含 100K 样本 的最终训练集(称为 OpenThoughts-Agent),并在 Qwen3-32B 上进行全参数微调。评估采用 7 个智能体基准,包括代码、终端、网络交互等任务。
关键发现
- 数据多样性至关重要:混合多源、多格式的任务能显著提升模型在未见基准上的泛化能力,优于任何单一来源的训练。
- 流水线各阶段的贡献被量化:消融实验表明,任务过滤和智能体轨迹筛选对最终性能影响最大,而简单的任务增强(如重写)也能带来稳定提升。
- 缩放性质优异:在控制计算资源的对比中,OpenThoughts-Agent 数据在任意训练集大小下均优于其他开放数据集(如 SWE-Smith、SERA),证明其数据效率。
- SFT 模型已达强劲基线:仅通过 SFT,模型在 7 个基准上平均准确率达 44.8%,超越此前最强的开放数据智能体模型 Nemotron-Terminal-32B(准确率 40.9%,提升 3.9 个百分点)。
- 强化学习探索:初步 RL 实验显示出模型能涌现出探索性行为,但整体收益需谨慎设计奖励函数,避免 reward hacking。
与基线的深度对比
与 Nemotron-Terminal 相比,OpenThoughts-Agent 不仅在平均指标上更高,更重要的是其数据构建方式完全开放且可复现。Nemotron-Terminal 源于专有数据的微调,而本工作展示了如何通过精心策划公开任务源和自动化流水线达到更优性能。在计算匹配的条件下,OpenThoughts-Agent 数据集的缩放曲线高于所有现有开放数据集,说明该流水线生产的训练数据具有更高的“知识密度”,这对实际工程部署意义重大——在有限算力预算下优先考虑数据质量而非简单堆砌。
行业影响
落地场景
OpenThoughts-Agent 提供了一套完整的、可公开复现的 agentic 模型训练数据管道,其直接产出是通用 agent 微调数据集与模型。这能直接赋能需要多步骤推理与工具调用的产品,例如:
- 自动化 DevOps/SRE 助手:处理代码提交、CI/CD 故障排查、基础设施变更请求。
- 智能客服与工单系统:跨系统查询并执行业务操作(如退款、订单修改),不再仅生成回答。
- 企业知识工作流自动化:根据自然语言指令完成数据查询、报告生成、多平台信息同步。
商业价值
主要价值在于降低 agent 模型训练的门槛与成本,并提升任务泛化能力:
- 降本:公开可用的 100K 示例训练集与消融实验结论,使团队无需从头摸索数据配比与过滤策略,可节省数百 GPU 小时的探索成本。缩放实验表明,该数据在任意训练集大小下都优于其他开源数据,小数据量即可获得竞争力效果,进一步降低计算开销。
- 增效:在七项 agentic benchmark 上平均准确率从 40.9% 提升至 44.8%(+3.9 pp),尤其在代码修复、终端交互等对企业效率敏感的任务上表现显著。RL 阶段还观察到策略自主探索出更优行为,意味着更高任务完成率,可直接转化为自动化率提升。
- 体验提升:更强的泛化性使同一模型可应付多种 agent 任务,避免为每个场景部署多个专用模型,简化维护并提高用户请求的一次解决率。
与现有工作流的接口
该数据管道和模型可平滑集成进现有 AI 栈:
- 微调阶段:可直接替换现有的 SFT 数据生成环节。团队可采用其任务来源(GitHub issues、Web 终端记录等)、混合策略和轨迹过滤方法,生成符合自身业务的训练数据,再用 LoRA/QLoRA 或全参数微调适配已有基座模型。
- 推理部署:模型输出遵循标准 chat template,可接入 vLLM、TGI 等推理引擎;工具调用协议兼容常见 agent 框架(如 LangChain、AutoGen、CrewAI),无需修改现有 orchestration 层。
- 评估与迭代:项目公开的评估栈与消融实验日志,可作为内部 agent 性能回归测试的基线,帮助团队持续监测数据配比、模型尺寸等因素的影响。
具体用例
- 电商售后代理:客户要求“帮我取消最近一笔未发货订单并退款到原支付方式”。agent 需要查询订单系统、确认状态、调用支付网关执行退款。利用 OT-Agent 数据训练的模型能更好地规划并执行这一跨系统操作,减少人工坐席介入。
- SaaS 平台内部运维机器人:开发团队在 Slack 中 @bot “请重启 staging 环境中的 auth-service,并导出一份近 10 分钟的错误日志”。agent 需理解自然语言、定位对应 Kubernetes 集群、执行重启、运行日志查询并整理返回。该模型的多基准泛化能力确保在多种基础设施工具间可靠执行。
局限
- **训练数据规模与模型尺寸有限**:当前实验主要基于 32B 参数模型(Qwen3-32B)和 100K SFT 示例,尽管数据表现出缩放特性,但尚未验证在更大模型(如 70B+)上的增益是否持续。此外,100K 示例可能不足以覆盖长尾的智能体任务,部分基准准确率仍有较大提升空间(平均 44.8%)。
- **任务覆盖与评估生态不完整**:仅在 7 个智能体基准上评测,未包含更多真实世界场景(如 GUI 自动化、多步推理类)。与 Nemotron-Terminal 等专攻单基准的工作相比,本文方法的通用性虽强,但在特定任务上的极致优化可能不足。
- **数据管线依赖基座模型与教师模型质量**:SFT 数据生成与筛选大量依赖强教师模型(如未公开的更大模型)打分,这引入潜在偏差,且未充分探讨在不同基座模型(如 Llama 系列)上的迁移性。RL 阶段虽然带来了改进,但最终结果仍受限于教师模型能力上限。