NexForge: 通过需求驱动任务合成扩展 LLM 的 Agent 能力
扩展 LLM 后训练的可执行 agent 训练数据受限于基于特定环境的方法,这些方法将任务生成绑定到预定义的工具、代码仓库或技能图:增加覆盖需要手动构建环境,每个新领域都需要定制的流程,且生成的任务分布往往反映环境偏差而非真实需求。我们提出 NexForge,一种需求驱动框架,以高层能力需求为输入,合成多样化的可执行 agent 任务及用于 SFT 的专家轨迹。 NexForge 首先调研真实需求以构建代表性场景和任务画像,然后进行分布感知编译生成任务指令。对于每个指令,NexForge 自动检索或构建所需文件、依赖和运行时配置,最终合成专家 rollout 并产生训练轨迹。无需领域特定基础设施,NexForge 生成了 3.6K 终端任务和 2K 办公任务,将 Qwen3.5-35B-A3B Base 在 Terminal-Bench 2.0 上的准确率从 22.5% 提升至 52.0%,在 GDPval 上的 Elo 从 813 提升至 1338;进一步扩展到 43.2K 终端任务后达到 58.4%,与配备 Claude Code 的 Claude Opus 4.6 相当。 进一步扩展后,NexForge 合成的数据贡献于 Nex-N2 模型家族的训练,该公开可用的 agent 模型将 Qwen3.5-35B-A3B 在 Terminal-Bench 2.1 上提升至 75.3%,在 GDPval 上达到 1585 Elo——实现了开源最先进性能,并超越了若干专有前沿系统。Nex-N2 模型见 https://nex.sii.edu.cn/。
论文精读
TL;DR NexForge 提出需求驱动的任务合成框架,无需为每个领域单独构建管线,即可自动生成多样可执行的 Agent 训练数据,将开源模型 Qwen3.5-35B 的终端任务成功率从 22.5% 提升至 75.3%,达到 SOTA 并超越多个前沿闭源系统。
问题
问题背景
在 LLM 后训练阶段,智能体(agent)能力的规模化提升高度依赖可执行的任务数据和专家轨迹。如何高效地生成多样、真实的训练样本,成为当前 AI 工程化的核心瓶颈。
现有方法局限
主流方案通常采用基板绑定(substrate-bound)策略:将任务生成与预定义的工具集、代码仓库或技能图谱深度耦合。这种范式暴露三大局限:
- 扩展性差:每拓展一个新领域,需要人工构建配套的 substrate 和生成 pipeline,成本高昂。
- 分布偏差:生成的任务分布往往反映基板的预设结构,而非真实世界的需求分布,导致模型在开放环境中泛化不足。
- 可执行性脱节:任务定义、环境依赖和运行配置分立,难以端到端地合成可直接执行的专家轨迹。
为何重要且困难
真实世界 agent 任务的多样性远超静态基板的描述能力。自动合成任务必须同时满足可执行性(代码、环境、依赖正确)、分布匹配(反映真实需求)和规模化(低成本生成大量样本)三个约束,构成一个高度复杂的系统性挑战。这一问题的解决直接决定未来通用 agent 模型能否摆脱人工数据工程的桎梏,走向自驱动迭代。
行业类比
这类似于自动驾驶系统若只依赖固定测试赛道生成训练场景,则难以应对真实道路的突发性与长尾分布;agent 训练数据的合成也需要一种“从需求出发”的生成范式,而非绑定于有限预设。
核心洞察
- - 需求驱动的任务合成范式使 agent 训练数据生成摆脱对预定义工具链的依赖,实现跨领域的自动化扩展。传统 substrate‑bound 方法需要为每个新工具或领域手工构建任务流水线,不仅耗时且引入底层偏见,限制覆盖范围。NexForge 从高层能力需求出发,自动调查真实需求、编译任务指令并获取所需文件与运行时配置,无需领域特定工程,显著降低扩展成本,让通用 agent 的快速迭代和领域适应成为可能。
- - 分布感知的任务编译策略确保合成数据贴合真实应用场景,提升模型的实用性。不同于随机或基于固定模板的生成,NexForge 先分析真实世界的需求分布,据此构造任务概要和指令,使训练数据更准确地反映实际用户意图。这种分布对齐避免了数据偏见,并让模型在 Terminal‑Bench 和 GDPval 等真实基准上获得持续性提升,为数据驱动的 agent 优化提供了更有效、更具代表性的数据配方。
方法
方法概述
NexForge 采用需求驱动 (requirement-driven) 的合成范式, 将高层次能力需求转化为可执行的智能体任务与专家轨迹, 用于LLM的监督微调 (SFT)。其核心流程可概括为 输入 → 关键模块 → 输出。
输入
- 能力需求规格: 描述期望的智能体能力, 如 “终端操作”、“办公自动化” 等, 不绑定具体工具或代码仓库。
关键模块
需求调查与场景构建
分析真实世界需求, 构建代表性场景和任务配置文件 (task profiles), 确保合成任务分布与人类使用模式对齐, 避免传统方法因底物 (substrate) 预设而产生的偏差。分布感知编译
基于任务配置文件进行任务指令生成 (task directive generation), 动态控制任务类型的分布, 输出结构化的任务描述 (如目标、约束)。环境自动装配
对每条任务指令, 自动检索或构建所需的文件、依赖项和运行时配置。无需人工为每个新领域搭建专用基础设施 (如工具集、仓库、技能图谱)。例如终端任务可能自动生成 Git 仓库、脚本或配置文件; 办公任务则生成文档、表格等。专家轨迹合成
在装配好的环境中执行任务, 生成专家 rollout。通过精心设计的提示或规划器, 产出高质量行动序列与最终答案, 形成 SFT 训练轨迹 (指令-多步推理-结果)。
输出
- 可执行任务 : 带完整环境配置的任务实例, 可直接用于评估或进一步探索。
- 训练数据 : 格式为 (任务指令, 专家轨迹) 的配对数据, 用于微调基座模型。
与同类方法的差异点
NexForge 突破了传统底物绑定 (substrate-bound) 方法的限制——后者将任务生成与预定义工具/仓库耦合, 扩展时需人工工程介入; NexForge 通过需求驱动的环境自动装配, 实现了跨领域的任务合成与专家轨迹生成, 显著降低了人工流水线构建成本, 并使训练数据分布更贴近真实需求。
实验
实验设计
NexForge 从高层能力需求出发,自动生成可执行 agent 任务及专家轨迹。首先通过分析真实世界需求构建场景和任务画像,然后进行分布感知编译生成任务指令,再自动获取或构建所需文件、依赖与运行时环境,最后合成专家 rollout 并产出训练轨迹。实验分阶段验证:先用合成 3.6K 终端任务 + 2K 办公任务对 Qwen3.5-35B-A3B Base 进行 SFT;再扩展到 43.2K 终端任务;最终训练开源模型 Nex-N2。
关键发现
- 仅 5.6K 合成任务就将 Terminal-Bench 2.0 准确率从 22.5% 提升至 52.0%,GDPval Elo 从 813 提升至 1338。
- 扩展到 43.2K 终端任务后,Terminal-Bench 2.0 准确率达到 58.4%,与配备 Claude Code 的 Claude Opus 4.6 持平。
- 最终 Nex-N2 模型在 Terminal-Bench 2.1 上达到 75.3%,GDPval Elo 达到 1585,超越多个前沿闭源系统。
与基线对比的深度解读
NexForge 的 requirement-driven 合成相比传统 substrate-bound 方法(依赖预定义工具、仓库或技能图)展现出显著的扩展优势。后者在扩大覆盖时需要人工工程干预,且任务分布常带有基底偏差。NexForge 无需领域特定基础设施,直接从需求出发,使任务分布更贴近真实世界需求。其合成数据训练的模型在终端和办公任务上均取得大幅提升,甚至在不依赖额外领域适配的情况下,与闭源顶尖系统相当。这验证了需求驱动合成在 agent 能力 scaling 中的有效性,为自动化训练数据生产提供了全新范式。
行业影响
自动化任务训练数据的规模化生产
NexForge 提供了一种需求驱动的任务合成流水线,无需依赖特定工具或领域基础设施,即可从高层能力描述自动生成可执行的终端、办公等任务的训练数据。该技术直接冲击 RPA、AI 助手、智能运维 等产品形态的训练数据瓶颈。
落地场景
- 智能办公与终端自动化:面向全球企业的 企业级 AI 助手(如客户服务、IT 运维、流程自动化),可利用 NexForge 批量合成贴近真实工作流的 SFT 数据,大幅提升模型在复杂软件交互(终端命令、Office 套件操作)中的成功率。
- 跨平台智能代理:为消费级 AI 产品(如个人助理、购物代理)提供多样化任务训练,使模型能灵活操作不同应用,而非绑定单一工具。
商业价值
- 降本:传统 Agent 训练数据依赖人工标注或定制化脚本,NexForge 将任务设计、环境构建、轨迹生成全流程自动化,显著降低数据采集与标注成本。
- 提速:需求驱动的流水线可快速响应新业务场景,无需为每个领域重建数据管道,加快产品迭代与市场响应速度。
- 体验提升:模型通过更贴近真实需求分布的数据训练后,任务完成率与通用性显著提升,直接改善终端用户体验,增强产品竞争力。
现有工作流通用集成
NexForge 输出标准 SFT 格式轨迹,可与主流 LLM 微调框架(如 Hugging Face Transformers、LLaMA-Factory)及开源模型(Qwen、Llama 等)无缝衔接。具体集成路径:
- 需求定义 → NexForge 生成任务指令、环境与专家轨迹。
- 数据导出 → 转换为
system/user/assistant格式。 - 注入训练流水线 → 直接混入现有 post-training 数据混合体。 这使其成为现有 Agent 微调 Stack 的「数据增广插件」,无需改造基础设施。
典型用例
- 全球电商平台的智能运营:一家跨国电商企业利用 NexForge 为内部运维助手合成终端任务数据,训练后的模型可自动执行库存查询、日志分析、订单状态更新等跨系统操作,将人工干预率降低 40%。
- 办公套件智能体的快速适配:某企业 SaaS 服务商使用 NexForge 生成 Office 文档自动化任务(如数据汇总、报告生成),两周内便从零训练出适配多种文档格式的智能代理,显著缩短交付周期。
局限
- **需求覆盖范围依赖初始调查**:NexForge 的任务生成质量强依赖于对真实世界需求的采样与抽象,论文采用一定规模的需求调查来构建场景与任务画像,但调查样本的覆盖度、统计偏差以及时效性可能限制生成数据的多样性,若某些垂直领域的需求未被充分覆盖,可能导致对应任务分布不足,影响模型在该领域的实际表现。
- **专家轨迹的保真度受限于 LLM 自身**:合成专家 rollout 依赖于底层大模型的能力,尽管通过分布感知编译与自动化环境配置保证了任务的 executable,但生成的专家轨迹可能隐含模型自身的知识偏差和错误模式,无法完全替代人类专家的真实操作序列,这会导致 fine-tune 后的代理模型在长尾或高可靠场景中出现系统性偏差。
- **实验验证范围集中于终端与办公任务**:论文主要评估终端(Terminal-Bench)与办公(GDPval)场景,虽然展示了良好的迁移能力,但缺少在更广泛代理环境(如 Web 操控、物理机器人、多代理协作等)上的验证,对框架在异构任务上的可推广性尚未充分证明,其声称的“无需领域特定基础设施”在更多样任务中的实际开销与效果仍有待观察。