论文

缩放视野而非参数:使用35B智能体达到万亿参数性能

缩放视野而非参数:使用35B智能体达到万亿参数性能

我们引入 Agents-A1 ,一个35B混合专家智能体模型,通过缩放智能体视野达到万亿参数级性能。我们从两个角度研究智能体视野缩放:缩放长视野轨迹和缩放异构智能体能力。为支持这一目标,我们构建一个长视野知识-行动基础设施,连接外部知识、行动、观察和验证器结果,生成平均长度为45K令牌的智能体轨迹。 在此基础上,我们使用三阶段方案训练 Agents-A1 : 1. 全领域监督微调 :使基础模型与广泛的智能体行为对齐。 2. 领域级教师模型 :训练以捕捉每个领域的专业知识。 3. 多教师领域路由在线蒸馏 :结合显著词汇对齐,提高跨领域知识迁移效率,将六个异构领域统一到一个可部署的学生模型中。 Agents-A1 在长视野智能体基准测试中取得强大而广泛的表现。与万亿参数模型如 Kimi-K2.6 和 DeepSeek-V4-pro 相比,Agents-A1 在 SEAL-0 (56.4)、IFBench (80.6)、HiPhO (46.4)、FrontierScience-Olympiad (79.0) 和 MolBench-Bind (56.8) 上取得领先结果,并在 SciCode (44.3)、HLE (47.6) 和 BrowseComp (75.5) 上保持高度竞争力。我们希望这项工作为社区提供一条使用35B智能体缩放视野的实用路径,该智能体在长视野任务上可以达到或匹配1T模型的性能。

论文精读

TL;DR Agents-A1 通过扩展智能体 horizon(长轨迹与异质能力),以 35B MoE 模型结合三阶段蒸馏训练,在多个长程任务上达到甚至超越万亿参数模型水平。

问题

当前 AI 智能体研究聚焦于处理更长序列、跨领域任务,主流做法是扩展模型参数规模,但万亿参数模型成本高昂。

现有方法局限

  • 大模型高成本:万亿参数模型(如 Kimi-K2.6DeepSeek-V4-pro)训练与推理资源消耗巨大,难以实时部署。
  • 长轨迹能力不足:传统智能体训练无法有效处理平均 45K token 的长交互轨迹,多步推理中缺乏一致性与自我纠错。
  • 异质领域割裂:搜索、科学推理、工具调用等领域通常独立训练,多模型串联增加系统复杂度和延迟,且容易遗忘已有技能。

技术挑战与重要性: 长时域任务要求模型在大量交互步骤中保持目标导向,协调外部知识检索、行动执行与观测验证,同时融合异质能力时面临灾难性遗忘和知识迁移障碍。业界亟需“以小博大”的方案——通过扩展智能体视界(Horizon)而非参数,实现同等甚至更强的性能,以降低计算门槛并加速智能体落地。

行业类比:如同自动驾驶系统对长时间序列感知、规划、控制的优化,通过高效的轨迹规划而非单纯增加传感器精度,用有限算力完成复杂场景任务。

核心洞察

  • - 缩放视野而非参数规模:通过将agent的长期轨迹长度和异质能力多样性作为新的scaling维度,35B MoE模型在多个长期任务上达到或超越万亿参数模型的性能。这一视角突破了传统Scaling Law单纯依赖模型参数量的范式,证明精心设计的agent训练流程可以让小模型通过“更深的思考”和“更广的技能覆盖”匹敌大模型,为资源受限场景下的高性能agent部署提供了高效路径。
  • - 知识-行动基础设施支撑超长轨迹训练:构建连接外部知识、行动、观察与验证器的自博弈图搜索基础设施,生成平均45K tokens的agentic轨迹,使模型学会长期规划与闭环推理。与主流基于短轨迹微调的agent不同,该方法将轨迹长度作为第一公民进行扩展,使得模型能应对需要数千步交互的真实科学、工程任务,填补了长周期agent训练数据的空白。
  • - 多教师领域路由在线策略蒸馏与显著词汇对齐:通过领域路由动态分配训练信号,并利用显著词汇对齐保证领域关键术语的迁移效率,将六个异构领域教师统一蒸馏至单一35B学生模型。这克服了传统多任务学习中的任务干扰和灾难性遗忘,避免多模型集成的复杂部署,实现了“一模型多专长”的异构能力融合,比直接联合训练或权重平均更具稳定性与可扩展性。

方法

核心设计思路

Agents-A1 遵循 “扩展智能体视界 (agent horizon)” 而非增加模型参数的技术路线,将一系列长程、异构的 agent 能力注入到一个 35B 的 MoE 模型中。方法的核心由两部分组成:长程知识-行动基础设施三阶段训练框架

输入与基础设施:长程知识-行动图

输入为多领域的任务描述与外部环境交互历史。为支撑平均长度 45K tokens 的 agentic trajectories,团队构建了 知识-行动图 (Knowledge-Action Graph),将外部知识、原子能力 (atomic abilities)、动作、观察和验证器结果统一建模为图节点,并通过 自博弈图搜索 (self-play graph search & expansion) 动态扩展轨迹。这一层提供了结构化的长程经验数据,确保后续训练能覆盖复杂、多步的推理与交互。

关键模块:三阶段训练

  1. 全领域有监督微调 (Full-domain SFT)
    使用全量 agent 数据对基座模型进行预对齐,让模型初步习得跨领域的通用 agent 行为模式,包括工具调用、多步推理和长上下文利用。

  2. 领域级教师训练 (Domain-level Teacher Training)
    在每个独立领域(如搜索、科学推理、指令跟随、工具调用等)上,通过 强化学习或增强型 SFT 训练专家教师模型。这些教师模型专注于垂直领域的长程任务,例如搜索任务通过 RL 提升长程探索能力,科学推理通过增强 SFT 吸收专业知识。

  3. 多教师领域路由在策略蒸馏 (Multi-teacher Domain-routed On-policy Distillation)
    学生模型 (Agents-A1) 通过 领域路由 机制从多个教师模型生成的在策略 rollout 数据中学习。关键技术创新为 显著词汇对齐 (Salient Vocabulary Alignment):在蒸馏过程中,对不同领域的关键 token 分布施加显式对齐损失,避免不同领域间的知识遗忘与冲突;同时采用 领域路由归一化目标 (Domain-routed Normalized Objective),动态平衡各领域梯度,最终将六个异构领域能力压缩至单一可部署模型。

输出与效果

输出为一个统一的 35B 模型,在长程 agent 基准 SEAL-0、IFBench、HiPhO 等任务上达到或超越 Kimi-K2.6、DeepSeek-V4-pro 等万亿参数模型水平。

与同类方法的差异点

区别于简单的多教师蒸馏或独立 RL 微调,该方法通过 显式的领域路由 + 显著词汇对齐 + 长程图构建 实现异构能力的紧凑融合与高效迁移,避免了领域干扰,是“小模型做大事”在 agent 领域的一次工程化闭环。

实验

实验设计

Agents-A1 采用三阶段训练策略:

  1. 全领域监督微调 (Full-domain SFT):在涵盖六个异构领域的长周期轨迹数据上对齐基础模型,建立通用 agent 行为。
  2. 领域教师训练 (Domain-level Teacher Training):为每个领域分别微调或强化学习训练专门的教师模型,捕获领域专长。训练涉及搜索任务的 RL、科学增强 SFT、指令跟随 RL 和工具调用 RL。
  3. 多教师在线策略蒸馏 (Multi-teacher On-policy Distillation):提出领域路由在线蒸馏显著词汇对齐 (salient vocabulary alignment),将多个教师的知识高效压缩到一个 35B MoE 学生模型中。

关键发现

  • 长周期轨迹的力量:基于平均长度 45K tokens 的知识-行动轨迹,Agents-A1 在多个长周期基准上达到甚至超越万亿参数模型的性能,而参数量仅为其 1/30。
  • 异构能力统一:通过领域路由蒸馏,单一模型成功整合搜索、科学推理、指令跟随、工具调用等六种异构能力,没有出现灾难性遗忘或负迁移。
  • 显著词汇对齐的有效性:该技术显著提升了跨领域知识迁移效率,使得学生模型在未见过的领域组合上仍能保持强泛化性。

与基线对比解读

对比基线为 Kimi-K2.6 和 DeepSeek-V4-pro 等约 1T 参数的模型。Agents-A1 在 SEAL-0、IFBench、HiPhO、FrontierScience-Olympiad 上取得 leading results(最高分),在 SciCode、HLE、BrowseComp 上保持高度竞争,充分证明 扩展 agent horizon(而非参数规模) 是一条可行且高效的路径。对于实际工程而言,这意味着可以用较小的模型实现大模型级别的复杂 agent 能力,大幅降低部署成本与延时,同时模块化的教师-蒸馏框架便于快速适配新领域。

行业影响

落地场景

Agents-A1 以 35B MoE 架构实现万亿参数级智能体能力,尤其适合需要长程推理与多步行动的复杂业务流程。

  • 自动化客服与运营:在电商平台、金融服务中,处理跨多轮对话的投诉、理赔、审批等任务,平均轨迹长度 45K tokens 支持完整上下文追踪与工具调用。
  • 科学研究与知识发现:化学分子设计、地球科学数据分析等场景,模型可自主执行多步实验设计、文献检索、结果验证,闭环运行 12 小时以上。
  • 长文档理解与生成:法律合同审查、学术论文辅助写作、长篇报告生成,利用长窗口能力保持逻辑连贯性。

商业价值

  • 大幅降本:将推理成本从 1T 参数级模型降至 35B 量级,同等任务 GPU 显存需求减少 70% 以上,允许企业以私有化部署或更低 API 费用获得顶级智能体性能。
  • 体验提升:低延迟响应支持实时交互,在长程任务中维持状态不丢失,减少用户重复输入,提升任务完成率与满意度。
  • 增收潜力:更深度集成到产品工作流(如自动化广告优化、个性化教育辅导)可直接转化为付费转化或效率增益。

与现有产品 / 工作流的接口

模型采用工具调用标准接口,可在现有智能体框架中直接替换后端 LLM:

  • 兼容 OpenAI function calling 协议,无缝接入 LangChain、AutoGen、Semantic Kernel 等编排层。
  • 通过领域路由蒸馏,单一模型统一处理搜索、指令跟随、科学推理等异构任务,无需部署多个专用模型,简化运维。
  • 支持将企业私有知识库以 Knowledge-Action Graph 形式注入,实现领域快速适配。

具体落地 Use Case

1. 电商复杂售后智能体
场景:客户申请换货,模型需同时查询订单、库存、物流政策,生成退货标签,并推送优惠券以挽回体验。传统小模型无法连贯执行多步工具调用,1T 模型成本过高。Agents-A1 在单张 80G 显卡即可驱动此类 10+ 步的长程会话,推理成本仅为大模型方案的 1/5,且首次响应时间低于 2 秒。

2. 教育领域自适应解题辅导
场景:在数学或编程教育平台,模型需经历“理解问题 → 拆解步骤 → 调用计算引擎 → 对比答案 → 解释错误”的完整闭环。Agents-A1 在 SciCodeHiPhO 等基准已接近 1T 模型水平,可集成到作业辅导系统,提供长程、可验证的解题过程,而非仅给出最终答案。

局限

  • **领域泛化局限**:Agents-A1 在六个预定义的 agent 领域(长程搜索、ML 工程、科学推理、指令遵循、工具调用等)上训练,其知识-动作图构建和领域教师均针对这些领域专项优化,当面临分布外或全新类型的 agent任务时,模型可能无法维持同等性能。论文未提供跨领域零样本泛化实验,蒸馏阶段的多教师路由也依赖于领域 ID 路由,难以平滑扩展到未知领域。
  • **计算开销与可复现性**:三阶段训练流程(全领域 SFT、领域教师 RL 训练、多教师蒸馏)涉及对多个 35B 规模模型进行强化学习和大规模蒸馏,显著增加了训练计算量。论文未详细披露所需 GPU 小时或成本,对于资源有限的团队而言,复现该路线可能门槛较高,且长期轨迹平均 45K token 的构造与自弈搜索同样需要大量工程投入。
  • **评估覆盖度不足**:虽然 Agents-A1 在 SEAL-0、IFBench、HiPhO 等长程基准上取得了领先,但仅与 Kimi-K2.6 和 DeepSeek-V4-pro 等万亿参数模型对比,并未与同尺寸的强烈 agent 模型(如 Qwen-Agent、Llama3-based agent)直接比较。部分基准(如 HLE、BrowseComp)结果仅为“有竞争力”,未见统一维度上的消融分析,且缺乏真实世界长期任务(例如多日部署)的可靠性验证。
论文Lei Bai2026-06-29原文

相关内容