论文

ZGCM-1:面向数学与 Agentic Search 的完全开放且极致高效的基础模型

ZGCM-1:面向数学与 Agentic Search 的完全开放且极致高效的基础模型

本文提出 ZGCM-1,一个完全开放、从零训练的 7B dense 基础模型,在数据、系统与算法层面追求极致效率。其核心前提是:紧凑模型无法被动记忆整个开放网络,但可通过将 内部思考 与 外部工具使用 相结合,突破参数容量限制。 为在 256K 上下文下支撑这一范式,我们给出端到端高效开放训练配方: 1. 架构与系统协同设计:交错的 gated sliding-window attention 与 full attention,以及稳定的 FP8 Muon optimizer; 2. 渐进式课程与 MDP Mid-Training:上下文从 16K、64K 扩展至 256K,并把交互轨迹重构为 Markov Decision Processes。 此外,我们建立了 AI 原生研发工作流,由 agent swarms 自主管理集群运维、数据策管与快速诊断评估。 评测显示,ZGCM-1-7B 在通用基准上与 7B 模型家族相当;在多项高难度数学推理与 agentic search 套件上,仍可与规模大数个数量级的前沿模型(如 Qwen3-235B-A22B、GLM-5.1)竞争。预训练设计在 16K 预训练 time-to-loss 上带来约 4.2 倍 效率提升。 我们提炼出八条可操作实证发现,涵盖架构扩展、SFT 质量剪枝、长上下文泛化与 agentic 协同训练动态,并开源预训练、mid-training、post-training 各阶段权重、中间 checkpoint、训练代码、分阶段数据与数据配方以及 W&B 日志。

论文精读

TL;DR ZGCM-1 是一个全开源 7B 基座模型,通过混合注意力、FP8 Muon 优化和渐进式 256K 长上下文训练,让紧凑模型结合内部思维与外部工具,在数学与智能搜索上媲美数百亿参数模型,预训练效率提升 4.2 倍。

问题

问题背景

当前开放基础模型在长上下文推理与工具调用 Agent 任务上的能力边界,日益受限于参数规模与训练效率。业界关注如何用紧凑模型实现接近前沿大模型的复杂推理表现,同时保持完全开放与可复现。

现有方法局限

主流 7B 级模型依赖静态网络记忆与独立推理,难以在 256K 上下文内稳定融合多步工具调用轨迹。长上下文注意力机制面临 O(n²) 计算与 KV 缓存带宽瓶颈;FP8 训练中优化器数值不稳定;agentic 轨迹直接作为普通文本训练,忽略环境反馈与决策序贯性。结果是:小模型在多轮搜索、代码执行等场景下频繁产生幻觉或无效动作。

为什么这个问题难/重要

技术难点在于同时解决三对矛盾:容量受限 vs 外部知识依赖、长序列效率 vs 信息保持、轨迹数据规模 vs 决策质量。业界高度关注,是因为实际部署中算力成本约束强,无法普遍使用百亿甚至千亿参数模型,但业务上又要求接近前沿水平的 agentic search 和数学推理。解决该问题将大幅降低复杂 AI 代理系统的落地门槛。

行业类比

这一挑战类似在资源受限的边缘推理节点上部署智能助手:模型必须像熟练工程师一样,既能进行内部心算推导,又能高效查阅外部文档、执行命令并迭代修正,而非只靠背下所有知识库。

核心洞察

  • ZGCM-1 将 agentic 交互轨迹重构为 **马尔可夫决策过程**(MDP),而不是直接作为模仿学习样本。这种形式化让 mid-training 不仅拟合状态到动作的映射,还能显式建模状态、动作和奖励信号,为后续强化学习提供更平滑的过渡。相比仅用 SFT 训练工具调用,MDP 轨迹能保留决策过程中的不确定性,使 7B 模型在复杂搜索任务中能进行策略性探索,而非机械复制示范。
  • ZGCM-1 的预训练效率提升主要来自 **架构与系统协同设计**:交错门控滑动窗口与全注意力,配合 **FP8 Muon** 优化器。与单纯应用稀疏注意力或线性注意力不同,这种混合策略在保持长上下文建模能力的同时,显著降低了 KV 缓存和计算量,使 16K 预训练 time-to-loss 提升约 4.2 倍。更关键的是,FP8 Muon 的稳定性设计让低精度训练不损失收敛质量,为开源社区提供了一套可复现的高效训练配方。
  • 论文展示了 **AI-native R&D** 的可行性:**agent swarms** 自主承担集群操作、数据策展和快速诊断评估。这不同于常见的辅助型 AI 工具(如代码补全或实验分析助手),而是让智能体在研发流程中拥有决策和执行权,形成闭环迭代。这一工作流不仅加速了 ZGCM-1 的开发,更重要的是量化了 AI 自主程度(通过 **AI Autonomy Rubric**),为组织级 AI4AI 实践提供了可评估的范式。

方法

输入与整体范式

ZGCM-1 从零训练 7B dense 模型,输入包括通用文本、代码、数学、推理、指令以及 agentic 交互轨迹。核心假设是:紧凑模型不能仅凭参数记忆开放网络,需通过内部思考 与外部工具调用耦合来突破容量限制。

关键模块

  1. 架构与系统协同:采用交错门控滑动窗口注意力 与 全注意力 混合,在 256K 上下文内平衡效率与全局建模;优化器为稳定的 FP8 Muon。
  2. 渐进课程预训练:上下文长度按 16K → 64K → 256K 扩展,并显式交错代码与数学数据,以塑造长程推理能力。
  3. 中期训练(MDP 重构):将 agent 交互轨迹重新建模为 Markov Decision Processes,让模型学习状态-动作-奖励结构,而非被动模仿。
  4. 后训练:监督微调 覆盖通用数据、Deep Research、软件工程、终端轨迹;随后进行 混合强化学习,利用奖励设计与 RL 数据策展强化工具使用和推理。
  5. AI 原生研发流程:使用 agent swarms 自主管理集群、数据策展与诊断评估,加速迭代。

输出

最终得到 ZGCM-1-7B,在 7B 规模通用基准上具备竞争力,在数学推理与 agentic search 上可比肩 Qwen3-235B-A22B 等大得多的模型;16K 预训练 time-to-loss 效率提升约 4.2x。

与同类方法的差异:将内部思考与外部工具使用作为一等公民共同训练,并通过 MDP 中期训练和 AI 自主 R&D 实现极致的开源端到端效率。

实验

实验设计

ZGCM-1 采用从零预训练的 7B dense 模型,实验围绕三条主线展开:架构/系统协同(gated sliding-window 与 full attention 交错、FP8 Muon 优化器)、渐进式课程与 MDP 中间训练(16K → 64K → 256K 上下文,交互轨迹重构为 Markov Decision Processes)、以及 AI-native 研发流程(agent swarms 自动管理集群、数据清洗与诊断评估)。评估覆盖通用基准、数学推理、agentic search(Web 环境 Deep Research、Binary Function Search 等)。

关键发现

  1. 混合注意力 在长上下文下显著降低 KV cache 占用,同时保持 full attention 的局部精度。
  2. FP8 Muon 稳定训练 7B dense 模型,未出现发散。
  3. 渐进式上下文缩放让模型在 256K 长度上具备可用推理能力。
  4. 交互轨迹建模为 MDP 后,中间训练能同时提升内部思考与外部工具调用。
  5. pre-training 设计在 16K time-to-loss 上达到 ~4.2x 效率提升。

与基线对比解读

在 7B 同规模模型中,ZGCM-1 通用基准具有竞争力;在数学推理和 agentic search 子集上,可与数量级更大的 Qwen3-235B-A22B、GLM-5.1 正面比较,说明紧凑模型配合工具使用能突破参数容量限制。但其结果依赖特定评测套件,需更多独立复现验证。整体看,开源权重与训练 recipe 为高效训练 7B 级推理模型提供了可参考路径。

行业影响

落地场景

ZGCM-1 作为 7B 高效开源模型,在需要数学推理与工具调用的场景有直接落地价值。例如:

  • 电商智能客服与搜索:处理折扣计算、价格比较等复杂查询,并调用商品检索 API 完成多步 agentic search。
  • 金融研报自动化:结合长上下文(256K)读取财报、公告,通过外部数据源进行数据抽取与数值分析。
  • 教育解题与代码辅助:数学推理能力可嵌入题库讲解、编程作业批改等轻量服务。

商业价值

  • 降本:预训练效率提升约 4.2x(16K time-to-loss),FP8 Muon 优化器降低训练算力;7B 规模使推理成本远低于 235B 模型。
  • 增收:智能体任务自动化(如深度研究、终端操作)可替代人工重复劳动,提升交付效率。
  • 体验提升:长上下文 + 工具使用让模型能处理更真实、复杂的多步任务,避免小而弱的印象。

集成接口

模型开源权重、训练代码、数据配方,可快速接入现有 MLOps 与 agent 框架:

  • 通过 GitHub 获取预训练 / 中训练 / 后训练 checkpoint,按需微调或量化部署。
  • 与 LangChain、AutoGen、LlamaIndex 等工具链集成,利用 MDP 训练出的轨迹提升工具调用可靠性。
  • 作为轻量推理后端替代部分大模型调用,降低云端 API 成本;256K 上下文可直接处理长文档,减少切分开销。

典型用例:电商平台的优惠计算与商品比价 agent(数学推理 + 搜索 API);金融领域的研报生成 agent(长上下文阅读 + 数据查询)。

局限

  • **模型规模限制**:ZGCM-1-7B 虽然通过 internal thinking + external tool use 弥补参数不足,但在开放域知识、长尾任务和复杂指令跟随上仍受 7B 容量约束,难以全面媲美 200B+ 模型。论文在结论中承认,部分 competitive 结果依赖特定评测集,并非通用能力。对于需要深度世界知识或长程规划的任务,小模型可能仍存在系统性差距,且多步 agentic 任务中稳定性有待进一步验证。
  • **工程复现门槛高**:尽管代码、权重、数据配方全部开源,但端到端训练流程高度依赖 AI-native R&D 工作流,其中 agent swarms 自主管理集群操作、数据清洗和快速诊断评估。这种自动化范式对多数团队难以直接复制,且从零训练 7B 模型仍需大规模 GPU 集群与长时间投入,即便 pre-training 效率提升 4.2x,总成本依然不低。FP8 Muon 优化器和自定义混合注意力等系统级实现尚未经过社区广泛验证。
  • **评估泛化性有限**:评测重点集中在数学推理、agentic search、Web 环境 deep research 和 binary function search,对通用代码生成(仅 SWE-bench Mini50)、多语言、多模态、安全对齐等覆盖不足。Agentic 任务依赖特定环境与工具协议,可能存在对协议格式的过拟合,真实世界工具使用的鲁棒性未充分证明。长上下文 256K 的评估也缺少系统性的 recall 和推理压力测试,难以全面反映长序列理解能力。
论文Jiyan He2026-09-11原文

相关内容