ZGCM-1:面向数学与 Agentic Search 的完全开放且极致高效的基础模型
本文提出 ZGCM-1,一个完全开放、从零训练的 7B dense 基础模型,在数据、系统与算法层面追求极致效率。其核心前提是:紧凑模型无法被动记忆整个开放网络,但可通过将 内部思考 与 外部工具使用 相结合,突破参数容量限制。 为在 256K 上下文下支撑这一范式,我们给出端到端高效开放训练配方: 1. 架构与系统协同设计:交错的 gated sliding-window attention 与 full attention,以及稳定的 FP8 Muon optimizer; 2. 渐进式课程与 MDP Mid-Training:上下文从 16K、64K 扩展至 256K,并把交互轨迹重构为 Markov Decision Processes。 此外,我们建立了 AI 原生研发工作流,由 agent swarms 自主管理集群运维、数据策管与快速诊断评估。 评测显示,ZGCM-1-7B 在通用基准上与 7B 模型家族相当;在多项高难度数学推理与 agentic search 套件上,仍可与规模大数个数量级的前沿模型(如 Qwen3-235B-A22B、GLM-5.1)竞争。预训练设计在 16K 预训练 time-to-loss 上带来约 4.2 倍 效率提升。 我们提炼出八条可操作实证发现,涵盖架构扩展、SFT 质量剪枝、长上下文泛化与 agentic 协同训练动态,并开源预训练、mid-training、post-training 各阶段权重、中间 checkpoint、训练代码、分阶段数据与数据配方以及 W&B 日志。
论文精读
TL;DR ZGCM-1 是一个全开源 7B 基座模型,通过混合注意力、FP8 Muon 优化和渐进式 256K 长上下文训练,让紧凑模型结合内部思维与外部工具,在数学与智能搜索上媲美数百亿参数模型,预训练效率提升 4.2 倍。
问题
问题背景
当前开放基础模型在长上下文推理与工具调用 Agent 任务上的能力边界,日益受限于参数规模与训练效率。业界关注如何用紧凑模型实现接近前沿大模型的复杂推理表现,同时保持完全开放与可复现。
现有方法局限
主流 7B 级模型依赖静态网络记忆与独立推理,难以在 256K 上下文内稳定融合多步工具调用轨迹。长上下文注意力机制面临 O(n²) 计算与 KV 缓存带宽瓶颈;FP8 训练中优化器数值不稳定;agentic 轨迹直接作为普通文本训练,忽略环境反馈与决策序贯性。结果是:小模型在多轮搜索、代码执行等场景下频繁产生幻觉或无效动作。
为什么这个问题难/重要
技术难点在于同时解决三对矛盾:容量受限 vs 外部知识依赖、长序列效率 vs 信息保持、轨迹数据规模 vs 决策质量。业界高度关注,是因为实际部署中算力成本约束强,无法普遍使用百亿甚至千亿参数模型,但业务上又要求接近前沿水平的 agentic search 和数学推理。解决该问题将大幅降低复杂 AI 代理系统的落地门槛。
行业类比
这一挑战类似在资源受限的边缘推理节点上部署智能助手:模型必须像熟练工程师一样,既能进行内部心算推导,又能高效查阅外部文档、执行命令并迭代修正,而非只靠背下所有知识库。
核心洞察
- ZGCM-1 将 agentic 交互轨迹重构为 **马尔可夫决策过程**(MDP),而不是直接作为模仿学习样本。这种形式化让 mid-training 不仅拟合状态到动作的映射,还能显式建模状态、动作和奖励信号,为后续强化学习提供更平滑的过渡。相比仅用 SFT 训练工具调用,MDP 轨迹能保留决策过程中的不确定性,使 7B 模型在复杂搜索任务中能进行策略性探索,而非机械复制示范。
- ZGCM-1 的预训练效率提升主要来自 **架构与系统协同设计**:交错门控滑动窗口与全注意力,配合 **FP8 Muon** 优化器。与单纯应用稀疏注意力或线性注意力不同,这种混合策略在保持长上下文建模能力的同时,显著降低了 KV 缓存和计算量,使 16K 预训练 time-to-loss 提升约 4.2 倍。更关键的是,FP8 Muon 的稳定性设计让低精度训练不损失收敛质量,为开源社区提供了一套可复现的高效训练配方。
- 论文展示了 **AI-native R&D** 的可行性:**agent swarms** 自主承担集群操作、数据策展和快速诊断评估。这不同于常见的辅助型 AI 工具(如代码补全或实验分析助手),而是让智能体在研发流程中拥有决策和执行权,形成闭环迭代。这一工作流不仅加速了 ZGCM-1 的开发,更重要的是量化了 AI 自主程度(通过 **AI Autonomy Rubric**),为组织级 AI4AI 实践提供了可评估的范式。
方法
输入与整体范式
ZGCM-1 从零训练 7B dense 模型,输入包括通用文本、代码、数学、推理、指令以及 agentic 交互轨迹。核心假设是:紧凑模型不能仅凭参数记忆开放网络,需通过内部思考 与外部工具调用耦合来突破容量限制。
关键模块
- 架构与系统协同:采用交错门控滑动窗口注意力 与 全注意力 混合,在 256K 上下文内平衡效率与全局建模;优化器为稳定的 FP8 Muon。
- 渐进课程预训练:上下文长度按
16K→64K→256K扩展,并显式交错代码与数学数据,以塑造长程推理能力。 - 中期训练(MDP 重构):将 agent 交互轨迹重新建模为 Markov Decision Processes,让模型学习状态-动作-奖励结构,而非被动模仿。
- 后训练:监督微调 覆盖通用数据、Deep Research、软件工程、终端轨迹;随后进行 混合强化学习,利用奖励设计与 RL 数据策展强化工具使用和推理。
- AI 原生研发流程:使用 agent swarms 自主管理集群、数据策展与诊断评估,加速迭代。
输出
最终得到 ZGCM-1-7B,在 7B 规模通用基准上具备竞争力,在数学推理与 agentic search 上可比肩 Qwen3-235B-A22B 等大得多的模型;16K 预训练 time-to-loss 效率提升约 4.2x。
与同类方法的差异:将内部思考与外部工具使用作为一等公民共同训练,并通过 MDP 中期训练和 AI 自主 R&D 实现极致的开源端到端效率。
实验
实验设计
ZGCM-1 采用从零预训练的 7B dense 模型,实验围绕三条主线展开:架构/系统协同(gated sliding-window 与 full attention 交错、FP8 Muon 优化器)、渐进式课程与 MDP 中间训练(16K → 64K → 256K 上下文,交互轨迹重构为 Markov Decision Processes)、以及 AI-native 研发流程(agent swarms 自动管理集群、数据清洗与诊断评估)。评估覆盖通用基准、数学推理、agentic search(Web 环境 Deep Research、Binary Function Search 等)。
关键发现
- 混合注意力 在长上下文下显著降低 KV cache 占用,同时保持 full attention 的局部精度。
- FP8 Muon 稳定训练 7B dense 模型,未出现发散。
- 渐进式上下文缩放让模型在 256K 长度上具备可用推理能力。
- 交互轨迹建模为 MDP 后,中间训练能同时提升内部思考与外部工具调用。
- pre-training 设计在 16K time-to-loss 上达到 ~4.2x 效率提升。
与基线对比解读
在 7B 同规模模型中,ZGCM-1 通用基准具有竞争力;在数学推理和 agentic search 子集上,可与数量级更大的 Qwen3-235B-A22B、GLM-5.1 正面比较,说明紧凑模型配合工具使用能突破参数容量限制。但其结果依赖特定评测套件,需更多独立复现验证。整体看,开源权重与训练 recipe 为高效训练 7B 级推理模型提供了可参考路径。
行业影响
落地场景
ZGCM-1 作为 7B 高效开源模型,在需要数学推理与工具调用的场景有直接落地价值。例如:
- 电商智能客服与搜索:处理折扣计算、价格比较等复杂查询,并调用商品检索 API 完成多步 agentic search。
- 金融研报自动化:结合长上下文(256K)读取财报、公告,通过外部数据源进行数据抽取与数值分析。
- 教育解题与代码辅助:数学推理能力可嵌入题库讲解、编程作业批改等轻量服务。
商业价值
- 降本:预训练效率提升约 4.2x(16K time-to-loss),FP8 Muon 优化器降低训练算力;7B 规模使推理成本远低于 235B 模型。
- 增收:智能体任务自动化(如深度研究、终端操作)可替代人工重复劳动,提升交付效率。
- 体验提升:长上下文 + 工具使用让模型能处理更真实、复杂的多步任务,避免小而弱的印象。
集成接口
模型开源权重、训练代码、数据配方,可快速接入现有 MLOps 与 agent 框架:
- 通过 GitHub 获取预训练 / 中训练 / 后训练 checkpoint,按需微调或量化部署。
- 与 LangChain、AutoGen、LlamaIndex 等工具链集成,利用 MDP 训练出的轨迹提升工具调用可靠性。
- 作为轻量推理后端替代部分大模型调用,降低云端 API 成本;256K 上下文可直接处理长文档,减少切分开销。
典型用例:电商平台的优惠计算与商品比价 agent(数学推理 + 搜索 API);金融领域的研报生成 agent(长上下文阅读 + 数据查询)。
局限
- **模型规模限制**:ZGCM-1-7B 虽然通过 internal thinking + external tool use 弥补参数不足,但在开放域知识、长尾任务和复杂指令跟随上仍受 7B 容量约束,难以全面媲美 200B+ 模型。论文在结论中承认,部分 competitive 结果依赖特定评测集,并非通用能力。对于需要深度世界知识或长程规划的任务,小模型可能仍存在系统性差距,且多步 agentic 任务中稳定性有待进一步验证。
- **工程复现门槛高**:尽管代码、权重、数据配方全部开源,但端到端训练流程高度依赖 AI-native R&D 工作流,其中 agent swarms 自主管理集群操作、数据清洗和快速诊断评估。这种自动化范式对多数团队难以直接复制,且从零训练 7B 模型仍需大规模 GPU 集群与长时间投入,即便 pre-training 效率提升 4.2x,总成本依然不低。FP8 Muon 优化器和自定义混合注意力等系统级实现尚未经过社区广泛验证。
- **评估泛化性有限**:评测重点集中在数学推理、agentic search、Web 环境 deep research 和 binary function search,对通用代码生成(仅 SWE-bench Mini50)、多语言、多模态、安全对齐等覆盖不足。Agentic 任务依赖特定环境与工具协议,可能存在对协议格式的过拟合,真实世界工具使用的鲁棒性未充分证明。长上下文 256K 的评估也缺少系统性的 recall 和推理压力测试,难以全面反映长序列理解能力。