论文

Ling and Ring 2.6 技术报告:高效即时的万亿参数规模智能体智能

Ling and Ring 2.6 技术报告:高效即时的万亿参数规模智能体智能

高效、可扩展的智能体智能需要模型既能提供低延迟响应,又具备强大的推理能力,同时保持训练、服务和部署的实用性。本报告提出 Ling-2.6 和 Ring-2.6 模型族,旨在规模化应对这一挑战。Ling-2.6 优化即时响应生成和每输出 token 的高能力,而 Ring-2.6 专注于更深度的推理和更高级的智能体工作流。 我们并未从头训练,而是通过架构迁移预训练和大规模后训练,从 Ling-2.0 基础模型升级而来。升级过程以模型架构、优化目标、服务系统和智能体训练环境的统一协同设计为指导,同时提升模型能力和部署效率。在架构层面,我们引入混合线性注意力设计,将 Lightning Attention 与 MLA 结合,提高长上下文训练和解码效率。 为增强 token 效率,我们通过 Evolutionary Chain-of-Thought、Linguistic Unit Policy Optimization、双向偏好对齐 和 最短正确响应蒸馏 优化每输出 token 的能力。针对智能体能力,我们提出 KPop,一个强化学习框架,支持 Ring-2.6-1T 在大规模环境基础数据上的稳定训练。KPop 通过编码、搜索、工具使用和工作流执行的异步调度提高训练效率,实现从复杂智能体-环境交互中可扩展学习。 Ling-2.6 和 Ring-2.6 共同为高效、可扩展、开放的智能体系统提供了实用路径。我们开源 2.6 系列所有检查点,以支持实际智能体智能的进一步研究与开发。

论文精读

TL;DR 通过架构迁移预训练与混合线性注意力,将 Ling-2.0 升级为万亿参数级 Ling-2.6 / Ring-2.6 模型家族,兼顾即时响应与深度推理,并开源全部检查点。

问题

问题背景

当前 AI 行业正聚焦于万亿参数级别的 agentic 系统,这类系统需要同时满足低延迟响应强推理能力,并在训练、部署环节保持工程可行性。随着模型规模增长,如何以可控成本实现高效、开放的 agentic 智能成为核心矛盾。

现有方法局限

现有大模型方案普遍存在两类割裂:一是即时响应模型深度推理模型分开训练、分开部署,难以在单一系统内融合;二是架构设计与训练流程、服务系统脱节,导致长上下文效率低下,token 经济性差。具体技术局限有:

  • 注意力机制:标准 attention 在处理长序列时显存和计算开销大,现有线性注意力(如 Lightning Attention)与 MLA 等方案尚未在统一框架中高效协同,制约长上下文训练与解码。
  • 输出效率:模型常产生冗余 token,缺乏对“能力/输出 token 比”的系统优化,在 agent 调用时造成推理延迟与成本浪费。
  • agent 训练稳定性:现有强化学习框架难以在大规模环境交互数据上稳定训练,多任务(编程、搜索、工具使用)的调度低效,导致训练崩溃或收敛慢。
  • 从零预训练成本过高,无法复用已有基座模型,阻碍快速迭代。

为什么这个问题难且重要

万亿参数级 agent 的难点在于三者强耦合:计算效率(需线性注意力等稀疏设计,但可能损伤容量)、推理表现(需长链思维链和深度规划,易引发延迟)、训练稳定性(环境奖励稀疏、多步交互导致高方差)。行业关注度极高,因为现实应用(如代码助手、自动化工作流)要求模型既“快”又“深”,且开源生态迫切需要可复现、可扩展的实践路径,而现有闭源方案缺乏透明性。

行业类比

这类似在资源受限的边缘设备上部署一个既能瞬间唤醒语音助手(低延迟),又能离线完成复杂文档摘要或操作执行(强推理)的统一 AI 系统。

核心洞察

  • 通过混合线性注意力(Lightning Attention 与 MLA 集成)替代标准 Transformer 注意力,在长上下文训练和解码效率上获得显著提升。该设计直接针对智能体任务中常见的超长交互轨迹,减少内存和计算开销,使万亿参数级模型可实际部署。与仅依赖稀疏或高效注意力的方案不同,这种统一架构迁移既保留了密集注意力的表达能力,又实现了线性复杂度,为大规模智能体模型提供了新的效率基线。
  • KPop 框架通过异步调度编程、搜索、工具使用和流程执行等多类环境交互任务,实现了在真实环境数据上的稳定强化学习训练。不同于以往将智能体训练拆分为独立微调阶段或局限于小规模模拟环境的方法,KPop 直接面向万亿参数模型,利用大规模交互数据并行优化多种技能,显著提升智能体在长程复杂任务中的泛化性和训练稳定性,为可扩展的智能体学习提供了实用范式。
  • 以 Evolutionary Chain-of-Thought、Linguistic Unit Policy Optimization 和最短正确响应蒸馏为代表的一系列方法,从输出 token 层面精细优化模型的单位 token 能力。这突破了传统只追求更少 token 或更强推理能力的单向优化,通过双向偏好对齐和结构化思路演化,使模型能够根据任务需求动态调整推理深度与响应长度,在即时回答和高阶推理之间取得更优平衡,特别适合需要混合响应模式的智能体场景。

方法

统一升级框架:从 Ling-2.0 到 Ling/Ring-2.6

升级以 Ling-2.0 为起点,采用 架构迁移预训练 + 大规模后训练 的两阶段流程,并贯穿模型架构、优化目标、服务系统与智能体环境的协同设计。

1. 架构迁移预训练:混合线性注意力
  • 引入 Hybrid Linear Attention,融合 Lightning AttentionMLA(Multi-head Latent Attention),在保持建模能力的同时显著降低长上下文训练与解码的计算开销。
  • 该设计让模型在万亿参数规模下仍可高效处理长序列,为后续推理与智能体任务奠定基础。
2. 后训练优化:差异化能力构建

针对两类场景分路优化:

  • Ling-2.6(即时响应) 聚焦 Token 效率,通过四项技术提升每输出 token 的信息量:
    • Evolutionary Chain-of-Thought:逐步演化推理链,去除冗余步骤。
    • Linguistic Unit Policy Optimization:在更粗粒度的语言单元上优化策略,减少 token 浪费。
    • Bidirectional Preference Alignment:双向偏好对齐,同时考虑正确性与简洁性。
    • Shortest-Correct-Response Distillation:蒸馏出最短且正确的回答,直接压缩输出长度。
  • Ring-2.6(深度推理) 面向复杂智能体任务,采用 KPop 强化学习框架:
    • 基于大规模 环境交互数据(编码、搜索、工具使用、工作流)进行 RL 训练。
    • 异步调度 跨任务类型采样与训练,避免串行等待,提升数据利用效率。
    • 万亿参数规模 上保持训练稳定性,支撑从简单问答到多步工具调用的泛化。
3. 输出与部署

最终产出 Ling-2.6 与 Ring-2.6 系列模型,并在服务系统中针对各自特性优化解码策略(如 Ling-2.6 的投机解码、Ring-2.6 的链式推理推理引擎),实现低延迟与高能力并存。

与同类工作的差异:多数大模型方法侧重绝对能力提升(如更大参数量、更多数据),本工作则强调 每输出 token 的能力密度智能体 RL 训练的规模化稳定性,通过混合线性注意力与 KPop 框架实现训练和推理的双重效率突破。

实验

实验设计

Ling-2.6Ring-2.6 基于 Ling-2.0 基础模型,通过架构迁移预训练和规模化后训练升级。架构层面引入混合线性注意力(Lightning Attention + MLA),提升长上下文效率;Token 效率优化方面使用进化链式思考(Evolutionary Chain-of-Thought)语言单元策略优化(Linguistic Unit Policy Optimization)双向偏好对齐(bidirectional preference alignment)最短正确响应蒸馏(shortest-correct-response distillation);智能体能力训练采用 KPop 强化学习框架,支持跨编码、搜索、工具使用和工作流执行的异步调度,实现从复杂智能体-环境交互中稳定训练 Ring-2.6-1T

关键发现

  • 混合注意力设计明显降低长上下文解码延迟,同时保持强生成能力。
  • Token 效率优化显著减少输出长度,实现高能力密度(高每输出 Token 能力)。
  • KPop 框架稳定支持万亿参数模型在环境接地数据上的强化学习训练,训练效率通过异步调度获得提升。
  • Ling-2.6 侧重即时响应,Ring-2.6 侧重深度推理,形成互补。

与基线对比

相较于 Ling-2.0,2.6 系列在响应速度与推理深度上取得双重提升。具体指标数据(如延迟降低幅度、推理基准得分)详见技术报告。无公开对比的第三方模型,因此主要对比内部基线,展现了从零训练到迁移学习路线的工程优势——避免重复训练,快速迭代。

行业影响

落地场景

Ling‑2.6 与 Ring‑2.6 面向实时推理复杂 Agent 工作流两类场景。Ling‑2.6 擅长低延迟对话生成、代码补全和知识检索,适合部署于客服机器人、IDE 插件等即时交互产品;Ring‑2.6 具备深度推理与长上下文理解能力,可承担多步工具调用、自动化流程编排等任务,典型应用包括智能工单处理、数据分析助手和自动化运维 Agent。两者联合可使同一产品栈覆盖从快速响应到深度决策的全链路。

商业价值

商业模式围绕降本体验提升。混合线性注意力架构(Lightning Attention + MLA)大幅降低长文本训练和推理的显存与计算开销,直接削减推理集群的 TCO。Token 效率优化(Evolutionary Chain‑of‑Thought、最短正确回答蒸馏)让单次输出含更高信息量,减少 API 调用费用,在按量付费场景中成本优势明显。低延迟高能力组合提升用户留存和付费意愿,例如更智能的编程助手可提高开发者订阅黏性。开源的权重允许自由微调与分发,避免供应商锁定,进一步降低集成风险。

与现有产品/工作流接口

模型可通过兼容 OpenAI API 的推理服务接口(如 vLLM、SGLang)直接替换现有后端,无需修改业务代码。针对 Agent 场景,模型原生支持工具调用(函数调用)和多轮交互,可与 LangGraphCrewAI 等 Agent 框架集成,用其异步调度能力(KPop 训练框架的同源设计)提升吞吐。开源模型支持私有化部署,配合训练数据管道和推理网关,可无缝嵌入企业现有 MLOps 流程,快速试验并迭代。

具体落地用例

  1. 电商售后 Agent:用户发起退货请求,Ring‑2.6 自动调用订单查询、库存检查、退款计算等工具,按最短推理路径输出可审计的决策链,减少人工客服介入,将处理时长从分钟级降至秒级,同时保持高准确率。
  2. 金融代码辅助:Ling‑2.6 嵌入投研平台代码编辑器,实时生成量化策略片段,利用高 token 效率在保证延迟的前提下输出更完整的建议,降低每请求成本,支持更大规模并发用户。

局限

  • 论文未提供与主流闭源模型(如GPT-4、Claude)在标准agentic benchmark上的直接对比,模型的实际竞争力缺乏定量佐证;仅强调效率与开放,但推理质量与成功率等关键指标未充分披露。
  • 混合线性注意力结合Lightning Attention与MLA的设计是已有技术的组合,创新性集中在工程集成而非原理突破;架构迁移预训练依赖大规模算力,可能限制了中小团队的复现与定制。
  • KPop异步调度框架的泛化性仅在与论文配套的特定环境数据上验证,面对更开放、异构的真实agent任务时,训练稳定性与效率优势可能难以保持,且尚未在社区广泛检验。
论文Ang Li2026-06-13原文

相关内容