Toward Skill-Native LLMs: 用于基准测试和训练长程推理的技能熵
近期大语言模型的长程推理要求模型在推理链中切换不同技能, 例如先进行数学推导, 再利用结果规划日程。我们将此类问题称为跨技能长程任务: 多步骤任务, 其步骤需要不同推理技能且依赖早期输出。现有基准通常评估单一技能, 缺乏衡量模型技能切换能力的原理性方法。我们同时从评估与训练两个方面填补这一空白。 我们引入技能熵(Skill Entropy), 一种衡量从一个技能切换到另一技能难度的指标, 并提出 Skill^2-Bench 基准, 该基准基于 9 个可验证和开放式领域中的 558 个技能构建跨技能长程任务。每个任务分配一个任务级技能熵分数, 并分为三个难度级别。在 Skill^2-Bench 上评估 8 个前沿模型和 4 个开源模型, 揭示了技能切换鸿沟: 在更高熵任务上准确率下降。 我们进一步将技能熵从基准尺度转化为训练信号, 提出 Skill-Entropy RL 强化学习框架, 其中模型不仅预测每一步的答案, 还预测产生该答案所用的技能。奖励结合了步骤级正确性与技能熵奖励, 后者衡量模型预测技能序列与金标准技能序列之间的对齐程度。在 Qwen3-4B-Instruct 和 Qwen3-1.7B 上, Skill-Entropy RL 将 Skill^2-Bench 得分分别从 34.4% 提升至 68.4%、从 14.6% 提升至 40.1%, 优于竞争基线。该流程可应用于现成训练数据(如 OpenR1-Math), 表明技能熵是可复用的训练信号。代码可在 https://github.com/Gen-Verse/Skill-Entropy-RL 获取。
论文精读
TL;DR 提出**技能熵** (Skill Entropy) 度量长程推理中技能切换的难度,构建 **Skill^2-Bench** 基准,并将技能熵作为 RL 奖励信号,显著提升 LLM 在跨技能多步任务上的表现。
问题
问题背景
当前大语言模型(LLM)正在被用于越来越复杂的 长程推理 任务,例如跨多步的数学证明、代码生成,或是融合规划与逻辑推导的智能体决策。这类任务要求模型在推理链中灵活切换不同的技能(例如先进行代数推导,再基于结果制定行程安排),而不再是单一技能的线性延伸。
现有方法局限
现有的评测基准(如 MATH、GSM8K)大多孤立地评估单种技能,无法衡量模型在技能之间切换的能力。这导致两个直接的问题:
- 评估缺失:即使模型在每个技能上得分很高,面对混合任务时仍可能出现断层式的性能下降,但现有指标无法捕捉这种“技能切换差距(skill-switching gap)”。
- 训练信号欠缺:当前强化学习(RL)方法通常只奖励最终结果的正确性,忽略了过程中技能选择的合理性,模型难以学习到何时、如何切换技能。
为什么这个问题难且重要
技能切换的难点在于它需要:
- 规划隐含的技能序列;
- 在不同类型的推理范式之间进行控制转移;
- 保持跨步的上下文一致性和输出依赖。 这本质上是对 LLM 的元认知和策略规划能力的考验。从工程价值看,任何需要多步 Agent 的场景(如自动代码调试、复杂查询规划)都严重依赖这一能力。如果模型不能稳定切换技能,整个长程任务的可用性就会大打折扣。因此,业界迫切需要一套可量化的技能切换难度指标,以及能够直接优化该指标的训练框架。
行业类比
类似于自动驾驶系统需要在「感知→预测→规划→控制」之间无缝衔接,长程推理模型也必须平滑地在「数学计算→约束求解→自然语言生成」等技能间跳转——任一接口的失效都会导致整体任务崩溃。
核心洞察
- **技能熵 (Skill Entropy)** 将跨技能长程推理的难度量化为技能切换的不确定性,填补了现有基准只评估单一技能、忽略技能间转换成本的空白。传统推理评测主要关注孤立的数学、代码等任务,而实际复杂问题需要模型在推理链中依次调用不同技能(如数学推导→逻辑规划)。技能熵通过估计从一种技能过渡到另一种的期望困惑度,定量刻画了这种切换的难度,为评测模型的长程推理能力提供了更贴近真实场景的维度。
- **将评测指标转化为训练信号** 是另一关键洞察:Skill-Entropy RL 框架不仅在奖励中纳入步骤正确性,还引入技能序列对齐奖励,迫使模型显式学习何时切换技能。这区别于常见的过程奖励模型只关注最终答案或步骤级正确性,而是通过强化学习直接优化模型的技能路由策略,使模型变成“技能原生”的推理器。该方法在 Qwen3-4B 上将 Skill^2-Bench 准确率从 34.4% 提升至 68.4%,且可无缝嵌入现有训练数据(如 OpenR1-Math),证明技能熵作为可复用训练信号的工程价值。
方法
我们构建了一个从评测到训练的统一框架。输入为包含多技能切换的长程推理任务(Skill^2-Bench),每个任务由问题文本、标准答案以及由参考模型导出的技能序列(gold skill sequence)组成。
输入
- 多步推理问题,需先后运用不同技能(如数学推导、日程规划)。
- 问题被赋予一个 技能熵(Skill Entropy) 分数,该分数衡量技能间切换的难度,由参考模型在技能序列上的概率分布计算得出,并用于难度分层。
关键模块
- 技能熵(Skill Entropy):从参考模型的困惑度出发,度量不同技能间转换的信息量。它既作为 Benchmark 难度标尺,又被转化为训练信号。
- Skill-Entropy RL:一种强化学习框架,要求模型在每个推理步骤同时输出答案片段和使用的技能标签。奖励由两部分组成:
- 步骤正确性奖励:基于答案是否与标准答案匹配。
- 技能熵对齐奖励:衡量模型预测的技能序列与 gold skill sequence 的匹配度(如通过嵌入相似度),匹配度越高奖励越大。
训练时,模型首先生成带技能标注的推理链,然后根据上述组合奖励进行优化(可能采用 PPO-like 算法)。框架允许直接应用于现成数据集(如 OpenR1-Math),只需为数据标注技能序列即可复用该训练信号。
输出
训练后的模型在跨技能长程任务上的准确率显著提升,例如在 Qwen3-4B-Instruct 上,Skill^2-Bench 分数从 34.4% 提升至 68.4%,且优于仅用答案奖励或仅用技能预测的基线。
与同类方法的差异:传统 RL 训练多依赖最终答案的对错或步骤级正确性,忽略推理过程中技能切换的连贯性。Skill-Entropy RL 首次将技能切换的信息熵作为辅助奖励,显式鼓励模型学习结构化的技能调度,而不仅仅是模仿答案序列。
实验
实验设计
以 Skill^2-Bench 为核心,构建覆盖 9 个领域、558 种技能的跨技能长程推理任务。每个任务根据 技能熵(Skill Entropy) 分配难度等级,评估模型在推理链中切换不同技能的能力。实验首先在 8 个前沿模型和 4 个开源模型上评测基准性能,确认技能切换缺口。训练阶段提出 Skill-Entropy RL,让模型在每一步同时预测答案和使用的技能,奖励函数融合步骤级正确性与预测技能序列与黄金序列的对齐度(技能熵奖励)。该方法在 Qwen3-4B-Instruct 和 Qwen3-1.7B 上训练,并验证迁移至现成数据集(如 OpenR1-Math)的效果。
关键发现
- 技能切换缺口: 模型在低熵任务(技能切换少)上表现较好,高熵任务准确率显著下降,显示现有 LLM 在序贯技能组合上存在短板。
- Skill-Entropy RL 带来大幅提升: Qwen3-4B 从 34.4% 提升至 68.4%,Qwen3-1.7B 从 14.6% 提升至 40.1%,且该方法可直接应用于离线训练数据,无需专门构造。
- 可复用性: 在 OpenR1-Math 上应用同一管线同样能提升跨技能推理能力,证明技能熵可作为通用训练信号。
与基线对比
Skill-Entropy RL 的核心优势在于将技能序列显式建模为训练目标,相较仅奖励最终答案或稀疏步骤奖励的传统 RL 方法,它能更直接地优化技能切换过程。在 Skill^2-Bench 上的领先幅度表明,密集奖励加技能对齐不仅提升单步质量,更系统性改善了模型在不同技能间的调度能力,这对复杂 Agent 任务尤为关键。
行业影响
落地场景
Skill Entropy 框架直接受益于需要 跨技能长程推理 的产品场景。典型如 自动化工作流引擎(多步骤数据分析、排程、报告生成)、复杂客服机器人(需结合知识检索、逻辑校验、总结回复)、金融投研助手(数据预处理、量化建模、可视化说明)及 教育自适应导师(诊断、生成练习题、评估答案)。在这些场景中,单次交互需串联多种技能,现有模型常在技能切换时出错,Skill Entropy 可度量并优化这种“技能切换”瓶颈。
商业价值
- 降本增效:通过 Skill-Entropy RL 训练,模型在长程任务上的成功率大幅提升(如 Qwen3 4B 从 34.4% 提升至 68.4%),可减少人工审查与重试成本。
- 体验提升:端到端解决复杂问题,降低平均解决时间,提升客户满意度。
- 数据效率:Skill Entropy 作为可迁移的训练信号,可直接应用于现成数据(如 OpenR1-Math),降低从零构建标注数据的开销。
与现有产品/工作流的接口
Skill^2-Bench 可作为模型选型的标准测试集,评估候选模型在真实多技能任务上的表现。Skill-Entropy RL 训练框架易于集成到现有 RLHF/Verifiable Reward 管线中:只需在每条训练样本上附加技能序列标签(可由 LLM 自动标注),并加入基于技能匹配的奖励分量。代码已开源,可直接适配主流训练栈(如 TRL, VeRL)。
具体用例
- 电商智能客服:处理“订单修改+优惠券叠加+部分退款”类请求,需技能序列:信息检索 → 规则计算 → 数学推理 → 对话生成。使用 Skill-Entropy RL 微调客服模型,可显著提高一次解决率,降低转人工率。
- 金融服务:投研报告自动生成,需从财报中提取数据、执行财务比率计算、市场对比分析、生成文本总结,这些技能组合要求高。Skill Entropy 可帮助训练模型,确保推理链中各技能衔接准确,生成更可靠的分析报告。
局限
- **技能熵计算依赖参考模型,缺乏自动化选择机制**:技能熵的估计需借助指定的参考模型(如 DeepSeek-V2),论文指出参考模型的选择会影响熵排序的稳定性和与人类判断的一致性(附录 B.5)。然而,对于如何跨不同任务分布自动选取最优参考模型,文中未给出通用方案。若参考模型能力不足或存在偏差,可能扭曲技能切换难度的量化结果,进而影响基准的准确性及训练奖励的可靠性,这限制了该方法在高度异构任务集上的即插即用性。
- **Skill-Entropy RL 依赖步骤级技能标签,可扩展性受限**:训练中需要为每个推理步骤提供 gold 技能序列作为监督信号,该信号在论文中主要通过模型自动标注或规则生成。对于任意自然长程任务,获取细粒度技能标签的成本较高,尤其是涉及开放式生成或主观判断的领域。虽然作者展示了在 OpenR1-Math 等数学推理数据上的迁移能力,但将该框架推广至无现成技能标注的通用文本或对话任务时,需要额外的标注 pipeline 或可靠的对齐方案,工程落地难度增大。
- **基准任务的合成性可能限制真实场景的代表性**:Skill^2-Bench 由 proposer 模型根据技能种子和模板合成许多跨技能任务,尽管构造过程考虑了多样性,但合成任务与人类设计、工业级复杂长程任务之间的差异尚未量化分析。评测集中在 Qwen3 系列等较小开源模型上,对更大规模(如 70B+)前沿模型时,技能切换 gap 是否依然显著、Skill-Entropy RL 的提升幅度是否饱和,仍需进一步验证。此外,部分任务被公认为开放式,自动评估的可靠性虽有对齐实验,但仍可能因 prompt 敏感性而波动。