Qwen3后训练使用CLP提升工具效率
在规划器方面,我们分两个阶段后训练Qwen3-30B-A3B:首先从235B教师模型进行同策略蒸馏,然后使用我们称之为条件对数惩罚(CLP)的GRPO进行优化。CLP对需要更多工具调用的正确轨迹进行惩罚,鼓励高效到达答案的轨迹。错误答案始终得0分。对工具调用的简单线性惩罚(1 - ε·tc)会很快耗尽正向奖励。改用对数惩罚(1 - ε·log(1+tc))意味着每次额外调用时奖励衰减更慢,为模型在训练过程中提供了更广泛的学习范围。下图显示使用CLP(蓝色、红色)训练时,工具调用次数保持平稳而准确率上升。没有CLP(绿色)时,模型只会学习更多地搜索。[3/n]