动态

混合后训练流程:分领域训练专家模型再统一对齐

Z.ai
我们的混合后训练流程通过冷启动监督微调(SFT)和专门化强化学习(RL)为每个领域(推理、代理、通用)训练专家模型。然后通过大规模SFT自蒸馏统一知识,随后进行三阶段RL对齐,用于推理、代理和通用任务。
动态Z.ai2025-07-28原文

相关内容