动态

Andrew Ng推出LLM后训练课程,涵盖SFT、DPO、RL等方法。

Andrew Ng推出LLM后训练课程,涵盖SFT、DPO、RL等方法。
Andrew Ng
新课程:LLM的后训练

学习如何在后训练中定制LLM,本短课程由华盛顿大学助理教授、NexusflowX联合创始人@BanghuaZ讲授。

训练LLM遵循指令或回答问题有两个关键阶段:预训练和后训练。预训练中,它从大量无标注文本中学习预测下一个词或token。后训练中,它学习有用行为,如遵循指令、工具使用和推理。

后训练将通用token预测器(在数万亿无标注文本token上训练)转变为遵循指令并执行特定任务的助手。由于比预训练便宜得多,更多团队将后训练方法纳入工作流程是可行的。

在本课程中,你将学习三种常见的后训练方法——监督微调(SFT)、直接偏好优化(DPO)和在线强化学习(RL)——以及如何有效使用每种方法。使用SFT,你在输入和理想输出响应对上训练模型。使用DPO,你提供偏好(选中)和不偏好(拒绝)的响应,并训练模型偏向偏好输出。使用RL,模型生成输出,基于人工或自动反馈获得奖励分数,并更新模型以改进性能。

你将学习基本概念、常见用例以及策划高质量数据以进行有效训练的原则。通过动手实验,你将下载Hugging Face上的预训练模型,并使用SFT、DPO和RL对其进行后训练,了解每种技术如何塑造模型行为。

具体来说,你将:
- 理解什么是后训练、何时使用它以及它与预训练的区别。
- 构建SFT管道,将基础模型转变为指令模型。
- 探索DPO如何通过最小化对比损失——惩罚差响应并强化偏好响应——来重塑行为。
- 实施DPO管道以改变聊天助手的身份。
- 学习在线RL方法,如近端策略优化(PPO)和群体相对策略优化(GRPO),以及如何设计奖励函数。
- 使用GRPO训练模型,通过可验证奖励提高其数学能力。

后训练是LLM训练中发展最快的领域之一。无论你是在构建高精度特定上下文助手、微调模型语气还是提高任务特定准确性,本课程都将让你体验塑造LLM后训练的最重要技术。

请在此注册:
https://deeplearning.ai/short-courses/post-training-of-llms/
动态Andrew Ng2025-07-09原文

相关内容