SFT覆盖多数场景,RL通过奖励模型学习
> SFT(监督微调,Supervised Fine-Tuning)足以覆盖大多数场景。
SFT 是直接模仿学习“标准答案”,可以快速学习使用特定工具的基础能力,RL(强化学习)是通过奖励模型自己摸索学习。
SFT 是直接模仿学习“标准答案”,可以快速学习使用特定工具的基础能力,RL(强化学习)是通过奖励模型自己摸索学习。
@oran_ge @dotey SFT已经足够覆盖绝大部分情况了。
@oran_ge @dotey SFT已经足够覆盖绝大部分情况了。