动态

SFT覆盖多数场景,RL通过奖励模型学习

宝玉
> SFT(监督微调,Supervised Fine-Tuning)足以覆盖大多数场景。

SFT 是直接模仿学习“标准答案”,可以快速学习使用特定工具的基础能力,RL(强化学习)是通过奖励模型自己摸索学习。
熊师傅 weight decay 了吗
@oran_ge @dotey SFT已经足够覆盖绝大部分情况了。
动态宝玉2025-07-14原文

相关内容