模型在真实agent环境中后训练,含SFT、RL等阶段
RT @liquidai: 我们在人们使用的真实Agent环境中训练它。
> 后训练的四个阶段:SFT、专家专化、多领域在线策略蒸馏和Agentic RL
> 后训练的最后阶段是通过Pi、Hermes Agent和OpenClaw进行多轮Agentic RL
> 每次回滚都在自己的沙箱中运行,使用GRPO根据结果奖励进行优化:LLM作为裁判的评分标准、程序化检查以及硬性安全门。该模型在到达时已经见过它们的工具、系统提示和交互模式。
> 后训练的四个阶段:SFT、专家专化、多领域在线策略蒸馏和Agentic RL
> 后训练的最后阶段是通过Pi、Hermes Agent和OpenClaw进行多轮Agentic RL
> 每次回滚都在自己的沙箱中运行,使用GRPO根据结果奖励进行优化:LLM作为裁判的评分标准、程序化检查以及硬性安全门。该模型在到达时已经见过它们的工具、系统提示和交互模式。