动态

通过LLM模拟环境扩展强化学习训练

通过LLM模拟环境扩展强化学习训练
Jason Weston
通过经验合成扩展智能体学习
:
http://arxiv.org/abs/2511.03773

使用推理LLM模拟训练环境来扩展强化学习的训练环境!

环境模型 + 回放缓冲区 + 新任务 = 任何环境的廉价强化学习!

- 在非强化学习就绪环境和多个模型家族上有显著改进!
- 在仿真到真实强化学习设置中效果更好 → 为高成本环境提供热启动
1/7
动态Jason Weston2025-11-07原文

相关内容