通过LLM模拟环境扩展强化学习训练
通过经验合成扩展智能体学习
:
http://arxiv.org/abs/2511.03773
使用推理LLM模拟训练环境来扩展强化学习的训练环境!
环境模型 + 回放缓冲区 + 新任务 = 任何环境的廉价强化学习!
- 在非强化学习就绪环境和多个模型家族上有显著改进!
- 在仿真到真实强化学习设置中效果更好 → 为高成本环境提供热启动
1/7
:
http://arxiv.org/abs/2511.03773
使用推理LLM模拟训练环境来扩展强化学习的训练环境!
环境模型 + 回放缓冲区 + 新任务 = 任何环境的廉价强化学习!
- 在非强化学习就绪环境和多个模型家族上有显著改进!
- 在仿真到真实强化学习设置中效果更好 → 为高成本环境提供热启动
1/7