浙江理工与南京大学联合提出EMCES,用情景记忆引导强化学习样本合成
EMCES利用情景记忆为可控扩散模型提供条件,合成更有助于策略学习的样本,大幅提升效率。
合成样本虽真实,但对策略学习帮助有限。EMCES引入情景记忆机制,引导扩散模型优先合成高价值样本。相比已有方法,存储开销降低约8000倍,时间开销降低25.5倍,且不损失下游算法性能。
正文摘录
.jpg)  近年来,强化学习在游戏智能体、具身智能、大语言模型等领域取得了显著进展。然而,在真实世界中,强化学习仍面临一个核心难题:高质量样本的获取不仅成本高昂,还可能带来多种风险。因此,样本增强成为缓解强化学习中样本获取成本高、风险大等问题的重要途径之一。 近年来,受扩散模型其强大分布建模能力的启发,研究者们提出了基于扩散模型的样本增强方法(代表方法是 SynthER [1]),通过合成高保真样本实现训练数据的扩充。 然而,合成样本虽然符合真实环境动态,但未必最助于智能体的策略学习。为了更清楚地展示这一局限性,论文采用经典离线强化学习算法 TD3+BC [2],在合成样本集上训练智能体并评估其表现。实验在 Hopper 环境中的 medium-expert 样本集上进行。该样本集由 D4RL 基准 [3] 提供,包含约 200 万条直接从环境中预先采集的样本。合成样本集由 SynthER 合成所得,其规模设置为从 10 万条到 500 万条不等。 实验结果如下(原论文图 1b)。