Adobe和Rutgers提出EPO优化LLM Agent RL,性能提升152% DailyPapersAdobe与Rutgers为LLM Agent RL引入EPO这种熵正则化策略优化解决了多轮、稀疏奖励环境中'探索-利用级联失败'的核心挑战。在ScienceWorld上实现了高达152%的性能提升。 动态DailyPapers2025-09-29原文 打开互动版