动态

通过self-play bug注入修复扩展强化学习训练编码代理

通过self-play bug注入修复扩展强化学习训练编码代理
Junyang Lin
非常好的一项工作!强化学习为编码代理达到智能水平开辟了许多潜力,但始终难以获得可扩展的问题供模型学习。这种通过bug注入和修复的自我对弈非常巧妙,展示了潜在的可扩展性,尽管我总是担心bug的复杂性。这是编码代理研究的一个有前景的方向!
Yuxiang Wei
软件代理可以通过自我对弈的强化学习实现自我改进。

介绍Self-play SWE-RL (SSR):训练单个LLM代理在bug注入和bug修复之间进行自我对弈,基于真实世界仓库,无需人工标注的问题或测试。🧵
动态Junyang Lin2025-12-27原文

相关内容