动态

SAO训练方法优于GRPO等

jietang
我们的单轮异步优化(SAO)能够稳定训练一千步,并在代理编码和推理基准(如SWE-Bench Verified、BeyondAIME和IMOAnswerBench)上持续优于GRPO及其变体。
动态jietang2026-07-14原文

相关内容