SAO训练方法优于GRPO等 jietang我们的单轮异步优化(SAO)能够稳定训练一千步,并在代理编码和推理基准(如SWE-Bench Verified、BeyondAIME和IMOAnswerBench)上持续优于GRPO及其变体。 动态jietang2026-07-14原文 打开互动版