论文提出单轨迹异步优化(SAO),用每个提示词一次采样替代GRPO的组采样,并结合价值模型训练与严格的双侧令牌级裁剪,以缓解异步强化学习中的离策略与训练不稳定问题。作者称其可稳定训练1000步,并在SWE-Bench Verified、BeyondAIME和IMOAnswerBench上持续优于GRPO及其变体,还用于训练750B-A40B规模的开放模型GLM-5.2。
最近 24 小时暂无可用热度快照。