论文提出陈旧度自适应信赖域SAT,用脱离梯度的采样log-ratio估计异步强化学习中的策略滞后,并对高失配样本收缩PPO区间的特定端点。在Qwen3-30B-A3B-Base、SGLang与Megatron组成的异步系统中,SAT-GSPO w/ R3在AIME24 avg@8上于lag 1和lag 8分别达到35.83与34.79。
最近 24 小时暂无可用热度快照。