论文指出,RLVR 的有界响应级奖励与 OPD 的稠密逐 token 优势结合时,会因数值尺度和训练时序失配导致熵塌缩。作者提出 SAF,通过仅处理 OPD 优势的稀疏化、压缩、预热和退火四阶段流程稳定融合。在 Qwen3-1.7B/4B/8B 的数学推理与代码生成实验中,七个基准的六种模型领域组合较固定系数融合提升 0.51%–2.70%。
最近 24 小时暂无可用热度快照。