论文以国际象棋为受控测试场,训练5M至1B参数模型,系统研究预训练、监督微调与可验证奖励强化学习之间的关系。结果显示,预训练损失可预测固定RL算力下的表现,RL收益斜率随预训练token近似线性提升;RL在简单题上强化已有偏好,在难题上则能挖掘SFT中几乎未出现的正确走法。数学领域的1B模型也呈现相同趋势。
最近 24 小时暂无可用热度快照。