论文提出 Surrogate Latent Policy Optimization(SLPO),为自回归潜在推理器构造潜在状态转移的经验替代策略密度,并加入受正确性监督的停止头,使结果奖励强化学习能够进行轨迹级信用分配和可变时长推理。在连续与软思考设置中,SLPO提升并行采样的 Pass@k,并让模型将更多潜在计算分配给困难样本。
最近 24 小时暂无可用热度快照。