论文提出ACPO,用“1减去最高概率”这一模态局部代理替代全局熵,为结果监督强化学习进行令牌级信用分配。方法加入错配路由与饱和修正:在正优势轨迹上强调不确定决策,在失败轨迹上惩罚过度自信区域。摘要称其在AIME 2025和HumanEval Pro等数学、代码推理基准上优于80/20、GTPO、DAPO和SAPO。
最近 24 小时暂无可用热度快照。