论文提出对比策略优化(CPO),利用参考引导生成分布与普通生成分布之间的逐 token 对比分歧,为具备可验证奖励的强化学习塑造更具正确性感知的优势。作者称该信号能区分有益探索与错误混淆,并将在线蒸馏视为 CPO 的特例,同时缓解零优势问题,在域内外基准上优于基于熵的方法。
最近 24 小时暂无可用热度快照。