论文指出,LLM强化学习中训练引擎与推理引擎的概率不一致,会造成持续存在的偏离策略问题;即使训练侧策略得到改善,也不代表部署所用的推理策略变好。作者提出单调推理策略改进目标MIPI及两步框架MIPU,通过推理侧间隙代理选择性接受候选更新,并在两种模型规模、高失配条件下报告了更好的平均推理性能与训练稳定性。
最近 24 小时暂无可用热度快照。