论文针对开放式任务缺乏可验证奖励的问题,提出 Flux-OPD,在训练过程中让上下文随学生表现演化。作者从反向 KL 分解出上下文条件教师的几何均值与教师冲突项,并据此将上下文差异作为修正信号注入无上下文教师锚点,再用冲突程度调节修正强度。摘要称其在开放式任务上优于既有 OPD 方法,但未提供具体数据。
最近 24 小时暂无可用热度快照。