论文指出,混合异质任务下,同一策略会形成不同熵区间,统一或逐 token 熵控制难以兼顾探索需求;同时,GRPO 的组内归一化优势可能产生熵相关偏差。GEPO利用已有分组样本估计组熵,并通过历史统计得到自适应阈值,对正负优势进行非对称塑形,在低熵组抑制过度利用、高熵组保留探索。作者称其在两种基座模型、13个数学、物理、科学、代码和指令跟随基准上优于GRPO及近期熵控制方法。
最近 24 小时暂无可用热度快照。