QLPO 是一种基于 GRPO 的重采样方法:先过量生成候选回答,再保持训练组中正确与错误样本的经验比例,同时偏向短且正确、长且错误的回答。论文称,该方法无需修改奖励函数或增加控制模块,在 1.5B 至 32B 模型上将回答长度缩短 30% 至 70%,并维持推理表现。
最近 24 小时暂无可用热度快照。