CoRT针对规则引导的GRPO训练,将原本广播到整段回答的响应级优势重新分配到令牌级。方法用同一回答在带规则与不带规则提示下的逐令牌似然差异,估计令牌对规则上下文的依赖,并据此加权优势,无需额外训练令牌评分器。论文称其在多数比较中优于匹配的响应级GRPO,平均提升4.4个百分点。
最近 24 小时暂无可用热度快照。