论文提出贝叶斯重复惩罚框架,通过比较生成 token 的观测频率与语料先验,构造自归一化惩罚比率,并将其转化为无近似误差的 logit 偏置。该偏置以指数移动平均写入冻结输出层,用于修复已经陷入重复吸引子的模型。作者在 1.5B 参数模型上报告,2-gram 重复率由 0.073 降至接近 0,同时保持生成质量。
最近 24 小时暂无可用热度快照。