论文研究一种无需修改模型权重、梯度或复杂微调的适配方法:学习一个在每个解码步骤加入的、与上下文无关的 logit 偏置向量。方法基于 KL 正则化强化学习目标,并从 rollout、奖励和 token 概率中构造闭式逆倾向评分估计器。摘要称其在数学与推理基准上超过基础模型,同时参数量远少于传统微调。
最近 24 小时暂无可用热度快照。