论文提出GradCuit:冻结模型参数,在选定Transformer层插入可优化潜在状态,并利用因果自注意力将整段续写的奖励加权梯度直接分配给潜变量。作者报告其在5个指令微调模型、3项推理基准和2种答案格式上平均准确率64.5%,较思维链高6.6个百分点,较最强对比方法高2.4个百分点。
最近 24 小时暂无可用热度快照。