SyRuP提出一种无需微调基础模型的推理时控制框架:利用系统提示词条件下的偏好数据训练交叉注意力奖励头,为候选 token 生成遵循度分数,再与基础模型 logits 及可选的对比信号结合重排 top-k 候选。论文称其在系统提示词遵循基准上优于多种提示和解码基线,但摘要未披露具体模型、数据集与提升幅度。
最近 24 小时暂无可用热度快照。