论文提出体验式学习(EL),将传统 LLM-as-a-Judge 的评分模型改造成 LLM-as-a-Coach,把对策略模型输出的文本评价提炼为可迁移经验,再通过在策略上下文蒸馏完成学习。作者称,EL 在两个策略模型家族、不同反馈模型设置及未见开放式任务上优于基于量规的强化学习,并能缓解奖励破解。
最近 24 小时暂无可用热度快照。