阅读原文
HuggingFace 每日论文Yinuo Jiang论文84

当教师误导学生:具备伪信号感知能力的在策略蒸馏

原标题:When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation

论文指出,在策略蒸馏(OPD)的逐 token 教师信号可能受语言先验、格式习惯或刻板推理模板驱动,而非任务证据,从而产生方向错误但梯度很大的更新。SA-OPD用输入依赖性代理指标识别信号,并仅过滤同时低输入扎根性、蒸馏分歧极端的 token;摘要称其在LLM与VLM实验中优于标准OPD及竞争性选择方法。

为什么值得读

OPD正被用于更细粒度地迁移教师能力,而这项工作把“教师信号是否真正依赖输入”加入筛选标准,直接触及蒸馏更新的可靠性。

标签

on-policy distillationSA-OPDLLMVLMknowledge distillationspurious signalsalignment