论文指出,在策略蒸馏(OPD)的逐 token 教师信号可能受语言先验、格式习惯或刻板推理模板驱动,而非任务证据,从而产生方向错误但梯度很大的更新。SA-OPD用输入依赖性代理指标识别信号,并仅过滤同时低输入扎根性、蒸馏分歧极端的 token;摘要称其在LLM与VLM实验中优于标准OPD及竞争性选择方法。
最近 24 小时暂无可用热度快照。