DOPD提出一种优势感知的双重在策略蒸馏方法,在特权教师策略与特权学生策略之间动态分配逐Token监督,以区分可迁移能力差距和无法复制的信息不对称,缓解“特权幻觉”。论文在大语言模型和视觉语言模型实验中报告其优于Vanilla OPD及其他方法,并进一步评估稳定性、鲁棒性、持续学习和分布外任务。
最近 24 小时暂无可用热度快照。