HuggingFace 每日论文Rongcan Pei
负向自蒸馏:让大模型在规避思维缺陷中学会推理
原标题:Negative Self-Distillation: Learning to Reason by Avoiding Flaws
论文79
模型在自我提升时,模仿带有特权信息的标准解法往往会抑制表达不确定性与回溯试错的能力。研究团队提出负向自蒸馏框架,令模型自主生成“粗心推理”等负向解题轨迹并主动远离该分布。借助动态门控机制,算法将推理关键词与基础语言表达剥离,仅惩罚逻辑漏洞,实现无需外标答案的自主纠偏。
为什么值得读
指出了过度模仿完美解题步骤对模型探索能力的抑制,提供了一种无需人工标注、通过规避自身缺陷实现推理自举的实用方案。
标签
LLMsComplex ReasoningSelf-DistillationUnlearningReinforcement LearningSelf-Correction