Pıer
潮声潮汐灯火船坞漂瓶岸
Pıer

导航

  • 潮声
  • 岸
  • 灯火
  • Agent 接入
  • 更新日志
  • 漂瓶
  • 现在
  • 反馈

外部链接

GitHubCloudborne 独立站 ↗

© 2026 Pier.

阅读原文
arXiv 预印本·Ravi Ranjan·2026年9月9日 16:50

FOM-UL:基于层级选择性遗忘的大模型鲁棒机器遗忘框架

原标题:Forgetting Only What Matters: Layer-Selective Unlearning toward Robust LLMs

论文78

大型语言模型(LLM)可能会记住并复现敏感、受版权保护或其它不良的训练内容,从而引发隐私、安全和监管方面的担忧。机器遗忘(Machine unlearning)提供了一种替代完全重新训练的实用方案,但许多现有方法采用宽泛或固定的参数更新,这可能会降低模型效用,并且在诸如训练后量化等部署变化下表现脆弱,其中已遗忘的知识可能会部分重新出现。我们提出了 FOM-UL(Forgetting Only What Matters via Unlearning Layers),这是一种层级遗忘框架,它利用“遗忘-保留显著性得分”来选择 Transformer 层。该得分可识别出对遗忘集影响较大且对保留集敏感度较低的层,从而使 FOM-UL 能够将更新集中在最有效的位置,同时保持模型的大部分不变。这种针对性的更新策略改善了遗忘与效用之间的权衡,并通过减少微小且分散的更新被低比特舍入抹去的可能性,为实现抗量化的遗忘提供了一条实证路径。在 TOFU、KnowUnDo 和 MUSE 风格的评估中,与基于 GA、NPO、KLD、SURE、ReLearn 和 LUNAR 的强大基线相比,FOM-UL 减少了残留记忆,同时使保留集效用保持在接近原始模型的水平。在 8 位和 4 位训练后量化下,FOM-UL 比竞争方法保持了更强的记忆抑制能力和效用保留能力,且对抗性提示评估显示已遗忘内容的恢复率更低。总体而言,FOM-UL 提供了一种高效的遗忘策略,在不要求形式化擦除保证的前提下,提升了针对性遗忘、效用保留和部署鲁棒性。

为什么值得读

它切中了机器遗忘在低比特量化等实际部署场景中容易失效的痛点,给出了极低侵入性的层级选择方案。

标签

LLMMachine UnlearningQuantizationModel SafetyTransformersarXiv

评分依据

  • 新颖性76
  • 影响力78
  • 实践价值82
  • 可信度80
  • 时效性75