论文在含匹配重训练参考的受控 nonce-fact 测试床上发现,常见的 trained-probe 对齐标准会偏好仍保留遗忘知识的方法。跨五类开放架构、45个模型种子单元的审计显示,基于基模型的 held-out 筛查可作为高灵敏度必要测试,但不能构成充分认证;固定幅度 logit 抑制攻击还击穿了部分前向认证。
最近 24 小时暂无可用热度快照。