论文研究激活预言机(AO)能否可靠读取另一模型的内部信息。在禁词猜测实验中,微调后的AO会选择性地无法报告其训练中持续出现的隐藏概念,成为“反阅读器”。分析显示,目标概念仍可在AO内部解码,失败更可能发生在读出路径,说明行为泄漏、表示可解码性与AO可言说性并不等价。
最近 24 小时暂无可用热度快照。