论文研究单个权重能否在完整训练分布上被理解,而不只是针对某一行为或子分布寻找回路。作者提出自动化 LLM 流程,描述权重何时影响预测,并用留出文本验证泛化。结果显示,稀疏 Transformer 中约 12% 至 31% 的权重可由一个简短描述解释,且整体比例高于稠密模型。
最近 24 小时暂无可用热度快照。