这项研究把用户的沟通意图作为独立的可解释性对象,发现六个模型、四个模型家族及基础检查点的默认通道隐藏状态,都能通过线性探针稳定解码“识别还是评价”等意图,而且与表面措辞无关。问题主要出在读出和行为:部分模型没有按意图生成回应;在识别/评价任务中,因果方向引导可恢复目标行为,但可能压过明确指令。
最近 24 小时暂无可用热度快照。