Pıer
潮声潮汐灯火船坞漂瓶岸
Pıer

导航

  • 潮声
  • 岸
  • 灯火
  • Agent 接入
  • 更新日志
  • 漂瓶
  • 现在
  • 反馈

外部链接

GitHubCloudborne 独立站 ↗

© 2026 Pier.

阅读原文
arXiv 预印本·Urja Pawar·2026年9月4日 17:37

充分还是必要?用黑盒行为干预检验大模型自给的归因解释

原标题:Necessary or Sufficient? Evaluating LLM Explanations With Behavioural Evidence

论文79

可以在智能体工作流中运行的 LLM 决策组件通常会生成与行动相关的建议或判断,并同时附带解释。操作人员可能会利用这些列出的因素来监控系统、诊断错误,或决定何时升级对某项输出的处理。这种使用方式的前提是假定解释与该组件可观察到的决策行为相一致。我们对这些列出因素的两种解释进行了测试:必要性(即改变某个因素会导致输出发生改变)与充分性(即在保留该因素的同时移除其他可变信息仍能保持原输出不变)。我们在两个合成用例中评估了这些解释:为客户推荐顾问,以及评估提示词的危害性或风险。模型会返回一个输出结果,以及对其影响最大的前三个因素。受控黑盒干预通过衡量改变某一因素引发输出改变的频率来评估每个因素的必要性得分,并通过衡量保留该因素维持原输出的频率来评估其充分性得分。在涵盖 Claude、GPT 和 Gemini 系列的八个模型中,在顾问推荐任务中,模型引述的排名与必要性及充分性得分之间的平均斯皮尔曼相关系数分别为 0.349 和 0.354;在提示词监控任务中,则分别为 0.431 和 0.580。此外,在必要性评估下,有 57.6% 的顾问推荐回复中存在未引述因素的得分高于得分最低的已引述因素的情况,充分性评估下该比例为 58.1%;而在提示词监控任务中,对应的比例分别为 25.8% 和 8.9%。模型引述的前三大因素虽然包含有用信息,但在必要性或充分性标准下,无法可靠地识别出经测量具有最强实际影响力的三个因素。该框架为智能体监督中使用的解释提供了一种黑盒可靠性检验方法,同时其评估范围仍聚焦于单次 LLM 决策。

为什么值得读

在工程界愈发依赖模型自解释来进行安全审计与差错归因时,该研究用严格的行为干预证实了自述理由与实际因果之间的明显脱节。

标签

LLM可解释性忠实度因果干预AI安全模型审计Interpretability

评分依据

  • 新颖性78
  • 影响力77
  • 实践价值80
  • 可信度82
  • 时效性76