arXiv 预印本Julien Colin
从可解释性方法转向可解释模型
原标题:From Interpretability Methods to Interpretable Models
论文77
历经十余年发展,计算机视觉领域的可解释人工智能(XAI)已构建起一套成熟的工具箱:涵盖归因、特征可视化、基于概念的方法以及基于回路的方法。然而,该领域几乎所有的精力都投入到了构建和对比这些方法上,却鲜少探究它们本应解答的核心问题——我们的模型可解释性究竟如何?随着模型的演进,我们是否取得了进展?我们主张沿着两个互补的方向,将该领域的研究重心从“方法”转向“模型”。其一已触手可及:现有工具足以让我们刻画和对比不同模型所表征与计算的内容。另一个方向则更为困难,且在很大程度上被忽视了:模型能否真正被依赖它的人类所理解——即信任与认证所依赖的独立评估者,而非仅仅印证自身既有预期的专家。这种可理解性只能通过实际测量得出,而无法直接推断。我们阐述了为何当前工具箱已足够成熟以支持这两个方向,梳理了目前为数不多的模型对比研究,引入了系统神经科学的类比,并最终提出了一项以模型为中心的 XAI 研究议程。
为什么值得读
在可解释性工具层出不穷却难以转化为结构化评估准则的当下,文章为学界从“发明探测器”转向“测度模型本身的可理解度”厘清了路径。
标签
XAIComputer VisionInterpretabilityModel EvaluationNeural CircuitsSystems Neuroscience