阅读原文
arXiv 预印本Vaishnavi B Mohan论文67

IRIS:受视觉皮层启发的视觉Transformer方向选择性分析框架

原标题:IRIS: A Visual Cortex-Inspired Framework for Analyzing Orientation Selectivity in Vision Transformers

视觉变换器(ViT)已成为众多感知任务中图像编码的事实标准。尽管其在经验上取得了成功,但鉴于缺乏归纳偏置,ViT 如何编码低层特征在机制上仍不清楚:ViT 以全局方式处理信息,而不是依赖局部结构。相比之下,生物视觉系统通过结合来自视野中小范围局部区域的信息,构建低层特征,例如初级视觉皮层中的方向选择性。这些特征是通用表示,在多个专门化神经通路之间共享且不可或缺,不同于更高层次、特定于任务的语义特征。这引出了一个问题:此类具有生物学依据的特征是否也会在 ViT 中出现?在本研究中,我们通过引入一组受神经科学启发的指标,系统研究方向选择性如何在 ViT 中产生:表征相似度得分(RSS)、方向招募得分(ORS)以及方向调谐带宽,用于量化方向如何编码在表征几何结构中,以及这种编码如何随模型深度变化。通过广泛分析,我们发现:(1)训练范式是决定方向选择性的最重要因素;采用相同训练目标的模型,无论规模如何,其方向选择性都会在相近的相对深度处达到峰值;(2)许多单元在训练早期就表现出方向选择性,随着训练进行,早期到中间层会招募更多此类单元,而更深层则会失去选择性并拓宽其调谐范围,转向语义编码;(3)我们的指标为确定应解冻多少层以获得最佳下游泛化能力提供了一种机制性启发式方法。我们的框架为追踪 ViT 训练过程中的生物学特征、探究目标属性如何编码在变换器表征中,以及系统理解 ViT 如何跨任务泛化提供了一种途径。

为什么值得读

它把ViT低层表征分析连接到可量化的神经科学指标,并可能直接影响迁移学习中的解冻层数选择,但未来日期与缺少正文证据需谨慎对待。

标签

Vision Transformermechanistic analysisorientation selectivityvisual cortexrepresentation learningtransfer learningarXiv