论文提出结构化稀疏自编码器 S²AE,针对视觉语言模型中稀疏特征跨图像区域碎片化、跨模态概念不一致的问题,引入基于注意力相似度与空间邻近性的图像分组,并结合组内组稀疏和组间排他稀疏。在 Qwen2.5-VL-7B-Instruct 上,语义对齐 mIoU 平均提升 6.06%,l0 范数为 60.81,同时保持超过 99% 的解释方差。
最近 24 小时暂无可用热度快照。