TORINO提出一种无需微调的视觉令牌压缩框架,利用稀疏自编码器将视觉令牌映射到可解释潜空间,并依据共享概念激活度进行分组,再执行剪枝或合并。该方法可根据图像复杂度动态调整保留令牌数量,论文称其在多个视觉语言基准上取得了较好的效率与精度平衡,但摘要未给出具体压缩率和性能数字。
最近 24 小时暂无可用热度快照。