VisCo提出一种训练高效的视觉令牌自压缩框架,复用预训练视觉语言模型本身作为内在压缩器。该方法通过少量记忆令牌和参数共享的自编码结构传递层级信息,在不同压缩率下超过既有方法,并在单令牌极限设置下保持稳定;记忆令牌与原始视觉令牌结合时还可能改善基础模型表现。
最近 24 小时暂无可用热度快照。