论文质疑视觉语言模型必须依赖固定二维 patch 特征的假设。作者发现,VLM 微调会让视觉表示更抽象、空间一致性下降,并提出 RADIO1D:通过多教师知识蒸馏与自动编码器,将图像压缩为可变长度的一维 token 序列,在场景理解、图像检索和多模态基准上实现精度与计算开销的灵活权衡。
最近 24 小时暂无可用热度快照。