3DZip针对3D视觉语言模型场景令牌数量过多的问题,提出三阶段压缩流程:先用粗粒度体素化去除点级冗余,再通过基于行列式点过程(DPP)的特征多样性选择锚点,最后在空间约束下合并其余令牌。论文称其在三个3D问答基准上保留原始性能的94.7%。
最近 24 小时暂无可用热度快照。