论文提出即插即用的视频 Token 压缩框架 ONCE,将高成本压缩从逐视频在线处理转移到离线阶段:先在视觉特征空间学习频率感知的全局码本,再通过码本查找与聚合完成轻量在线压缩。摘要称其在多项视频理解基准上保持有竞争力的性能,并在所比较方法中取得最低推理延迟,但未提供具体数值。
最近 24 小时暂无可用热度快照。