论文研究多模态助手跨多轮对话保存视觉事实时,何时可以安全淘汰图像 KV。作者提出因果视觉记忆审计 CVMA,在 VisDial 和 ConvBench 上发现,当前注意力可能比随机选择更差地预测未来有用区域;若事实已被助手文本明确说出,文本 KV 可部分替代图像 KV,但对未陈述事实并不可靠。
最近 24 小时暂无可用热度快照。