论文提出 One Token at a Time(OTaT)分析框架,按语义角色追踪多模态大语言模型生成时对图像、文本、指令和已生成 token 的注意力变化。研究覆盖两个主流模型家族及四个不同规模的开放权重 MLLM,发现图像注意力在需要视觉信息时升高,任务切换时模型重新关注指令,生成后期则更依赖历史 token;干预实验进一步验证这些变化具有因果作用,并据此提出测试时注意力调节方法。
最近 24 小时暂无可用热度快照。