论文提出CEDI评测框架,将多模态大语言模型评估重构为被测模型、自动考官与评分器之间的动态三方交互。考官依据图结构任务表示进行多轮对话,通过澄清、对抗探测等策略评估视觉幻觉。摘要称,CEDI在多模型、多数据集和多领域实验中发现,交互式评测能揭示更多且更贴近实际使用的幻觉,尤其包括长上下文累积、自我强化以及无法拒绝错误前提等问题。
最近 24 小时暂无可用热度快照。