论文在动态 FrozenLake 环境中研究视觉语言模型智能体如何处理过时空间记忆与新观测的冲突,覆盖 3 个闭源模型和 3 个开放权重 VLM。实验显示,文本中的陈旧性判断并不等于视觉定位能力;在 GPT-4o 设置中,直接信任原始记忆的智能体死亡率超过无记忆基线两倍,而审计过滤只能部分缓解风险。
最近 24 小时暂无可用热度快照。