论文提出无需训练的 VTM-Nav,让视觉语言模型驱动的 ObjectNav 智能体在独立回合之间保留场景级经验。分层视觉拓扑记忆按房间组织视觉证据、区分室内与远程可见信息,并保存成功接近线索。在统一 40 步设置下,相比重置记忆的 WMNav,HM3D v0.1、HM3D v0.2 和 MP3D 的成功率分别提升 4.6、2.0 和 0.8 个百分点。
最近 24 小时暂无可用热度快照。