论文提出 Phi-Nav,用路径级后见推理缓解视觉语言导航中在策略探索阶段出现的指令与实际轨迹语义错配。框架包含专家引导探索、后见指令生成和第二轮模仿学习三个阶段,并在 R2R-CE、RxR-CE 上报告了具有竞争力的表现,同时仅需当前基线所用专家示范的一小部分。
最近 24 小时暂无可用热度快照。