论文提出 LaMem-VLA,针对传统视觉-语言-动作模型依赖当前观测、难以处理长时序任务的问题,将历史经验重建为与模型推理相同空间中的潜在记忆令牌。系统通过短期与长期记忆库、检索器、压缩器和交织器,把历史上下文与当前视觉观测及指令共同输入策略,并在 SimplerEnv 与 LIBERO 上进行实验。
最近 24 小时暂无可用热度快照。