UniMPA:以动作为锚点的具身“记忆-预测-执行”统一模型
原标题:UniMPA: A Unified Memory-Prediction-Action Model via Action-Grounded Transition Modeling
视觉-语言-动作(VLA)模型的最新进展提升了机器人的操作能力,但从观测到动作的学习仍受限于一个根本性的转移可实现性差距(transition realizability gap),具体表现在三个紧密耦合的问题中:(i) 转移歧义性(Transition ambiguity)。视觉上相似的当前观测可能对应不同的操作阶段,并预示着不同的后续转移。(ii) 预测与执行不匹配(Prediction--execution mismatch)。视觉上看似合理的预测未来观测并不一定对应物理上可实现的转移。(iii) 经验与实现不匹配(Experience--realization mismatch)。历史上可执行的动作模式不一定能在当前场景下实现预期的转移,因此需要进行上下文感知的自适应调整。
为此,我们提出了 UniMPA,一个统一的“记忆-预测-动作”(Memory-Prediction-Action)模型,通过共享的动作关联转移接口来解决这些问题。(i) UniMPA 引入了持久-选择性未来预测(Persistent-Selective Future Prediction),通过对预期的未来状态演化建模来解决转移歧义性。持久隐流持续跟踪任务层面的进度,而对转移至关重要的像素流则通过基于记忆的预测,选择性地解析细粒度的交互变化。(ii) 为了评估预期转移的物理可执行性,预测的转移会查询一个时序视觉-动作记忆库(Visual-Action Memory Bank)。该记忆库检索历史上已实现的视觉-动作经验,使未来预测建立在可执行的证据基础之上。(iii) 为了使可执行经验适配当前场景,动作-视觉记忆库(Action-Visual Memory Bank)从历史动作演化中检索与视觉关联的动作原型。随后,原型偏置流(Prototype-Biased Flow)将流源向具有历史支持的动作流形转移,以实现上下文感知的优化细化。
为什么值得读
它直面具身模型“推演合理却无法落地”的执行鸿沟,通过双路记忆将物理世界的可行性直接嵌入未来预测与动作流中。