UniMPA: Action-Grounded Memory-Prediction-Action Framework for Robotic Manipulation
Original title:UniMPA: A Unified Memory-Prediction-Action Model via Action-Grounded Transition Modeling
Vision-Language-Action models often falter when visually ambiguous scenes demand distinct manipulation phases, leading to predictions that are visually plausible but physically impossible to execute. UniMPA tackles this transition gap by integrating memory retrieval, future prediction, and policy execution into a single action-grounded architecture. Utilizing dual temporal memory banks, it cross-references planned transitions with verified historical executions, constraining action flow generation to physically grounded trajectories and stabilizing complex robotic manipulation.
Why it's worth reading
It directly tackles the prediction-execution gap in robotic VLA models by grounding future state evolution and action flows in physically verified historical memories.