The paper introduces Pegasus, a low-resource framework for converting human manipulation videos into robot-learnable data. It builds a Task Graph from human demonstrations, transforms it through Affordance and Constraint Graphs, and produces a Robot Planning Graph for robot-conditioned video generation. A hierarchical affordance latent space aims to generalize across object identities, while a closed-loop physics verifier filters generations against kinematic feasibility, collision constraints, and joint limits. Evaluations cover GTEA Gaze+, EPIC-KITCHENS-100, multiple robot embodiments, and metrics for task correctness, executability, state consistency, and learnability.
No heat snapshots are available in the last 24 hours.