GORDON提出一种从无动作视频示范中学习稠密奖励的方法:将场景表示为物体与空间关系图,用自监督图神经网络学习任务进度表征,并通过活动感知池化抑制机器人运动干扰。奖励轨迹可揭示阶段性物体状态转换,自动发现子任务;在MAGICAL和ManiSkill3的7项操作任务中,长时程任务平均成功率达74.4%。
最近 24 小时暂无可用热度快照。