Play2Perfect提出先让多指机器人在多样物体和目标上进行任务无关的强化学习“玩耍”,学习抓取、手内重定向和位姿到达等可复用操作先验,再针对精密装配微调。研究系统比较物体多样性、训练目标、轨迹多样性和目标精度,称其相较从零开始强化学习提升33倍样本效率,并在仿真到现实中实现0.5毫米间隙紧插60%成功率。
最近 24 小时暂无可用热度快照。