论文提出将信号时序逻辑(STL)用于四足机器人步态约束,把安全边界、腿部同步、速度指令跟踪和执行器限制转化为连续奖励。研究在Google Barkour机器人与MuJoCo XLA上实现行走-小跑、小跑和奔跑三类步态,并结合PPO、并行仿真和域随机化;摘要称其相较手工奖励具有更紧的速度跟踪和更稳定的训练。
最近 24 小时暂无可用热度快照。