arXiv 预印本Ao Shen
H2INT:面向密集不确定人群导航的交互式强化学习框架
原标题:Human-Human & Human-Robot Interaction Transformer (H2INT) for Robot Navigation in Dense and Uncertain Crowds
论文78
在密集人群中实现机器人的安全导航,需要对行人运动及其随机器人做出的反应变化进行推理。然而,许多基于学习的方法在生成行人运动时独立于机器人,或假设存在均一的互惠性,从而忽略了交互不确定性的一个重要来源。本文提出了人-人与人-机交互 Transformer(H2INT),这是一个强化学习框架,它在策略学习过程中保留了行人运动受机器人影响的变化,同时允许不同行人的响应度存在差异。当机器人可见时,响应度会影响人群动态,但它并不作为策略输入提供;相反,策略必须从以机器人为中心的相对位置中推断其影响。一个两阶段门控 Transformer 逐步对人-人与人-机关系进行编码,而循环策略则捕获其时序演变。课程机制通过逐步降低行人的响应度来增加交互难度。仿真实验表明,在各种响应条件和人群密度下,该方法相比代表性基线模型均展现出更高的导航安全性和鲁棒性,并且无需重新训练即可迁移至结构截然不同的人流布局中。消融实验验证了分层关系编码和门控更新的有效性。真实机器人部署进一步验证了所学策略能够在物理环境中使用稀疏观测有效运行。
为什么值得读
摒弃了行人均匀避让机器人的理想假设,通过分层关系编码与隐式推断为人机共存的移动导航提供了务实的解决方案。
标签
RoboticsReinforcement LearningCrowd NavigationTransformersHRIAutonomous Systems