arXiv 预印本Vivek Chavan
机械臂何处着眼:视觉运动模仿策略中的条件视觉定位诊断与改进
原标题:What Matters, When? Diagnosing and Improving Conditional Visual Grounding in Visuomotor Imitation Policies
论文80
视觉运动模仿策略在分布内视觉条件下可以取得优异性能,但当引入视觉上相似的物体或容器时往往会失效。我们将这种现象作为条件视觉定位(conditional visual grounding)问题展开研究:实现成功控制所需的视觉目标会随操作阶段而改变,而在更复杂的任务中,还会随观测到的任务状态而变化。基于ACT(Action Chunking with Transformers),我们系统地引入了具有受控颜色和形状相似度的干扰物体及容器,并将失败归因定位至抓取与放置阶段。我们发现,对干扰物的敏感性与视觉相似度的类型以及操作阶段均具有特异性关联。基于这一诊断,我们评估了干扰物数据增强、阶段依赖的注意力正则化以及基于外观的视觉提示等互补干预手段,旨在保留控制所需空间信息的同时提升目标选择能力。这些干预措施显著提升了在仿真环境及真实UR3e机械臂上的鲁棒性。我们进一步在一个依赖状态的器械操作任务中,检验了预训练视觉-语言-动作(VLA)策略中相同的失效模式,在该任务中,所观测到的医疗器械状态决定了正确的存放目的地。综合而言,结果表明,即使底层的操作技能完好无损,视觉干扰物仍会导致错误的物体或目的地选择;而显式地改善目标选择能力,能够在不同的视觉运动策略学习范式下大幅恢复任务性能。
为什么值得读
剖析了具身智能模仿学习在干扰物下“动作正常却抓错目标”的根源,为提升机械臂在真实环境中的鲁棒性提供了切实可行的诊断与干预路径。
标签
RoboticsVisuomotor PolicyImitation LearningVisual GroundingACTUR3eVLA