阅读原文
arXiv 预印本Peiyan Li论文86

BridgeVLA++:面向三维操作的数据高效、可泛化记忆增强视觉语言动作框架

原标题:BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation

利用预训练视觉语言模型(VLM)构建视觉语言动作(VLA)模型,已成为实现三维机器人操作的一种有前景的范式。然而,现有的三维 VLA 方法仍然高度依赖数据,在分布偏移下表现出有限的泛化能力,并且缺乏对过去观测的显式记忆。这些局限阻碍了其在数据稀缺、开放世界以及依赖记忆的操作场景中的应用。我们此前的工作 BridgeVLA 在三维动作学习过程中保留预训练 VLM 的输入输出对齐关系,从而提升了数据效率和泛化能力:将原始点云投影为多视角图像,并在生成机器人动作之前预测中间热力图。在本文中,我们通过为 BridgeVLA 配备统一的时空记忆架构,建模持续的空间上下文和时间交互历史,进一步开发了 BridgeVLA++。这一融合记忆的框架能够在保留 BridgeVLA 数据效率和泛化能力的同时,对观测历史进行推理。大量实验表明,我们的框架在空间操作任务上取得了优异性能,并展现出稳健的泛化能力。在不牺牲原始 BridgeVLA 数据效率和泛化能力的前提下,BridgeVLA++ 还在两个具有挑战性的依赖记忆的操作基准上取得了当前最佳性能。此外,BridgeVLA++ 在双臂操作场景中也表现出良好效果,并在另一种真实世界机器人平台上得到验证,展现出其跨任务、跨环境和跨机器人平台的可扩展性。这些结果表明,BridgeVLA++ 是一个统一的三维视觉语言动作框架,能够同时支持高数据效率的学习、稳健的泛化能力以及有效的记忆感知机器人操作。项目网站:https://bridgevla-plus.github.io/。

为什么值得读

三维VLA正从单步感知转向依赖历史的持续操作,这项工作把时空记忆、数据效率和跨平台验证放进同一框架,值得及时跟踪。

标签

BridgeVLA++VLA3D manipulationroboticsspatio-temporal memorydata efficiencybimanual manipulation