论文指出,机器人行为克隆微调会逐步覆盖预训练视觉语言模型中支持视觉与语义泛化的表示,网页图文协同训练也无法解决语言与动作错位。作者提出Anchor-Align,用冻结VLM进行逐层表示蒸馏,并将动作目标转为离散运动方向标签,在同一机器人观测上联合训练语言和动作。实体xArm7实验中,两种VLA架构成功率分别由28%升至54%、37%升至60%。
最近 24 小时暂无可用热度快照。