该论文研究视觉语言动作(VLA)模型在机器人微调后语义结构退化的问题,提出将动作表征锚定到语义流形,并拆分为共享语义通道与私有通道。锚定模块仅训练时使用,推理阶段不改变部署模型;在仿真和真实机器人基准上,最高带来18.7%的真实场景同分布提升与21.5%的分布外泛化提升。
最近 24 小时暂无可用热度快照。