论文提出Act2Answer协议,将VLM知识问答改造成桌面机器人中的单步物体放置任务,用动作选择答案,减少低层控制对知识评估的干扰。对7个VLA和9个VLM基线的大规模研究显示,VLA能保留简单概念,但在更丰富语义类别上相较源VLM出现更大差距;VQA联合训练与更好的知识保留相关,答案信号主要位于中间层。
最近 24 小时暂无可用热度快照。