论文指出,自动驾驶VLA模型的CoT标注若提前向教师模型展示真实未来轨迹,会产生轨迹锚定偏差,使模型事后合理化结果并加剧因果幻觉。作者提出AD-MCQ和DEFT-RLVR,将轨迹选择与决策后验证分离,以提升推理可验证性。
最近 24 小时暂无可用热度快照。