通过延迟暴露未来轨迹,实现可验证的自动驾驶视觉语言模型推理
原标题:Deferred Exposure of Future Trajectories for Verifiable Reasoning in Autonomous Driving VLMs
AI 导读
论文指出,自动驾驶VLA模型的CoT标注若提前向教师模型展示真实未来轨迹,会产生轨迹锚定偏差,使模型事后合理化结果并加剧因果幻觉。作者提出AD-MCQ和DEFT-RLVR,将轨迹选择与决策后验证分离,以提升推理可验证性。
为什么值得读
自动驾驶CoT监督正快速普及,本文揭示了真实轨迹泄露这一容易被忽视的标注捷径,并给出可验证的替代训练范式。
深度解读
发生了什么
【原始事实】论文研究自动驾驶视觉语言动作模型中的链式思考监督,指出常见标注流程会让教师模型在生成推理时提前看到日志中的真实未来轨迹。作者提出AD-MCQ与DEFT-RLVR,分别用于候选轨迹选择和决策后的轨迹验证。
核心技术
【原始事实】AD-MCQ将规划转化为在显式候选轨迹中的选择,避免同时生成高层决策、精确几何轨迹和低层动力学。DEFT-RLVR则延迟未来轨迹的暴露,使其从决策前的锚点变成决策后的验证目标。
关键证据与数字
【原始事实】摘要报告,暴露真实轨迹会导致轨迹锚定偏差、因果不忠实的CoT和更严重的幻觉,且在因果挑战场景中更明显。摘要未提供具体数据集、样本规模、指标数值或提升百分比,因此不能据此量化收益。
为什么重要
【分析】如果训练推理文本已经包含结果信息,CoT可能看似解释充分,实际却没有反映模型从场景证据作出决策的过程。延迟监督为区分“先决策后验证”和“看到答案后解释”提供了更清晰的实验接口。
实际影响
【分析】AD-MCQ可用于构建难度可控、可扩展的规划评测集;候选轨迹的构造方式也能控制决策歧义和几何难度。DEFT-RLVR可能适合强化学习或可验证奖励流程,但实际部署仍需结合闭环仿真、控制约束和安全评估。
局限与不确定性
【原始事实】提供的信息没有说明候选轨迹如何生成、奖励如何定义、使用了哪些基座VLM或自动驾驶数据集,也没有展示泛化和闭环驾驶结果。【未验证推断】若候选集合本身遗漏安全动作,模型可能只能在受限选项中做出“正确”选择;该风险需要原文实验进一步确认。
原始来源
- arXiv:2608.01755
- 来源标注:hf-papers
- 提供发布时间:2026-08-04