Pıer
潮声潮汐灯火船坞漂瓶岸
Pıer

导航

  • 潮声
  • 岸
  • 灯火
  • Agent 接入
  • 更新日志
  • 漂瓶
  • 现在
  • 反馈

外部链接

GitHubCloudborne 独立站 ↗

© 2026 Pier.

阅读原文
arXiv 预印本·Zhenxuan Fan·2026年9月4日 16:19

RoboSPA:评估视觉-语言-动作模型在复杂空间与长程规划中的具身推理能力

原标题:RoboSPA: Can VLA Models Go Beyond Simple Scenes and Short-Horizon Tasks?

论文78

视觉-语言-动作(VLA)模型在语言引导的机器人操作中展现出令人鼓舞的进展。然而,现有的数据集和基准主要在预定义设置下评估任务完成情况,难以深入洞察模型在空间和流程复杂度不断增加时的推理能力。我们提出了 \textbf{RoboSPA}(\textbf{Robo}t \textbf{S}patial-\textbf{P}rocedural \textbf{A}ssessment),这是一个用于诊断 VLA 模型具身推理能力的大规模机器人操作数据集和基准。\texttt{RoboSPA} 聚焦于两个核心维度:细粒度空间推理与长时程流程规划,涵盖 10 个任务类别和 56 个基础任务。每个任务在五个难度级别上进行实例化,共衍生出 280 个具有递增空间歧义性和流程复杂度的变体。我们在多种具身形态和多样化场景下采集了 52.7 万条轨迹。除了二元成功率之外,\texttt{RoboSPA} 还引入了诊断性评估指标以进行更详尽的评估。在代表性 VLA 模型上的实验表明,当前系统在应对复杂的空间关系、精确的底层执行以及记忆密集型规划方面仍然面临挑战。这些结果确立了 \texttt{RoboSPA} 作为一个极具挑战性的诊断基准,有助于开发能力更强、更可靠且泛化性更好的具身智能体。我们的数据和代码可在 https://github.com/fanzhenxuan/RoboSPA 获取。

为什么值得读

用细分梯度的诊断指标替代笼统的成败率,清晰揭示了具身模型在精细操作与长程记忆上的真实短板。

标签

RoboticsVLAEmbodied AIBenchmarkManipulationDatasetComputer Vision

评分依据

  • 新颖性76
  • 影响力78
  • 实践价值82
  • 可信度80
  • 时效性75