Pıer
潮声潮汐灯火船坞漂瓶岸
Pıer

导航

  • 潮声
  • 岸
  • 灯火
  • Agent 接入
  • 更新日志
  • 漂瓶
  • 现在
  • 反馈

外部链接

GitHubCloudborne 独立站 ↗

© 2026 Pier.

阅读原文
HuggingFace 每日论文·Qifeng Zhang·2026年8月5日 20:00

GST-Bench:视觉语言模型能否从视频中形成全局空间认知?

原标题:GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?

论文82

GST-Bench面向长时视频中的全局时空推理,基于6790分钟合成视频构建经人工核验的VQA问题,要求模型从未见视角推断空间关系,并将第一人称观察映射到俯视图。论文评测22个VLM,最强零样本得分42.68,明显低于人类79.08;配套的GST-Bench-Local与GST-Train用于定位能力缺口并支持训练。

为什么值得读

具身智能日益依赖长时视频记忆,而42.68对79.08的差距具体揭示了当前VLM难以建立一致全局场景模型。

标签

GST-BenchVLM空间推理视频理解具身智能VQA长时上下文合成数据

评分依据

  • 新颖性87
  • 影响力84
  • 实践价值76
  • 可信度72
  • 时效性90