HuggingFace 每日论文Qifeng Zhang
GST-Bench:视觉语言模型能否从视频中形成全局空间认知?
原标题:GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?
论文82
GST-Bench面向长时视频中的全局时空推理,基于6790分钟合成视频构建经人工核验的VQA问题,要求模型从未见视角推断空间关系,并将第一人称观察映射到俯视图。论文评测22个VLM,最强零样本得分42.68,明显低于人类79.08;配套的GST-Bench-Local与GST-Train用于定位能力缺口并支持训练。
为什么值得读
具身智能日益依赖长时视频记忆,而42.68对79.08的差距具体揭示了当前VLM难以建立一致全局场景模型。
标签
GST-BenchVLM空间推理视频理解具身智能VQA长时上下文合成数据