GST-Bench面向长时视频中的全局时空推理,基于6790分钟合成视频构建经人工核验的VQA问题,要求模型从未见视角推断空间关系,并将第一人称观察映射到俯视图。论文评测22个VLM,最强零样本得分42.68,明显低于人类79.08;配套的GST-Bench-Local与GST-Train用于定位能力缺口并支持训练。
最近 24 小时暂无可用热度快照。