AnyGroundBench将时空视频定位评测从通用数据集上的静态零样本测试,推进到覆盖动物、工业、体育、手术和公共安全五类专业领域的领域适应评测。该基准包含新采集视频、密集时空标注及训练子集,并测试15个视觉语言模型的零样本泛化与上下文学习能力。结果显示,现有模型在专业场景中仍难以有效适应,暴露出时空推理能力不足。
最近 24 小时暂无可用热度快照。