论文提出ProVisE(Protocolized Visual Evaluation),让图像生成模型通过指点、标记或绘图表达空间答案,再解析为可与原始指标兼容的结构化预测。作者同时发布包含470个样本、14项空间子任务和4个能力等级的SpatialGen-Bench,并比较文本VLM与图像生成模型的空间能力。
最近 24 小时暂无可用热度快照。