SceneActBench提出一个统一的智能体—环境评测框架,测试视觉语言模型在完整、多物体三维场景中的视觉条件行动能力。基准包含5类任务、210个源实例和520个任务案例,并以隐藏真值和任务专属几何指标评分。11种专有VLM配置的总体得分仅为38.6至50.2,且没有配置能在各任务上稳定表现。
最近 24 小时暂无可用热度快照。