论文提出ActiveVision基准,用17项任务、3类场景测量多模态大模型是否能根据中间假设反复调整视觉观察,而非只看一次图像。评测中,GPT-5.5最高仅解决10.6%项目,17项任务有11项得分为零;Claude Fable 5仅3.5%,三名人类参与者平均达96.1%。即使允许模型编写并运行视觉代码,差距仍大幅存在。
最近 24 小时暂无可用热度快照。