See2Think提出统一评测框架,包含1,200道覆盖12类任务的视觉依赖问题集See2ThinkBench,以及记录文本思考、视觉操作、渲染状态和后续推理的VAoT。对多种闭源与开源模型的评估显示,视觉推理高度依赖模型和环境;忠实渲染是主要瓶颈,相关视觉反馈受破坏时准确率下降超过10个百分点。
最近 24 小时暂无可用热度快照。