See2Think:多模态模型真的会使用中间视觉状态吗?
原标题:See2Think: Do Multimodal Models Really Use Intermediate Visual States?
AI 导读
See2Think提出统一评测框架,包含1,200道覆盖12类任务的视觉依赖问题集See2ThinkBench,以及记录文本思考、视觉操作、渲染状态和后续推理的VAoT。对多种闭源与开源模型的评估显示,视觉推理高度依赖模型和环境;忠实渲染是主要瓶颈,相关视觉反馈受破坏时准确率下降超过10个百分点。
为什么值得读
视觉草图和工具调用正成为多模态推理标准组件,这项研究用受控反馈破坏实验检验模型是否真的依赖它们。
深度解读
发生了什么
原始事实: 论文提出See2Think框架,由See2ThinkBench和Visual Action-of-Thought(VAoT)组成,用于评估模型是否生成并使用中间视觉状态,而不只比较最终答案。
核心技术
原始事实: See2ThinkBench包含1,200道开放式、视觉依赖问题,覆盖12类任务,涉及二维结构、三维场景和真实世界推理。VAoT记录文本思考、视觉动作、渲染状态及后续推理,并设置四种受控推理环境。
关键证据与数字
原始事实: 对代表性闭源和开源多模态模型的评估显示,没有一种环境在所有任务上持续占优。模型通常能选择相关视觉操作,但忠实渲染是最明显的瓶颈;反馈利用率较高也不必然带来准确率提升。在任务相关的反馈破坏干预中,准确率下降超过10个百分点。
为什么重要
分析: 结果把“模型会不会画图或调用视觉工具”与“模型是否真正依赖生成结果”区分开来。对视觉中间状态的因果式干预,比仅观察最终答案或操作轨迹更接近对推理过程的诊断。
实际影响
分析: 评测多模态Agent时,应同时记录动作、渲染结果和后续反馈使用情况,并加入有针对性的状态破坏测试。工程上,提升图形、标注或场景渲染的保真度,可能比单纯增加视觉操作数量更有效。
局限与不确定性
原始事实: 摘要未给出完整模型名单、各任务类别的分项结果、四种环境的具体定义或统计显著性信息。分析: “依赖视觉状态”仍可能混合了提示结构、工具接口和模型先验等因素;超过10个百分点的总体或局部下降范围需要查阅论文正文确认。未验证推断: 基准上的行为依赖不等于模型形成了可解释、稳定的内部视觉工作空间。
原始来源
- arXiv:2607.26769
- 来源标注:hf-papers
- 发表时间:2026-07-31