论文提出图表问答框架 CURV,将任务重构为多步视觉定位推理,使每一步逻辑推理与动态空间注意力协同;同时构建三级课程数据集 CCQA,从单操作逐步扩展到多图组合任务。摘要称其相对基线最高提升20.50%,在真实基准和域外多模态任务上最高提升12.30%与10.20%。
最近 24 小时暂无可用热度快照。