论文提出Perceive-to-Reason(P2R),将细粒度视觉推理拆分为感知器定位问题相关证据、推理器基于原图与裁剪区域作答两个阶段,并引入仅依赖最终答案监督的PRA-GRPO交替强化学习。在Qwen3-VL-Instruct-2B/4B/8B上,P2R-4B在V-Star、HR-Bench-4K和HR-Bench-8K分别达到93.2%、81.9%和80.5%。
最近 24 小时暂无可用热度快照。