论文发现,未接受共同可见性监督的 VGGT 内部已形成相关表征:早期层构建三维场景表示,后期层负责推理图像对是否共享可见表面,并定位到稳定的负锚点层 L17。作者据此提出 Co-VGGT,仅训练少于 750 万参数的分层混合专家头,在 Co-VisiON 上超过人工标注基线,配对任务 ECE 为 0.030。
最近 24 小时暂无可用热度快照。