论文提出“掩码边界建模”,通过动态学习亚像素边界表示,并将边界承载 token 作为掩码目标,促进密集视觉 token 学习。基于该框架构建的 LingBot-Vision 在多项视觉任务上表现出效用,并推动 LingBot-Depth 从 1.0 升级至 2.0,改善深度补全与深度估计。
最近 24 小时暂无可用热度快照。