arXiv 预印本Samer Abualhanud
CrossDepth:面向环视多相机深度估计的几何约束注意力机制
原标题:CrossDepth: Geometry-Constrained Attention for Generalizable Multi-View Surround Depth Estimation
论文75
对周围环境的可靠三维理解是自动驾驶的核心要求。多视角环视相机系统提供了广泛的场景覆盖,但空间相邻图像之间的重叠通常极小。因此,大多数像素的深度必须依赖单目外观线索来推导。这些线索在不同图像之间可能会呈现出差异,从而可能被深度估计模型做出不同的解读。我们针对跨图像不一致性的两个主要来源开展研究:相机内参的差异以及每张图像有限的感受野。针对前者,我们引入逐像素的相机感知光线嵌入(ray embeddings)对特征进行条件化调制,使网络能够顾及单目线索中因相机而异的变化。针对后者,我们基于标定好的相机系统推导出几何合理区域,并通过约束在这些区域内的跨图像注意力机制,将每个像素的上下文扩展到自身图像之外。该模型基于光度一致性以完全自监督的方式进行训练。在 DDAD 和 nuScenes 上的评估表明,在域内和跨域评估中,本方法相较于最先进的自监督方法均提升了整体深度精度和跨图像深度一致性。代码可在 https://abualhanud.github.io/CrossDepthPage/ 获取。
为什么值得读
针对车载环视相机重叠率低导致的跨视角深度撕裂问题,提出免监督且可泛化的几何先验解法。
标签
Computer VisionAutonomous DrivingDepth EstimationSelf-Supervised LearningMulti-ViewCrossDepthnuScenes