LiftFeat:3D 几何感知的局部特征匹配新颖网络 (ICRA‘25)
2026/9/15 22:59:49 网站建设 项目流程

1. 极端条件的匹配

图像间的局部特征匹配是许多机器人核心任务的关键,例如运动恢复结构 (SfM)、同步定位与建图 (SLAM) 和视觉定位。然而,在实际应用中,某些场景存在极端条件,例如光照剧烈变化、低纹理区域或重复纹理模式。在这些情况下,实现可靠的特征匹配仍然是一个具有挑战性的任务。

传统的局部特征匹配方法通常包含三个步骤:关键点检测、描述符提取和特征匹配。早期的SIFT和SURF等方法提出了精心设计的手工描述符,并在匹配阶段采用最近邻搜索来获取匹配结果。近年来,基于深度学习的特征匹配方法显著提升了性能。一些研究联合训练关键点预测和描述符提取,不仅提高了处理速度,还进一步优化了匹配性能。此外,其他研究引入了图神经网络 (GNN),将特征匹配任务建模为最优传输问题,从而有效提高了匹配精度。

尽管现有方法在大多数场景中表现优异,但在极端条件下(如光照剧烈变化、低纹理或重复纹理),仅依赖2D视觉线索可能导致特征匹配的混淆。例如,在低纹理场景中,视觉信息缺乏足够的区分性。一个直观的思路是利用3D数据提供的额外信息来增强特征匹配的鲁棒性。然而,3D数据的精度和计算成本带来了新的挑战,特别是在计算资源受限的机器人应用中。

本文介绍一种轻量级模型LiftFeat[1],融合2D和3D信息进行局部特征匹配。深度图是最易获取的3D信息之一,但由于其尺度模糊性,直接用于局部特征匹配并不合适。相比之下,表面法线 (Surface Normal) 具有平移和尺度不变性,更适合特征匹配。因此,我们在网络中引入了一个表面法线估计头,用于学习3D几何知识。值得注意的是,伪表面法线标签由Depth Anything v2预测的深度图生成,无需额外的标注成本。随后,我们提出3D几何感知的特征增强模块 (3D-GFL),将原始2D描述符与3D法线特征融合,从而提升2D描述符在挑战性场景中的区分能力。实验结果表明,我们的方法LiftFeat在多个任务(相对位姿估计、单应性估计和视觉定位)上均达到了最先进的性能。

项目链接:https://github.com/lyp-deeplearning/LiftFeat

主要贡献

  • 提出了一种轻量级网络LiftFeat,创新性地引入3D几何信息进行局部特征匹配。

  • 设计了3D-GFL模块,融合2D描述符与3D法线特征,显著提升了2D描述符在极端条件下的区分能力。

  • 实验证明,我们的方法在多种任务和场景下均具有高精度和鲁棒性,并且在边缘设备上的推理延迟仅为7.4毫秒。

2. 具体方法

为了克服极端场景下图像特征匹配的局限性,我们提出了一种利用深度图提取的表面法线信息来增强描述符匹配的新方法。本节首先介绍所提出的LiftFeat网络架构,然后阐述如何利用单目深度估计模型的先验知识监督表面法线学习,接着详细介绍融合表面法线信息与原始2D描述符的3D几何感知特征增强模块 (3D-GFL),最后说明网络训练细节。

2.1. 网络架构

如图2所示,为了在精度和速度之间取得更好平衡,我们设计了一个包含共享特征编码模块和多个任务专用头的网络架构。

2.1.1. 特征编码

设输入图像,其中W和H分别表示图像的宽度和高度。在特征编码模块中,我们采用5个块进行特征提取。所有块均由3×3卷积层和步长为2的最大池化层组成。Block5输出的特征图空间分辨率为。各块输出的特征图深度逐级增加,5个块的输出深度分别为{4,8,16,32,64}。随后,融合块对低级特征进行多尺度特征融合。我们使用1×1卷积和双线性插值对齐并求和Block3、Block4和Block5的特征,得到尺寸为的融合特征图。

2.1.2. 多任务头

我们的多任务头用于预测关键点、描述符和表面法线。关键点分支采用类似SuperPoint的策略,应用1×1卷积生成尺寸为的关键点图,然后进行通道级softmax操作得到原始图像分辨率的关键点分数分布。描述符分支使用双线性插值和L2归一化操作获得尺寸为的描述符图。同样,法线头使用双线性插值获得与原始图像相同分辨率的3通道图。

2.1.3. 3D几何感知特征增强模块

基于关键点信息,我们对描述符和法线特征进行采样,然后输入3D-GFL模块以增强提取的特征。

假设关键点分支通过非极大值抑制 (NMS) 预测关键点。我们执行网格采样操作提取对应的描述符和法线向量特征。接着,我们通过添加多层感知机 (MLP) 层对齐它们的特征维度,然后对对齐后的特征求和。最后,我们应用堆叠的自注意力层获得增强后的描述符

2.2. 3D几何知识监督

表面法线描述了表面上点的朝向,是一种具有平移和尺度不变性的3D信号。在训练阶段,我们使用单目深度估计模型 Depth Anything v2 生成表面法线的监督标签。虽然单目深度估计本身存在尺度模糊性问题,但将深度信息转换为表面法线可以有效缓解这个问题。这种转换通过提供对尺度和平移具有不变性的鲁棒几何线索,提升了特征匹配性能。

给定输入图像1,使用深度估计模型生成对应的深度图。对于图像中的像素 P(u,v),其法线向量可以基于局部梯度信息估计。设为该点的深度值,u和v方向的深度梯度可通过有限差分近似计算

利用这些深度梯度,我们可以估计点 P(u, v) 的法线向量。假设该点的3D坐标为,则法线向量可计算为:

其中分母表示向量的大小,确保法线向量被归一化。法线向量提供了点 P(u, v) 处局部表面朝向的信息,反映了物体的3D几何结构。

2.3. 3D几何感知特征增强

我们使用特征聚合模块将关键点的2D描述符与3D表面法线信息融合。具体来说,对于坐标为的每个关键点,我们使用网格采样操作提取对应的局部特征描述符和预测的表面法线向量。由于描述符和法线向量的维度不同,我们使用独立的多层感知机 (MLP) 层对齐特征维度并执行加法运算。然后,我们使用位置编码 (PE) 将关键点位置信息整合到描述符特征中,得到混合信息。计算过程如下:

我们使用堆叠的自注意力模块实现不同点之间特征信息的交互和聚合。我们使用线性transformer层构建自注意力模块,这也能提升模型的推理速度。对于第 (n+1) 层,第 i 个关键点对应的特征由第 n 层的原始特征和集合P中所有其他关键点的特征聚合得到:

其中表示集合P中某点的特征,表示线性映射层。实验中我们使用3个自注意力层。

2.4. 网络训练

我们使用来自合成数据或Megadepth数据集的成对图像的像素级匹配标签来监督网络训练。给定输入图像对,我们计算三种损失:关键点预测损失、表面法线估计损失和描述符损失

  • 关键点损失:对于关键点监督,我们采用与SuperPoint相同的策略。关键点logits图的原始输出尺寸为,其中最后一个通道表示"无关键点"。我们使用ALIKE检测器的输出作为真实关键点标签。关键点损失通过对关键点logits图应用负对数似然 (NLL) 损失计算得到。
  • 法线损失:法线向量估计损失用于确保准确的表面朝向预测。对于每个预测的法线向量,我们使用余弦相似度将其与真实法线向量进行比较,确保预测法线与真实表面法线对齐。法线损失定义为

其中分别是预测和真实的法线向量。

  • 描述符损失:给定从图像采样的描述符,我们将其输入特征融合模块得到描述符。接着计算相似度得分矩阵。真实匹配矩阵记为。我们最小化预测匹配得分矩阵S相对于真实匹配矩阵的负对数似然:
  • 总损失:训练的总损失是这三个分量的加权和:

其中是平衡关键点损失、法线损失和描述符损失贡献的权重因子。本实验中,我们经验性地设,

3. 实验效果

4. 总结一下

LiftFeat是一种新颖的轻量级网络,用于3D几何感知的局部特征匹配。我们通过学习表面法线来编码3D几何特征,利用Depth Anything模型估计深度图并从中推导伪表面法线作为监督信号。所提出的LiftFeat方法将学习到的表面法线3D几何特征与原始2D描述符有效聚合,从而提升了视觉特征的区分能力,尤其在光照变化显著、低纹理或重复纹理等极端场景中表现优异。通过在三个任务(相对位姿估计、单应性估计和视觉定位)上的验证,LiftFeat的性能优于部分轻量级前沿方法。

参考文献

LiftFeat: 3D Geometry-Aware Local Feature Matching

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询