☰
时域网络3-解决复杂背景检测问题YOLOMG: Vision-based Drone-to-Drone Detectionwith Appearance and Pixel-Level Motion
2026/10/11 6:09:02 网站建设 项目流程
YOLOMG: Vision-based Drone-to-Drone Detection with Appearance and Pixel-Level Motion Fusion
原文地址: https://arxiv.org/abs/2503.07115
GitHub:https://github.com/Irisky123/YOLOMG.
这篇文章思想非常好,大道至简。工业界比较喜欢这样的方法,边缘端NPU平台部署非常友好,而且非常灵活,可以和任意的检测模型相结合,文中使用的运动对齐方法-稀疏光流cpu端也非常友好,动静平台都很合适,也非常适合复杂背景。
而且融合一个新特征图的方法可以非常灵活,本文是运动场景,所以用到了motionmap, 如果是其他的任务map可以根据自己的业务需求进行拓展,这个map是有一定的教师能力的。
文中提到的算法缺点之一,“依赖运动特征,悬停或者低速无人机容易漏检;后续网络需要同时兼顾静止与运动无人机;”----其实作者可以补一组消融实验,将掩膜置为0看看是否是这样。
这个算法真正的缺点是弱小目标问题(只有2-3个像素),弱小目标很可能提取不出来掩膜,至少在提取不出来掩膜的时候不要影响检测网络本身的能力也是可以的,在具体的应用场景中还有很大的优化空间。

摘要

基于视觉的无人机对无人机检测,在视觉集群飞行、空中感知规避、恶意无人机侦测等众多任务中有着重要价值,受到越来越多的关注。但现有算法在背景复杂或者目标尺寸极小时,经常出现检测失效。本文提出一种全新的端到端框架,借助运动引导,能够在复杂环境下精准识别小型无人机。该方法首先生成运动差异图,捕捉微型无人机的运动特征;随后通过双模态融合模块,将运动差异图与 RGB 图像相结合,实现针对无人机的自适应特征学习;最后,在 YOLOv5 框架基础上改造得到增强骨干网络与检测头,对融合后的特征图进行处理,输出高精度检测结果。

*一、引言

YOLO 系列、R‑CNN 系列、SSD、DETR 等经典目标检测网络已经被用于无人机检测 [5‑7]。当目标无人机轮廓清晰、在画面中占比较大、背景简单时,这些方法可以取得不错效果。但在复杂场景下,外观特征可靠性下降,算法极易失效。如图 1 (a),背景环境极度复杂时,目标无人机很容易淹没在背景当中;如图 1 (b),距离相机约 100 米的无人机,在 1920×1080 分辨率图像中仅占 10×10 像素。而绝大多数检测网络的下采样与池化操作,会进一步加剧小目标检测的困难。

因此,亟需面向复杂恶劣条件开发高效无人机检测算法。

图 1 无人机对无人机检测的各类难点示意图。(a)背景干扰,无人机和背景难以区分;(b) ARD100 数据集内目标尺寸极小;(c)相机自身运动带来运动模糊。(右侧图片放大 700% 便于观察)

已有部分研究将运动特征或者时序信息引入无人机检测任务,例如背景差分 [8‑12]、时序信息 [13‑14]、光流法 [15‑17]。这类方法虽有一定效果,但针对目标极小、融入城市背景的场景仍不够理想,现存局限如下:

  1. 多数算法仅在 NPS‑Drones、FL‑Drones 数据集上完成测试,在更具挑战性场景下的性能缺少充分验证;
  2. 当相机自身运动时,微型无人机的运动特征很难和背景运动区分开;
  3. 现有算法对全新场景、新型无人机泛化能力不足,而这是实际落地的关键;
  4. 不少方法计算开销过大,难以部署在机载硬件平台。

针对以上问题,本文提出运动引导的目标检测器 YOLOMG,用于极小无人机检测。首先设计运动特征增强模块提取微型无人机像素级运动特征;通过双模态融合模块将运动差异图与 RGB 图像融合,自适应学习无人机特征;最后基于 YOLOv5 搭建轻量化增强骨干网络与检测头,端到端输出检测结果。

本文主要创新点总结:

  1. 构建全新空对空无人机检测数据集 ARD100。在现有同类数据集中,该数据集视频数量最多,目标平均尺寸最小(约占画面 0.01%)。数据集包含城市复杂背景、相机剧烈抖动、低光照、微型无人机等多种挑战,助力无人机检测与跟踪方向研究。
  2. 将像素级运动特征 —— 运动差异图与 RGB 图像结合,实现极小目标检测。ARD100 数据集实验表明,在高难度场景下,本文算法平均精度 AP 相比现有最优算法提升 22%。
  3. 提出一套高效端到端极小无人机检测框架,在 NPS‑Drones 数据集取得当前最优性能;模型推理效率高、泛化性能强,在未参与训练的 Drone‑vs‑Bird 数据集以及低光照场景下,各项指标均优于通用目标检测算法。

二、相关工作

2.2 小目标检测

小目标检测一直是难点,核心问题是目标外观、纹理信息匮乏。现有前沿算法常借助时序、运动特征增强小目标检测能力。文献 [22] 堆叠 5 帧灰度图像生成目标热力图,使用由粗到细两阶段 CNN 完成检测;文献 [16,23] 采用两阶段框架,把图像切分为重叠图像块,尽可能保留小目标外观;文献 [24] 基于 YOLOv5 搭建时空深度学习模型,利用帧序列获取时序上下文;文献 [25] 依靠空中目标与背景运动不一致的线索定位潜在目标;文献 [26] 提出自重建机制,借助差异图增强小目标微弱特征。上述方法在部分小目标场景有效,但尚未在相机存在显著自身运动的无人机对无人机检测任务中得到验证。

*三、本文所提方法

YOLOMG 整体网络结构见图 2,主要由运动特征增强模块 (MFEM)、双模态融合模块 (BFM)两部分组成。

图 2 YOLOMG 算法整体架构。首先运动特征增强模块提取无人机运动差异图;双模态融合模块自适应融合 RGB 特征与运动特征;融合特征送入轻量化 YOLO 骨干网络提取深层特征,经过特征金字塔 FPN 跨层融合;最后送入检测头输出检测结果。

3.1 运动特征增强模块 (MFEM)

部分现有工作使用光流提取无人机运动特征 [16‑17,27],但是当目标极小、背景复杂时,缺少显著特征点,光流容易失效;同时稠密光流网络计算开销大,不适合移动平台。受微型目标检测 [10,26]、视频动作识别 [28‑29] 启发,本文使用像素级差异图构建无人机运动特征。

帧差分法 [30‑31] 是简单有效的运动目标检测技术,利用相邻帧像素变化捕捉运动物体。在时间间隔很短前提下,像素变化大多来自运动物体。参考已有工作 [8,32‑33],本文先通过图像对齐完成帧稳定,再使用改进三帧差分法突出运动目标。

3.2 双模态融合模块 (BFM)

1)融合策略:运动差异图可以给出目标位置引导,但很容易受到干扰:行驶车辆、行人、飞鸟,还有图像对齐错误都会产生伪运动信号。虽然这些干扰物在运动差异图上和无人机十分相似,但是它们在 RGB 图像上外观特征差异明显。因此可以利用 RGB 的外观特征区分无人机与干扰。

借鉴多模态融合检测思路 [30,35‑37],将运动差异图与 RGB 图像视为无人机的两种模态。为保持模型轻量化,采用特征级融合策略。RGB 图像与运动差异图输入双模态融合模块,得到融合特征图;再送入骨干网络下采样,经过 FPN 跨层融合,最后输入检测头输出检测结果。

2)网络结构:YOLOMG 一共 35 层网络,整体下采样倍率为 16 倍。骨干网络在 YOLOv5s 基础上扩展改造,减少通道数提升推理速度。 针对小目标检测,在 Neck 部分增加小目标检测层:将最后一层特征图上采样,与骨干网络对应分辨率特征图拼接后送入检测头,最终拥有 4 个检测分支。FPN 在上采样过程融合深浅层特征,生成高分辨率、强语义特征图。对比原始 YOLOv5s,本文网络更加轻量化,专门针对小目标检测做优化。

3)双模态自适应融合:普通卷积前向传播时,所有特征权重均等。但双模态输入场景中,经常出现某一模态质量高、另一模态质量差的情况。例如背景极度复杂时,RGB 图像很难区分无人机,而运动差异图仍然可以提供清晰运动信息。

本文采用与文献 [35‑36] 类似的自适应融合策略,由自适应权重块、通道‑空间注意力模块 CBAM 两部分构成(见图 2 右下角)。RGB 特征图与运动特征图先经过自适应权重块,生成初始权重与混合特征图;混合特征送入 CBAM 卷积块注意力模块,生成通道权重,输出最终融合特征图。借助 CBAM,网络可以自动给质量更高的输入特征分配更大权重。

四、实验

4.1 数据集

本文在自建 ARD100 数据集与公开 NPS‑Drones 数据集上开展算法评估。

ARD100 数据集:一共 100 段视频,总计 202467 帧;使用大疆 Mavic2、M300 相机在中低空采集。数据集包含大量真实场景挑战:复杂背景、强光弱光、相机剧烈抖动、无人机高速飞行、目标尺寸极小。视频帧率 30FPS,分辨率 1920×1080。 划分:65 段视频作为训练集,35 段视频作为测试集;测试集包含训练集未出现的场景、弱光强光片段,验证模型泛化能力与鲁棒性。该数据集中大量目标尺寸小于 12×12 像素,在现有无人机对无人机检测数据集当中,视频数量最多,目标平均尺寸最小。

NPS‑Drones 数据集 [8]:50 段定制三角翼无人机视频,合计 70250 帧;机载 GoPro3 相机拍摄,分辨率 1920×1280 或 1280×960。目标尺寸分布 10×8 ~ 65×21 像素,目标平均占画面 0.05%。本文使用文献 [16] 发布的干净标注;按照文献 [16] 划分方式,前 40 段视频用于训练验证,剩余 10 段做测试。

4.2 评价指标与实验设置

1)评价指标:遵循相关工作 [14,16],采用精确率 Precision、召回率 Recall、平均精度 AP;IOU 阈值设置为 0.5,预测框与真值框 IOU≥0.5 记为真正例;单 GPU 下每秒帧数 FPS 衡量推理速度。

2)实现细节:实验硬件为 NVIDIA RTX 2080Ti;优化器 Adam,动量 0.937,初始学习率 0.01;训练轮数 100 epoch,batch size=8;使用 MS COCO 预训练 YOLOv5s 权重初始化。

4.3 对比现有 SOTA 算法

对比算法包含单阶段检测器、两阶段检测器、视频目标检测算法、小目标检测专用算法 [14,16,23]。为尽可能保留小目标外观特征,大部分对比算法训练测试输入尺寸 1280×1280。CFINet、Dogfight 训练时图像分别切分为 3×2、3×3 重叠图像块。所有对比方法均使用官方公开代码,加载公开预训练权重微调。

ARD100 数据集定量结果如表 2。本文算法各项指标均优于现有方法;ARD100 上 AP 相较最优对比算法提升 21 个百分点。值得注意,YOLOMG 输入尺寸仅 640×640,性能已经超过全部输入 1280×1280 的对比算法;640 输入推理速度和 YOLOv5 接近,具备机载部署潜力。对比基线 YOLOv5s 可以看出,引入运动特征显著提升小目标检测能力。YOLOMG 具备即插即用特性,可以适配后续 YOLO 系列新版本。

在 NPS‑Drones 数据集上,YOLOMG 取得与当前最优算法持平的最高 AP。

可视化对比见图 6。在复杂背景、目标极小时,对比算法漏检或者输出不准确边界框,YOLOMG 可以实现精准检测。更多测试结果见补充视频。

4.4 消融实验

运动差异图消融:在 ARD100(输入 640×640)上测试不同差分方式、帧间隔 k。三帧差分优于两帧差分;k=2 效果优于 k=1;但是帧间隔进一步增大,精度反而下降。原因:更大帧间隔会放大运动特征,但同时引入更多噪声。只用两张 RGB 图作为输入对比实验可以看出,运动差异图能够大幅提升小目标检测性能。这里可以补充一组掩膜全0的效果,就可以看出来本文方法到底适不适合静平台或静目标。

NPS‑Drones 数据集(输入 1280)也得到同样结论:三帧差分效果优于两帧差分,步长为 2 最优;步长继续增加性能回落。

小目标检测层消融:去掉小目标检测层,ARD100 数据集 AP 下降 2 个百分点,证明该模块有效。

泛化性测试:使用 ARD100 训练好的模型直接在 Drone‑vs‑Bird 数据集测试(无人机种类、场景均未见过);另外,训练集剔除夜间低光样本,在夜间数据上测试低光照泛化性能。结果见表 5,YOLOMG 的召回率与整体 AP 明显优于通用检测器。

失败案例分析:本算法依靠运动特征做引导,悬停、低速运动无人机偶尔漏检;极小目标外观信息极少,部分和远距离无人机外观相似的物体会产生误检。

五、讨论

本文借助运动特征解决复杂背景下极小无人机检测问题,性能与泛化能力优于现有 SOTA。原因主要两点:

  1. 运动差异图专门提取无人机运动特征,当目标极小、背景复杂时,补充大量有效信息;仅依靠外观的检测器在此条件下表现很差。其他引入运动信息的方法,针对极小目标提取的运动、时序特征不足。
  2. 运动差异图不依赖目标类别,在不同无人机、不同环境下具备域不变特性,泛化能力优于纯外观的通用检测器。

同时算法仍存在局限,未来有待改进:

  1. 依赖运动特征,悬停或者低速无人机容易漏检;后续网络需要同时兼顾静止与运动无人机;
  2. 引入运动差异图带来额外计算开销,需要进一步优化计算效率。

————————————————
版权声明:本文为CSDN博主「Eva_Hua」的原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接及本声明。
原文链接:https://blog.csdn.net/whatwho_518/article/details/160376341

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询