本文基于YOLOv13 官方仓库(iMoonLab/yolov13,ultralytics 8.3.63 fork)实测整理,Windows/CPU 全程可跑。非局部注意力的 (HW)² 矩阵一步到位但太贵;A2(Double Attention Network,Chen et al., NeurIPS 2018)拆成两步:先用 B 的空间相似度把特征"聚合"成 c_m×c_n 的全局描述子(bmm,与 HW 无关),再用 V 的相似度把描述子"分发"回每个位置——两步都是 bmm/matmul,复杂度 O(HW·c) 而非 O((HW)²)。本文把它插入 v13n 主干层 6 之后(128 通道 @40×40 的 P4 尺度),实测仅 +16,608 参数、GFLOPs 6.5→6.59,与标准实现逐位一致,3 轮冒烟训练正常收敛。
前言
注意力机制篇的"插入式"玩法(层 6 之后插入、层号全量顺移)。A2 出自论文《Double Attention Network for Scene Understanding》——它的洞察是:非局部注意力的本质是"聚合全局、再分发回各处",这两个动作可以解耦成两次矩阵乘,中间的中介是 c_n 个"可学习的语义槽"(类似后来 ExternalAttention 的记忆单元思想,A2 早了三年)。插入点选在层 6 之后:A2C2f 输出的 P4 特征(128 通道 @40×40),1600 个位置的两步 bmm 在这里几乎免费。所有数据均在 v13n 上实测。