Swin Transformer:使用移位窗口的层次化视觉Transformer
作者
Ze Liu¹²†, Yutong Lin¹³†, Yue Cao¹*, Han Hu¹*‡, Yixuan Wei¹⁴†, Zheng Zhang¹, Stephen Lin¹, Baining Guo¹
¹微软亚洲研究院
²中国科学技术大学
³西安交通大学
⁴清华大学
{v-zeliu1, v-yutlin, yuecao, hanhu, v-yixwe, zhez, stevelin, bainguo}@microsoft.com
†实习生于微软亚洲研究院
‡联系人
*平等贡献
摘要
本文提出了一种新的视觉Transformer,称为Swin Transformer,它能够作为计算机视觉的通用骨干网络。从语言领域到视觉领域的Transformer适配面临诸多挑战,这些挑战源于两个领域之间的差异,例如视觉实体的尺度变化较大,以及图像中像素分辨率远高于文本中的单词。为了解决这些问题,我们提出了一个层次化的Transformer,其表示通过移位窗口(Shifted Windows)计算。移位窗口方案通过将自注意力(Self-Attention)计算限制在非重叠的局部窗口内提高了效率,同时允许跨窗口连接。这种层次化架构能够灵活地建模不同尺度的特征,并且计算复杂度与图像大小呈线性关系。Swin Transformer的这些特性使其适用于广泛的视觉任务,包括图像分类(在ImageNet-1K上达到87.3%的top-1准确率)和密集预测任务,如对象检测(在COCO test-dev上达到58.7的box AP和51.1的mask AP)和语义分割(在ADE20K val上达到53.5的mIoU)。其性能大幅超越了之前的最优结果,在COCO上提高了+2.7的box AP和+2.6的mask AP,在ADE20K上提高了+3.2的mIoU,展示了基于Transformer的模型作为视觉骨干网络的潜力。层次化设计和移位窗口方法也证明对全MLP架构有益。代码和模型已在https://github.com/microsoft/Swin-Transformer公开。
1. 引言
在计算机视觉领域,建模长期以来由卷积神经网络(Convolutional Neural Networks,简称CNN)主导。从AlexNet [35] 在ImageNet图像分类挑战中取得革命性性能开始,CNN架构通过更大规模 [27, 69]、更广泛的连接 [31] 和更复杂的卷积形式 [64, 17, 75] 变得越来越强大。作为多种视觉任务的骨干网络,这些架构上的进步带来了性能提升,广泛推动了整个领域的发展。
然而,在自然语言处理(Natural Language Processing,简称NLP)领域,网络架构的演变走上了不同的道路,目前的主流架构是Transformer [58]。Transformer专为序列建模和转换任务设计,以其使用注意力机制(Attention)来建模数据中的长距离依赖而著称。它在语言领域的巨大成功促使研究人员探索其在计算机视觉中的应用。最近,它在某些任务上显示出了前景,特别是在图像分类 [19] 和联合视觉-语言建模 [43] 中。
本文旨在扩展Transformer的适用性,使其像在NLP中一样,成为计算机视觉的通用骨干网络,正如CNN在视觉领域的作用。我们观察到,将Transformer从语言领域的高性能转移到视觉领域面临重大挑战,这些挑战可归因于两种模式之间的差异。其中一个差异涉及尺度。语言Transformer以单词作为处理的基本元素,而视觉元素的尺度差异很大,这一问题在对象检测 [38, 49, 50] 等任务中尤为突出。现有的基于Transformer的模型 [58, 19] 中的标记(Token)均为固定尺度,这一特性不适合这些视觉应用。另一个差异是图像中像素分辨率远高于文本段落中的单词数量。许多视觉任务(如语义分割)需要在像素级别进行密集预测,而Transformer在高分辨率图像上的自注意力计算复杂度与图像大小呈二次方关系,这使其难以处理。为了克服这些问题,我们提出了一种通用Transformer骨干网络,称为Swin Transformer,它能构建层次化的特征图,并且计算复杂度与图像大小呈线性关系。如图1(a)所示,Swin Transformer从小的图像块(灰色框)开始,逐步在更深的Transformer层中合并相邻块,构建层次化表示。有了这些层次化的特征图,Swin Transformer模型可以方便地利用高级技术进行密集预测,例如特征金字塔网络(Feature Pyramid Networks,简称FPN) [38] 或U-Net [47]。通过在非重叠窗口(红色框)内局部计算自注意力,实现了线性计算复杂度。每个窗口中的图像块数量固定,因此复杂度与图像大小呈线性关系。这些优点使Swin Transformer适合作为多种视觉任务的通用骨干网络,而之前的基于Transformer的架构 [19] 仅生成单一分辨率的特征图,且具有二次复杂度。
Swin Transformer的一个关键设计元素是其在连续自注意力层之间移位窗口分区,如图2所示。移位窗口连接了前一层中的窗口,为其提供了跨窗口的连接,大幅增强了建模能力(见表4)。该策略在实际延迟方面也更高效:同一窗口内的所有查询块共享相同的键集(Key Set)1,这有助于硬件中的内存访问。相比之下,之前的基于滑动窗口的自注意力方法 [30, 46] 由于不同查询像素使用不同的键集,在通用硬件上延迟较高。实验表明,提出的移位窗口方法比滑动窗口方法的延迟低得多,但在建模能力上相似(见表5和表6)。移位窗口方法还证明对全MLP架构 [56] 有益。

图1
(a) 提出的Swin Transformer通过在更深层中合并图像块(灰色框)构建层次化特征图,并由于仅在每个局部窗口(红色框)内计算自注意力,其计算复杂度与输入图像大小呈线性关系。因此,它可作为图像分类和密集识别任务的通用骨干网络。(b) 相比之下,之前的视觉Transformer [19] 生成单一低分辨率的特征图,且由于全局计算自注意力,其计算复杂度与输入图像大小呈二次关系。
Swin Transformer在图像分类、对象检测和语义分割等识别任务上取得了优异的性能。它显著优于ViT/DeiT [19, 57] 和ResNe(X)t模型 [27, 64],在三个任务上的延迟相似。在COCO test-dev数据集上,它达到了58.7的box AP和51.1的mask AP,比之前的最优结果提高了+2.7 box AP(Copy-paste [23],无外部数据)和+2.6 mask AP(DetectoRS [42])。在ADE20K语义分割任务上,它在验证集上获得了53.5的mIoU,比之前的最优结果(SETR [73])提高了+3.2 mIoU。它还在ImageNet-1K图像分类中取得了87.3%的top-1准确率。我们相信,计算机视觉和自然语言处理的统一架构将有益于两个领域,因为它有助于视觉和文本信号的联合建模,并使两个领域的建模知识更深入地共享。我们希望Swin Transformer在多种视觉问题上的优异性能能推动社区进一步探索视觉和语言信号的统一建模。
2. 相关工作
CNN及其变体
卷积神经网络(CNN)是计算机视觉中的标准网络模型。虽然CNN已存在数十年 [36],但直到AlexNet [35] 的引入,其在ImageNet上的表现使其成为主流。此后,更深、更有效的卷积神经网络架构被提出,推动了计算机视觉的深度学习浪潮,例如VGG [48]、GoogleNet [53]、ResNet [27]、DenseNet [31]、HRNet [59] 和EfficientNet [54]。除了这些架构进步外,还对单个卷积层进行了大量改进,例如深度卷积(Depthwise Convolution) [64] 和可变形卷积(Deformable Convolution) [17, 75]。虽然CNN及其变体仍是计算机视觉应用的主要骨干架构,但我们强调Transformer类架构在视觉和语言统一建模中的强大潜力。本研究在几个基本视觉识别任务上取得了优异性能,希望能推动建模的转变。
基于自注意力的骨干架构
受NLP领域自注意力层和Transformer架构成功的启发,一些工作使用自注意力层替换了流行的ResNet中的部分或全部空间卷积层 [30, 46, 72]。在这些工作中,自注意力在每个像素的局部窗口内计算,以加速优化 [30],并在准确率与FLOPs的权衡上略优于对应的ResNet架构。然而,其昂贵的内存访问导致实际延迟远大于卷积网络 [30]。我们没有使用滑动窗口,而是提出在连续层之间移位窗口,这种方法在通用硬件上实现更高效。
自注意力/Transformer辅助CNN
另一类工作是将标准CNN架构与自注意力层或Transformer相结合。自注意力层可以补充骨干网络 [61, 7, 3, 65, 21, 68, 51] 或头部网络 [29, 24],提供编码远距离依赖或异构交互的能力。最近,Transformer的编码器-解码器设计被应用于对象检测和实例分割任务 [8, 13, 76, 52]。本研究探索Transformer在基本视觉特征提取中的适配,与这些工作互补。
基于Transformer的视觉骨干网络
与本研究最相关的是Vision Transformer(ViT) [19] 及其后续工作 [57, 66, 15, 25, 60]。ViT的开创性工作直接将Transformer架构应用于非重叠的中等大小图像块,用于图像分类。它在图像分类上与卷积网络相比取得了令人印象深刻的性能-速度权衡。虽然ViT需要大规模训练数据集(例如JFT-300M)才能表现出色,但DeiT [57] 引入了几种训练策略,使ViT也能在较小的ImageNet-1K数据集上有效。ViT在图像分类上的结果令人鼓舞,但其架构不适合作为密集视觉任务的通用骨干网络,或在输入图像分辨率较高时使用,因为其特征图分辨率较低且复杂度随图像大小呈二次增长。有几项工作通过直接上采样或反卷积将ViT模型应用于对象检测和语义分割等密集视觉任务,但性能相对较低 [2, 73]。与本研究同期的一些工作修改了ViT架构 [66, 15, 25] 以提高图像分类性能。实证上,我们发现Swin Transformer架构在图像分类上取得了最佳的速度-准确率权衡,尽管我们的工作重点是通用性能而非专门针对分类。另一项同期工作 [60] 探索了类似的思路,在Transformer上构建多分辨率特征图。其复杂度仍与图像大小呈二次关系,而我们的方法是线性的,且在局部操作,这在建模视觉信号的高相关性方面已被证明有益 [32, 22, 37]。我们的方法兼具高效性和有效性,在COCO对象检测和ADE20K语义分割上实现了最先进的准确率。
3. 方法
3.1 总体架构
Swin Transformer的总体架构如图3所示,展示了其微型版本(Swin-T)。它首先通过一个图像块分割模块将输入RGB图像分成非重叠的块,类似于ViT。每个块被视为一个“标记”(Token),其特征是原始像素RGB值的拼接。在我们的实现中,我们使用4×4的块大小,因此每个块的特征维度为4×4×3=48。接着,一个线性嵌入层(Linear Embedding Layer)将这些原始特征投影到一个任意维度(记为C)。
在这些图像块标记上应用了多个带有改进自注意力计算的Transformer块(Swin Transformer块)。这些Transformer块保持标记数量(H/4 × W/4),连同线性嵌入层一起称为“阶段1(Stage 1)”。
为了生成层次化表示,随着网络加深,通过图像块合并层(Patch Merging Layers)减少标记数量。第一个图像块合并层将每组2×2相邻块的特征拼接起来,并在4C维的拼接特征上应用一个线性层。这将标记数量减少了2×2=4倍(分辨率下采样2倍),输出维度设置为2C。随后应用Swin Transformer块进行特征转换,分辨率保持在H/8 × W/8。这一图像块合并和特征转换的第一个块称为“阶段2(Stage 2)”。该过程重复两次,分别作为“阶段3(Stage 3)”和“阶段4(Stage 4)”,输出分辨率分别为H/16 × W/16和H/32 × W/32。这些阶段共同生成了层次化表示,其特征图分辨率与典型的卷积网络(如VGG [48] 和ResNet [27])相同。因此,提出的架构可以方便地替换现有方法中的骨干网络,用于各种视觉任务。

图3
(a) Swin Transformer(Swin-T)的架构;(b) 两个连续的Swin Transformer块(符号表示见方程(3))。W-MSA和SW-MSA分别是使用常规和移位窗口配置的多头自注意力模块。
Swin Transformer块
Swin Transformer通过将标准Transformer块中的多头自注意力(Multi-Head Self-Attention,简称MSA)模块替换为基于移位窗口的模块(见3.2节描述)构建而成,其他层保持不变。如图3(b)所示,一个Swin Transformer块包括一个基于移位窗口的MSA模块,随后是一个两层MLP(多层感知器),中间使用GELU非线性激活。在每个MSA模块和MLP之前应用LayerNorm(LN)层,并在每个模块后应用残差连接(Residual Connection)。
3.2 基于移位窗口的自注意力
标准Transformer架构 [58] 及其用于图像分类的适配 [19] 都执行全局自注意力,其中计算一个标记与所有其他标记之间的关系。全局计算导致复杂度与标记数量呈二次关系,这使得它不适合需要大量标记的视觉问题,例如密集预测或表示高分辨率图像。
非重叠窗口中的自注意力
为了高效建模,我们提出在局部窗口内计算自注意力。这些窗口以非重叠的方式均匀分割图像。假设每个窗口包含M×M个块,全局MSA模块和基于窗口的MSA模块在一个h×w块的图像上的计算复杂度分别为:
Ω(MSA) = 4hwC² + 2(hw)²C, (1)
Ω(W-MSA) = 4hwC² + 2M²hwC, (2)
其中前者与块数量hw呈二次关系,而后者在M固定时(默认设为7)呈线性关系。全局自注意力计算对较大的hw通常难以承受,而基于窗口的自注意力具有可扩展性。
连续块中的移位窗口分区
基于窗口的自注意力模块缺乏跨窗口的连接,这限制了其建模能力。为了在保持非重叠窗口高效计算的同时引入跨窗口连接,我们提出了一种移位窗口分区方法,在连续的Swin Transformer块中交替使用两种分区配置。
如图2所示,第一个模块采用常规窗口分区策略,从左上角像素开始,将8×8的特征图均匀分成2×2个大小为4×4(M=4)的窗口。下一个模块采用从前一层移位的窗口配置,通过将窗口从常规分区窗口位移(M/2, M/2)像素实现。使用移位窗口分区方法,连续的Swin Transformer块计算如下:
ẑᵗ = W-MSA(LN(zᵗ⁻¹)) + zᵗ⁻¹,
zᵗ = MLP(LN(ẑᵗ)) + ẑᵗ,
ẑᵗ⁺¹ = SW-MSA(LN(zᵗ)) + zᵗ,
zᵗ⁺¹ = MLP(LN(ẑᵗ⁺¹)) + ẑᵗ⁺¹, (3)
其中ẑᵗ和zᵗ分别表示块l的(S)W-MSA模块和MLP模块的输出特征;W-MSA和SW-MSA分别表示使用常规和移位窗口分区的多头自注意力。

图2
Swin Transformer架构中计算自注意力的移位窗口方法的示意图。在第l层(左图),采用常规窗口分区方案,在每个窗口内计算自注意力。在下一层l+1(右图),窗口分区发生移位,形成新的窗口。新窗口中的自注意力计算跨越了第l层中前一窗口的边界,提供了它们之间的连接。
移位窗口分区方法为前一层中的相邻非重叠窗口引入了连接,并在图像分类、对象检测和语义分割中证明是有效的(见表4)。
移位配置的高效批处理计算
移位窗口分区的一个问题是它将增加窗口数量,从⌈h/M⌉×⌈w/M⌉增加到(⌈h/M⌉+1)×(⌈w/M⌉+1),且某些窗口会小于M×M2。一个简单的解决方案是将较小的窗口填充到M×M大小,并在计算注意力时屏蔽填充值。当常规分区的窗口数量较少时(例如2×2),这种简单方案的计算量增加显著(2×2变为3×3,增加了2.25倍)。我们提出了一种更高效的批处理计算方法,通过朝左上方循环移位(Cyclic-Shifting),如图4所示。移位后,一个批处理窗口可能由特征图中不相邻的多个子窗口组成,因此采用掩码机制(Masking Mechanism)将自注意力计算限制在每个子窗口内。通过循环移位,批处理窗口数量与常规窗口分区保持一致,因此也高效。这种方法的低延迟在表5中显示。

图4
移位窗口分区中自注意力高效批处理计算方法的示意图。
相对位置偏置
在计算自注意力时,我们遵循 [45, 1, 29, 30] 的做法,为每个头添加一个相对位置偏置(Relative Position Bias)B∈R^(M²×M²),用于计算相似度:
Attention(Q, K, V) = SoftMax(QKᵀ / √d + B)V, (4)
其中Q、K、V∈R^(M²×d)分别是查询、键和值矩阵;d是查询/键的维度,M²是窗口内的块数量。由于每轴的相对位置范围在[-M+1, M-1]内,我们参数化一个较小的偏置矩阵B̂∈R^((2M-1)×(2M-1)),B中的值从B̂中获取。
我们观察到,与不使用偏置项或使用绝对位置嵌入(Absolute Position Embedding)的模型相比,性能有显著提升(见表4)。进一步在输入中添加如 [19] 的绝对位置嵌入会略微降低性能,因此我们的实现中未采用此方法。
在预训练中学习的相对位置偏置也可通过双三次插值 [19, 57] 初始化不同窗口大小的模型进行微调。
3.3 架构变体
我们构建的基础模型称为Swin-B,其模型大小和计算复杂度与ViT-B/DeiT-B相似。我们还引入了Swin-T、Swin-S和Swin-L,分别是模型大小和计算复杂度约为0.25倍、0.5倍和2倍的版本。Swin-T和Swin-S的复杂度分别与ResNet-50(DeiT-S)和ResNet-101相似。默认窗口大小设为M=7。每个头的查询维度为d=32,所有实验中MLP的扩展层为α=4。这些模型变体的架构超参数如下:
- Swin-T: C=96,层数={2, 2, 6, 2}
- Swin-S: C=96,层数={2, 2, 18, 2}
- Swin-B: C=128,层数={2, 2, 18, 2}
- Swin-L: C=192,层数={2, 2, 18, 2}
其中C是第一阶段隐藏层的通道数。模型大小、理论计算复杂度(FLOPs)和ImageNet图像分类的吞吐量列于表1。
表1
不同骨干网络在ImageNet-1K分类上的比较。吞吐量使用 [62] 的GitHub仓库和V100 GPU测量,遵循 [57]。
(a) 常规ImageNet-1K训练模型
| 方法 | 图像大小 | 参数量 | FLOPs | 吞吐量 (图像/秒) | ImageNet top-1 准确率 |
|---|---|---|---|---|---|
| RegNetY-4G [44] | 224² | 21M | 4.0G | 1156.7 | 80.0 |
| RegNetY-8G [44] | 224² | 39M | 8.0G | 591.6 | 81.7 |
| RegNetY-16G [44] | 224² | 84M | 16.0G | 334.7 | 82.9 |
| ViT-B/16 [19] | 384² | 86M | 55.4G | 85.9 | 77.9 |
| ViT-L/16 [19] | 384² | 307M | 190.7G | 27.3 | 76.5 |
| DeiT-S [57] | 224² | 22M | 4.6G | 940.4 | 79.8 |
| DeiT-B [57] | 224² | 86M | 17.5G | 292.3 | 81.8 |
| DeiT-B [57] | 384² | 86M | 55.4G | 85.9 | 83.1 |
| Swin-T | 224² | 29M | 4.5G | 755.2 | 81.3 |
| Swin-S | 224² | 50M | 8.7G | 436.9 | 83.0 |
| Swin-B | 224² | 88M | 15.4G | 278.1 | 83.5 |
| Swin-B | 384² | 88M | 47.0G | 84.7 | 84.5 |
(b) ImageNet-22K预训练模型
| 方法 | 图像大小 | 参数量 | FLOPs | 吞吐量 (图像/秒) | ImageNet top-1 准确率 |
|---|---|---|---|---|---|
| R-101x3 [34] | 384² | 388M | 204.6G | - | 84.4 |
| R-152x4 [34] | 480² | 937M | 840.5G | - | 85.4 |
| ViT-B/16 [19] | 384² | 86M | 55.4G | 85.9 | 84.0 |
| ViT-L/16 [19] | 384² | 307M | 190.7G | 27.3 | 85.2 |
| Swin-B | 224² | 88M | 15.4G | 278.1 | 85.2 |
| Swin-B | 384² | 88M | 47.0G | 84.7 | 86.4 |
| Swin-L | 384² | 197M | 103.9G | 42.1 | 87.3 |
4. 实验
我们在ImageNet-1K图像分类 [18]、COCO对象检测 [39] 和ADE20K语义分割 [74] 上进行了实验。以下首先将提出的Swin Transformer架构与之前的最优方法在这三个任务上进行比较,然后消融(Ablation)研究Swin Transformer的重要设计元素。
4.1 ImageNet-1K上的图像分类
设置
在图像分类实验中,我们在ImageNet-1K [18] 上评估Swin Transformer,该数据集包含128万训练图像和5万验证图像,涵盖1000个类别。报告单次裁剪的top-1准确率。我们考虑两种训练设置:
-
常规ImageNet-1K训练
该设置主要遵循 [57]。我们使用AdamW优化器 [33] 训练300个周期,采用余弦衰减学习率调度器和20个周期的线性预热。批量大小为1024,初始学习率为0.001,权重衰减为0.05。我们采用了 [57] 中的大部分增强和正则化策略,但未使用重复增强 [28] 和EMA [41],因为它们未提升性能。注意,这与 [57] 不同,在 [57] 中重复增强对稳定ViT训练至关重要。 -
ImageNet-22K预训练和ImageNet-1K微调
我们在ImageNet-22K数据集上进行预训练,该数据集包含1420万图像和2.2万类别。我们使用AdamW优化器训练90个周期,采用余弦学习率调度器和5个周期的线性预热。批量大小为4096,初始学习率为0.001,权重衰减为0.01。在ImageNet-1K微调中,我们训练30个周期,批量大小为1024,恒定学习率为10⁻⁵,权重衰减为10⁻⁸。
常规ImageNet-1K训练结果
表1(a)展示了与其他骨干网络的比较,包括基于Transformer和基于ConvNet的模型。与之前的最优Transformer架构DeiT [57] 相比,Swin Transformer在相似复杂度下显著优于对应的DeiT架构:Swin-T(81.3%)比DeiT-S(79.8%)提高了+1.5%(224²输入);Swin-B(83.3%/84.5%)比DeiT-B(81.8%/83.1%)分别提高了+1.5%/+1.4%(224²/384²输入)。
与最优ConvNet(如RegNet [44])相比,Swin Transformer在速度-准确率权衡上略胜一筹。值得注意的是,RegNet [44] 通过彻底的架构搜索获得,而Swin Transformer是从标准Transformer手动适配的,仍有进一步改进的潜力。
ImageNet-22K预训练结果
我们在更大容量的Swin-B和Swin-L上进行了ImageNet-22K预训练。结果在ImageNet-1K上微调后如表1(b)所示。对于Swin-B,ImageNet-22K预训练比从头训练ImageNet-1K提高了1.8%~1.9%。与之前的最优ImageNet-22K预训练结果相比,我们的模型取得了显著更好的速度-准确率权衡:Swin-B获得86.4%的top-1准确率,比ViT高出2.4%,且推理吞吐量相似(84.7 vs. 85.9 图像/秒),FLOPs略低(47.0G vs. 55.4G)。更大的Swin-L模型达到了87.3%的top-1准确率,比Swin-B提高了+0.9%。
4.2 COCO上的对象检测
设置
对象检测和实例分割实验在COCO 2017数据集上进行,该数据集包含11.8万训练图像、5000验证图像和2万test-dev图像。消融研究在验证集上进行,系统级比较在test-dev上报告。在消融研究中,我们考虑四种典型的对象检测框架:Cascade Mask R-CNN [26, 6]、ATSS [71]、RepPoints v2 [12] 和Sparse RCNN [52],使用mmdetection [10]。这四种框架使用相同设置:多尺度训练 [8, 52](调整输入使短边在480到800之间,长边不超过1333)、AdamW优化器 [40](初始学习率为0.0001,权重衰减为0.05,批量大小为16)和3x调度(36个周期)。在系统级比较中,我们采用改进的HTC [9](记为HTC++),包括instaboost [20]、更强的多尺度训练 [7]、6x调度(72个周期)、soft-NMS [5] 和ImageNet-22K预训练模型作为初始化。
我们将Swin Transformer与标准ConvNet(如ResNe(X)t)和之前的Transformer网络(如DeiT)进行比较。比较仅改变骨干网络,其他设置保持不变。Swin Transformer和ResNe(X)t因其层次化特征图可直接应用于上述所有框架,而DeiT仅生成单一分辨率的特征图,无法直接应用。为公平比较,我们遵循 [73] 为DeiT使用反卷积层构建层次化特征图。
与ResNe(X)t比较
表2(a)列出了Swin-T和ResNet-50在四个对象检测框架上的结果。Swin-T架构比ResNet-50一致提高了+3.4~4.2的box AP,模型大小、FLOPs和延迟略有增加。
表2(b)使用Cascade Mask R-CNN比较了不同模型容量的Swin Transformer和ResNe(X)t。Swin Transformer达到了51.9的box AP和45.0的mask AP,比ResNeXt101-64x4d显著提高了+3.6 box AP和+3.3 mask AP,后者具有相似的模型大小、FLOPs和延迟。在更高的基线(使用改进的HTC框架,52.3 box AP和46.0 mask AP)上,Swin Transformer的提升也很大,达到+4.1 box AP和+3.1 mask AP(见表2©)。在推理速度方面,虽然ResNe(X)t使用高度优化的Cudnn函数构建,但我们的架构使用内置的PyTorch函数实现,未完全优化。彻底的内核优化超出了本文范围。
表2
COCO对象检测和实例分割结果。†表示使用额外的反卷积层生成层次化特征图。*表示多尺度测试。
(a) 不同框架
| 方法 | 骨干网络 | APᵇᵒˣ | APᵇᵒˣ₅₀ | APᵇᵒˣ₇₅ | 参数量 | FLOPs | FPS |
|---|---|---|---|---|---|---|---|
| Cascade Mask R-CNN | R-50 | 46.3 | 64.3 | 50.5 | 82M | 739G | 18.0 |
| Swin-T | 50.5 | 69.3 | 54.9 | 86M | 745G | 15.3 | |
| ATSS | R-50 | 43.5 | 61.9 | 47.0 | 32M | 205G | 28.3 |
| Swin-T | 47.2 | 66.5 | 51.3 | 36M | 215G | 22.3 | |
| RepPointsV2 | R-50 | 46.5 | 64.6 | 50.3 | 42M | 274G | 13.6 |
| Swin-T | 50.0 | 68.5 | 54.2 | 45M | 283G | 12.0 | |
| Sparse R-CNN | R-50 | 44.5 | 63.4 | 48.2 | 106M | 166G | 21.0 |
| Swin-T | 47.9 | 67.3 | 52.3 | 110M | 172G | 18.4 |
(b) Cascade Mask R-CNN下不同骨干网络
| 骨干网络 | APᵇᵒˣ | APᵇᵒˣ₅₀ | APᵇᵒˣ₇₅ | APᵐᵃˢᵏ | APᵐᵃˢᵏ₅₀ | APᵐᵃˢᵏ₇₅ | 参数量 | FLOPs | FPS |
|---|---|---|---|---|---|---|---|---|---|
| DeiT-S† | 48.0 | 67.2 | 51.7 | 41.4 | 64.2 | 44.3 | 80M | 889G | 10.4 |
| R50 | 46.3 | 64.3 | 50.5 | 40.1 | 61.7 | 43.4 | 82M | 739G | 18.0 |
| Swin-T | 50.5 | 69.3 | 54.9 | 43.7 | 66.6 | 47.1 | 86M | 745G | 15.3 |
| X101-32 | 48.1 | 66.5 | 52.4 | 41.6 | 63.9 | 45.2 | 101M | 819G | 12.8 |
| Swin-S | 51.8 | 70.4 | 56.3 | 44.7 | 67.9 | 48.5 | 107M | 838G | 12.0 |
| X101-64 | 48.3 | 66.4 | 52.3 | 41.7 | 64.0 | 45.1 | 140M | 972G | 10.4 |
| Swin-B | 51.9 | 70.9 | 56.5 | 45.0 | 68.4 | 48.7 | 145M | 982G | 11.6 |
© 系统级比较
| 方法 | mini-val | test-dev | 参数量 | FLOPs | APᵇᵒˣ | APᵐᵃˢᵏ |
|---|---|---|---|---|---|---|
| RepPointsV2* [12] | - | 52.1 | - | - | - | - |
| GCNet* [7] | 51.8 / 44.7 | 52.3 / 45.4 | - | 1041G | - | - |
| RelationNet++* [13] | - | 52.7 | - | - | - | - |
| DetectoRS* [42] | - | 55.7 / 48.5 | - | - | - | - |
| YOLOv4 P7* [4] | - | 55.8 | - | - | - | - |
| Copy-paste [23] | 55.9 / 47.2 | 56.0 / 47.4 | 185M | 1440G | - | - |
| X101-64 (HTC++) | 52.3 / 46.0 | - | 155M | 1033G | - | - |
| Swin-B (HTC++) | 56.4 / 49.1 | - | 160M | 1043G | - | - |
| Swin-L (HTC++) | 57.1 / 49.5 | 57.7 / 50.2 | 284M | 1470G | - | - |
| Swin-L (HTC++)* | 58.0 / 50.4 | 58.7 / 51.1 | 284M | - | - | - |
与DeiT比较
表2(b)显示了DeiT-S在Cascade Mask R-CNN框架下的性能。Swin-T的结果比DeiT-S高出+2.5 box AP和+2.3 mask AP,模型大小相似(86M vs. 80M),推理速度显著更高(15.3 FPS vs. 10.4 FPS)。DeiT较低的推理速度主要由于其与输入图像大小呈二次关系的复杂度。
与之前的最优方法比较
表2©将我们的最佳结果与之前的最优模型进行比较。我们最佳模型在COCO test-dev上达到了58.7的box AP和51.1的mask AP,比之前的最优结果提高了+2.7 box AP(Copy-paste [23],无外部数据)和+2.6 mask AP(DetectoRS [42])。
4.3 ADE20K上的语义分割
设置
ADE20K [74] 是一个广泛使用的语义分割数据集,涵盖150个语义类别,总计2.5万张图像,其中2万用于训练,2000用于验证,3000用于测试。我们使用mmseg [16] 中的UperNet [63] 作为基础框架,因其高效性。更多细节见附录。
结果
表3列出了mIoU、模型大小(参数量)、FLOPs和FPS的不同方法/骨干网络组合。结果显示,Swin-S比DeiT-S高出+5.3 mIoU(49.3 vs. 44.0),计算成本相似。比ResNet-101高出+4.4 mIoU,比ResNeSt-101 [70] 高出+2.4 mIoU。我们的Swin-L模型在ImageNet-22K预训练后,在验证集上达到了53.5的mIoU,比之前的最佳模型提高了+3.2 mIoU(SETR [73] 的50.3 mIoU,后者模型更大)。
表3
ADE20K验证集和测试集上的语义分割结果。†表示使用额外的反卷积层生成层次化特征图。‡表示模型在ImageNet-22K上预训练。
| 方法 | 骨干网络 | mIoU | 测试得分 | 参数量 | FLOPs | FPS |
|---|---|---|---|---|---|---|
| DLab.v3+ [11] | ResNet-101 | 44.1 | - | 63M | 1021G | 16.0 |
| DNL [65] | ResNet-101 | 46.0 | 56.2 | 69M | 1249G | 14.8 |
| OCRNet [67] | ResNet-101 | 45.3 | 56.0 | 56M | 923G | 19.3 |
| UperNet [63] | ResNet-101 | 44.9 | - | 86M | 1029G | 20.1 |
| OCRNet [67] | HRNet-w48 | 45.7 | - | 71M | 664G | 12.5 |
| DLab.v3+ [11] | ResNeSt-101 | 46.9 | 55.1 | 66M | 1051G | 11.9 |
| DLab.v3+ [11] | ResNeSt-200 | 48.4 | - | 88M | 1381G | 8.1 |
| SETR [73] | T-Large‡ | 50.3 | 61.7 | 308M | - | - |
| UperNet | DeiT-S† | 44.0 | - | 52M | 1099G | 16.2 |
| UperNet | Swin-T | 46.1 | - | 60M | 945G | 18.5 |
| UperNet | Swin-S | 49.3 | - | 81M | 1038G | 15.2 |
| UperNet | Swin-B‡ | 51.6 | - | 121M | 1841G | 8.7 |
| UperNet | Swin-L‡ | 53.5 | 62.8 | 234M | 3230G | 6.2 |
4.4 消融研究
在本节中,我们在ImageNet-1K图像分类、COCO上的Cascade Mask R-CNN对象检测和ADE20K上的UperNet语义分割任务上,消融Swin Transformer的重要设计元素。
移位窗口
表4报告了移位窗口方法在三个任务上的消融结果。使用移位窗口分区的Swin-T比每个阶段使用单一窗口分区的版本在ImageNet-1K上提高了+1.1%的top-1准确率,在COCO上提高了+2.8 box AP/+2.2 mask AP,在ADE20K上提高了+2.8 mIoU。结果表明,使用移位窗口建立前一层窗口之间的连接是有效的。移位窗口的延迟开销也很小,如表5所示。
相对位置偏置
表4比较了不同位置嵌入方法。带有相对位置偏置的Swin-T相比无位置编码和使用绝对位置嵌入的版本,在ImageNet-1K上分别提高了+1.2%/+0.8%的top-1准确率,在COCO上提高了+1.3/+1.5 box AP和+1.1/+1.3 mask AP,在ADE20K上提高了+2.3/+2.9 mIoU,表明相对位置偏置的有效性。值得注意的是,虽然添加绝对位置嵌入提高了图像分类准确率(+0.4%),但对对象检测和语义分割有害(COCO上-0.2 box/mask AP,ADE20K上-0.6 mIoU)。
表4
移位窗口方法和不同位置嵌入方法的消融研究,使用Swin-T架构在三个基准上。
- w/o shifting:所有自注意力模块采用常规窗口分区,无移位;
- abs. pos.:ViT的绝对位置嵌入项;
- rel. pos.:默认设置,添加相对位置偏置项(见方程(4));
- app.:方程(4)中的第一个缩放点积项。
| 配置 | ImageNet top-1 | ImageNet top-5 | COCO APᵇᵒˣ | COCO APᵐᵃˢᵏ | ADE20k mIoU |
|---|---|---|---|---|---|
| w/o shifting | 80.2 | 95.1 | 47.7 | 41.5 | 43.3 |
| shifted windows | 81.3 | 95.6 | 50.5 | 43.7 | 46.1 |
| no pos. | 80.1 | 94.9 | 49.2 | 42.6 | 43.8 |
| abs. pos. | 80.5 | 95.2 | 49.0 | 42.4 | 43.2 |
| abs.+rel. pos. | 81.3 | 95.6 | 50.2 | 43.4 | 44.0 |
| rel. pos. w/o app. | 79.3 | 94.7 | 48.2 | 41.9 | 44.1 |
| rel. pos. | 81.3 | 95.6 | 50.5 | 43.7 | 46.1 |
不同自注意力方法
表5比较了不同自注意力计算方法和实现的真实速度。我们的循环实现比简单填充在硬件上更高效,尤其是在更深阶段。总体上,它为Swin-T、Swin-S和Swin-B分别带来了13%、18%和18%的加速。
表5
不同自注意力计算方法和实现的真实速度,在V100 GPU上测量。
| 方法 | 阶段MSA耗时 (ms) | 架构FPS | |||||
|---|---|---|---|---|---|---|---|
| S1 | S2 | S3 | S4 | T | S | B | |
| sliding window (naive) | 122.5 | 38.3 | 12.1 | 7.6 | 183 | 109 | 77 |
| sliding window (kernel) | 7.6 | 4.7 | 2.7 | 1.8 | 488 | 283 | 187 |
| Performer [14] | 4.8 | 2.8 | 1.8 | 1.5 | 638 | 370 | 241 |
| window (w/o shifting) | 2.8 | 1.7 | 1.2 | 0.9 | 770 | 444 | 280 |
| shifted window (padding) | 3.3 | 2.3 | 1.9 | 2.2 | 670 | 371 | 236 |
| shifted window (cyclic) | 3.0 | 1.9 | 1.3 | 1.0 | 755 | 437 | 278 |
提出的基于移位窗口的自注意力模块在四个网络阶段分别比滑动窗口的简单/内核实现高效40.8倍/2.5倍、20.2倍/2.5倍、9.3倍/2.1倍和7.6倍/1.8倍。总体上,基于移位窗口的Swin Transformer架构比基于滑动窗口的变体分别快4.1/1.5、4.0/1.5和3.6/1.5倍(对应Swin-T、Swin-S和Swin-B)。表6比较了它们在三个任务上的准确率,显示它们在视觉建模上准确率相似。
与Performer [14](最快的Transformer架构之一,见 [55])相比,提出的基于移位窗口的自注意力计算和整体Swin Transformer架构略快(见表5),在使用Swin-T时比Performer在ImageNet-1K上提高了+2.3%的top-1准确率(见表6)。
表6
使用不同自注意力计算方法的Swin Transformer在三个基准上的准确率。
| 骨干网络 | ImageNet top-1 | ImageNet top-5 | COCO APᵇᵒˣ | COCO APᵐᵃˢᵏ | ADE20k mIoU |
|---|---|---|---|---|---|
| sliding window Swin-T | 81.4 | 95.6 | 50.2 | 43.5 | 45.8 |
| Performer [14] Swin-T | 79.0 | 94.2 | - | - | - |
| shifted window Swin-T | 81.3 | 95.6 | 50.5 | 43.7 | 46.1 |
5. 结论
本文提出了Swin Transformer,这是一种新的视觉Transformer,它生成层次化特征表示,且计算复杂度与输入图像大小呈线性关系。Swin Transformer在COCO对象检测和ADE20K语义分割上实现了最先进的性能,显著超越了之前的最佳方法。我们希望Swin Transformer在多种视觉问题上的优异性能能鼓励视觉和语言信号的统一建模。
致谢
我们感谢李栋和魏福如的有益讨论;感谢肖斌、袁鹭和张磊在数据集上的帮助;感谢徐家睿在mmdetection和mmsegmentation代码库上的支持。
参考文献
[1] Hangbo Bao, Li Dong, Furu Wei, et al. Unilmv2: Pseudo-masked language models for unified language model pre-training. In International Conference on Machine Learning, pages 642–652. PMLR, 2020.
[2] Josh Beal, Eric Kim, Eric Tzeng, et al. Toward transformer-based object detection. arXiv preprint arXiv:2012.09958, 2020.
[3] Irwan Bello, Barret Zoph, Ashish Vaswani, et al. Attention augmented convolutional networks, 2020.
[4] Alexey Bochkovskiy, Chien-Yao Wang, Hong-Yuan Mark Liao. Yolov4: Optimal speed and accuracy of object detection. arXiv preprint arXiv:2004.10934, 2020.
[5] Navaneeth Bodla, Bharat Singh, Rama Chellappa, et al. Soft-nms – improving object detection with one line of code. In Proceedings of the IEEE International Conference on Computer Vision (ICCV), Oct 2017.
[6] Zhaowei Cai and Nuno Vasconcelos. Cascade r-cnn: Delving into high quality object detection. In Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pages 6154–6162, 2018.
[7] Yue Cao, Jiarui Xu, Stephen Lin, et al. Gcnet: Non-local networks meet squeeze-excitation networks and beyond. In Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV) Workshops, Oct 2019.
[8] Nicolas Carion, Francisco Massa, Gabriel Synnaeve, et al. End-to-end object detection with transformers. In European Conference on Computer Vision, pages 213–229. Springer, 2020.
[9] Kai Chen, Jiangmiao Pang, Jiaqi Wang, et al. Hybrid task cascade for instance segmentation. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 4974–4983, 2019.
[10] Kai Chen, Jiaqi Wang, Jiangmiao Pang, et al. Mmdetection: Open mmlab detection toolbox and benchmark. arXiv preprint arXiv:1906.07155, 2019.
[11] Liang-Chieh Chen, Yukun Zhu, George Papandreou, et al. Encoder-decoder with atrous separable convolution for semantic image segmentation. In Proceedings of the European conference on computer vision (ECCV), pages 801–818, 2018.
[12] Yihong Chen, Zheng Zhang, Yue Cao, et al. Reppoints v2: Verification meets regression for object detection. In NeurIPS, 2020.
[13] Cheng Chi, Fangyun Wei, and Han Hu. Relationnet++: Bridging visual representations for object detection via transformer decoder. In NeurIPS, 2020.
[14] Krzysztof Marcin Choromanski, Valerii Likhosherstov, David Dohan, et al. Rethinking attention with performers. In International Conference on Learning Representations, 2021.
[15] Xiangxiang Chu, Bo Zhang, Zhi Tian, et al. Do we really need explicit position encodings for vision transformers? arXiv preprint arXiv:2102.10882, 2021.
[16] MMSegmentation Contributors. MMSegmentation: Openmmlab semantic segmentation toolbox and benchmark. https://github.com/open-mmlab/mmsegmentation, 2020.
[17] Jifeng Dai, Haozhi Qi, Yuwen Xiong, et al. Deformable convolutional networks. In Proceedings of the IEEE International Conference on Computer Vision, pages 764–773, 2017.
[18] Jia Deng, Wei Dong, Richard Socher, et al. Imagenet: A large-scale hierarchical image database. In 2009 IEEE conference on computer vision and pattern recognition, pages 248–255. IEEE, 2009.
[19] Alexey Dosovitskiy, Lucas Beyer, Alexander Kolesnikov, et al. An image is worth 16x16 words: Transformers for image recognition at scale. In International Conference on Learning Representations, 2021.
[20] Hao-Shu Fang, Jianhua Sun, Runzhong Wang, et al. Instaboost: Boosting instance segmentation via probability map guided copy-pasting. In Proceedings of the IEEE/CVF International Conference on Computer Vision, pages 682–691, 2019.
[21] Jun Fu, Jing Liu, Haijie Tian, et al. Dual attention network for scene segmentation. In Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pages 3146–3154, 2019.
[22] Kunihiko Fukushima. Cognitron: A self-organizing multilayered neural network. Biological cybernetics, 20(3):121–136, 1975.
[23] Golnaz Ghiasi, Yin Cui, Aravind Srinivas, et al. Simple copy-paste is a strong data augmentation method for instance segmentation. arXiv preprint arXiv:2012.07177, 2020.
[24] Jiayuan Gu, Han Hu, Liwei Wang, et al. Learning region features for object detection. In Proceedings of the European Conference on Computer Vision (ECCV), 2018.
[25] Kai Han, An Xiao, Enhua Wu, et al. Transformer in transformer. arXiv preprint arXiv:2103.00112, 2021.
[26] Kaiming He, Georgia Gkioxari, Piotr Dollár, et al. Mask r-cnn. In Proceedings of the IEEE international conference on computer vision, pages 2961–2969, 2017.
[27] Kaiming He, Xiangyu Zhang, Shaoqing Ren, et al. Deep residual learning for image recognition. In Proceedings of the IEEE conference on computer vision and pattern recognition, pages 770–778, 2016.
[28] Elad Hoffer, Tal Ben-Nun, Itay Hubara, et al. Augment your batch: Improving generalization through instance repetition. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 8129–8138, 2020.
[29] Han Hu, Jiayuan Gu, Zheng Zhang, et al. Relation networks for object detection. In Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pages 3588–3597, 2018.
[30] Han Hu, Zheng Zhang, Zhenda Xie, et al. Local relation networks for image recognition. In Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV), pages 3464–3473, October 2019.
[31] Gao Huang, Zhuang Liu, Laurens Van Der Maaten, et al. Densely connected convolutional networks. In Proceedings of the IEEE conference on computer vision and pattern recognition, pages 4700–4708, 2017.
[32] David H Hubel and Torsten N Wiesel. Receptive fields, binocular interaction and functional architecture in the cat’s visual cortex. The Journal of physiology, 160(1):106–154, 1962.
[33] Diederik P Kingma and Jimmy Ba. Adam: A method for stochastic optimization. arXiv preprint arXiv:1412.6980, 2014.
[34] Alexander Kolesnikov, Lucas Beyer, Xiaohua Zhai, et al. Big transfer (bit): General visual representation learning. arXiv preprint arXiv:1912.11370, 6(2):8, 2019.
[35] Alex Krizhevsky, Ilya Sutskever, and Geoffrey E Hinton. Imagenet classification with deep convolutional neural networks. In Advances in neural information processing systems, pages 1097–1105, 2012.
[36] Yann LeCun, Léon Bottou, Yoshua Bengio, et al. Gradient-based learning applied to document recognition. Proceedings of the IEEE, 86(11):2278–2324, 1998.
[37] Yann LeCun, Patrick Haffner, Léon Bottou, et al. Object recognition with gradient-based learning. In Shape, contour and grouping in computer vision, pages 319–345. Springer, 1999.
[38] Tsung-Yi Lin, Piotr Dollar, Ross Girshick, et al. Feature pyramid networks for object detection. In The IEEE Conference on Computer Vision and Pattern Recognition (CVPR), July 2017.
[39] Tsung-Yi Lin, Michael Maire, Serge Belongie, et al. Microsoft coco: Common objects in context. In European conference on computer vision, pages 740–755. Springer, 2014.
[40] Ilya Loshchilov and Frank Hutter. Decoupled weight decay regularization. In International Conference on Learning Representations, 2019.
[41] Boris T Polyak and Anatoli B Juditsky. Acceleration of stochastic approximation by averaging. SIAM journal on control and optimization, 30(4):838–855, 1992.
[42] Siyuan Qiao, Liang-Chieh Chen, and Alan Yuille. Detectors: Detecting objects with recursive feature pyramid and switchable atrous convolution. arXiv preprint arXiv:2006.02334, 2020.
[43] Alec Radford, Jong Wook Kim, Chris Hallacy, et al. Learning transferable visual models from natural language supervision, 2021.
[44] Ilija Radosavovic, Raj Prateek Kosaraju, Ross Girshick, et al. Designing network design spaces. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 10428–10436, 2020.
[45] Colin Raffel, Noam Shazeer, Adam Roberts, et al. Exploring the limits of transfer learning with a unified text-to-text transformer. Journal of Machine Learning Research, 21(140):1–67, 2020.
[46] Prajit Ramachandran, Niki Parmar, Ashish Vaswani, et al. Stand-alone self-attention in vision models. In Advances in Neural Information Processing Systems, volume 32. Curran Associates, Inc., 2019.
[47] Olaf Ronneberger, Philipp Fischer, and Thomas Brox. U-net: Convolutional networks for biomedical image segmentation. In International Conference on Medical image computing and computer-assisted intervention, pages 234–241. Springer, 2015.
[48] K. Simonyan and A. Zisserman. Very deep convolutional networks for large-scale image recognition. In International Conference on Learning Representations, May 2015.
[49] Bharat Singh and Larry S Davis. An analysis of scale invariance in object detection snip. In Proceedings of the IEEE conference on computer vision and pattern recognition, pages 3578–3587, 2018.
[50] Bharat Singh, Mahyar Najibi, and Larry S Davis. Sniper: Efficient multi-scale training. In Advances in Neural Information Processing Systems, volume 31. Curran Associates, Inc., 2018.
[51] Aravind Srinivas, Tsung-Yi Lin, Niki Parmar, et al. Bottleneck transformers for visual recognition. arXiv preprint arXiv:2101.11605, 2021.
[52] Peize Sun, Rufeng Zhang, Yi Jiang, et al. Sparse r-cnn: End-to-end object detection with learnable proposals. arXiv preprint arXiv:2011.12450, 2020.
[53] Christian Szegedy, Wei Liu, Yangqing Jia, et al. Going deeper with convolutions. In Proceedings of the IEEE conference on computer vision and pattern recognition, pages 1–9, 2015.
[54] Mingxing Tan and Quoc Le. Efficientnet: Rethinking model scaling for convolutional neural networks. In International Conference on Machine Learning, pages 6105–6114. PMLR, 2019.
[55] Yi Tay, Mostafa Dehghani, Samira Abnar, et al. Long range arena : A benchmark for efficient transformers. In International Conference on Learning Representations, 2021.
[56] Ilya Tolstikhin, Neil Houlsby, Alexander Kolesnikov, et al. Mlp-mixer: An all-mlp architecture for vision, 2021.
[57] Hugo Touvron, Matthieu Cord, Matthijs Douze, et al. Training data-efficient image transformers & distillation through attention. arXiv preprint arXiv:2012.12877, 2020.
[58] Ashish Vaswani, Noam Shazeer, Niki Parmar, et al. Attention is all you need. In Advances in Neural Information Processing Systems, pages 5998–6008, 2017.
[59] Jingdong Wang, Ke Sun, Tianheng Cheng, et al. Deep high-resolution representation learning for visual recognition. IEEE transactions on pattern analysis and machine intelligence, 2020.
[60] Wenhai Wang, Enze Xie, Xiang Li, et al. Pyramid vision transformer: A versatile backbone for dense prediction without convolutions. arXiv preprint arXiv:2102.12122, 2021.
[61] Xiaolong Wang, Ross Girshick, Abhinav Gupta, et al. Non-local neural networks. In IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2018, 2018.
[62] Ross Wightman. Pytorch image models. https://github.com/rwightman/pytorch-image-models, 2019.
[63] Tete Xiao, Yingcheng Liu, Bolei Zhou, et al. Unified perceptual parsing for scene understanding. In Proceedings of the European Conference on Computer Vision (ECCV), pages 418–434, 2018.
[64] Saining Xie, Ross Girshick, Piotr Dollár, et al. Aggregated residual transformations for deep neural networks. In Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pages 1492–1500, 2017.
[65] Minghao Yin, Zhuliang Yao, Yue Cao, et al. Disentangled non-local neural networks. In Proceedings of the European conference on computer vision (ECCV), 2020.
[66] Li Yuan, Yunpeng Chen, Tao Wang, et al. Tokens-to-token vit: Training vision transformers from scratch on imagenet. arXiv preprint arXiv:2101.11986, 2021.
[67] Yuhui Yuan, Xilin Chen, and Jingdong Wang. Object-contextual representations for semantic segmentation. In 16th European Conference Computer Vision (ECCV 2020), August 2020.
[68] Yuhui Yuan and Jingdong Wang. Ocnet: Object context network for scene parsing. arXiv preprint arXiv:1809.00916, 2018.
[69] Sergey Zagoruyko and Nikos Komodakis. Wide residual networks. In BMVC, 2016.
[70] Hang Zhang, Chongruo Wu, Zhongyue Zhang, et al. Resnest: Split-attention networks. arXiv preprint arXiv:2004.08955, 2020.
[71] Shifeng Zhang, Cheng Chi, Yongqiang Yao, et al. Bridging the gap between anchor-based and anchor-free detection via adaptive training sample selection. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 9759–9768, 2020.
[72] Hengshuang Zhao, Jiaya Jia, and Vladlen Koltun. Exploring self-attention for image recognition. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 10076–10085, 2020.
[73] Sixiao Zheng, Jiachen Lu, Hengshuang Zhao, et al. Rethinking semantic segmentation from a sequence-to-sequence perspective with transformers. arXiv preprint arXiv:2012.15840, 2020.
[74] Bolei Zhou, Hang Zhao, Xavier Puig, et al. Semantic understanding of scenes through the ade20k dataset. International Journal on Computer Vision, 2018.
[75] Xizhou Zhu, Han Hu, Stephen Lin, et al. Deformable convnets v2: More deformable, better results. In Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pages 9308–9316, 2019.
[76] Xizhou Zhu, Weijie Su, Lewei Lu, et al. Deformable {detr}: Deformable transformers for end-to-end object detection. In International Conference on Learning Representations, 2021.

553

被折叠的 条评论
为什么被折叠?



