创见博客
论文解读:DEEN and LLCM(用于可见光-红外行人重识别的多样化嵌入扩展网络及低光照跨模态基准测试)
七崽爱吃小饼干2025/04/16阅读 4专栏 行人重识别

Diverse Embedding Expansion Network and Low-Light Cross-Modality Benchmark for Visible-Infrared Person Re-identification

摘要

对于可见光-红外行人重识别(VIReID)任务而言,主要挑战之一在于可见光(VIS)图像与红外(IR)图像之间的模态差异。然而,训练样本通常有限,同时模态差异又过大,这导致现有的方法无法有效地挖掘多样化的跨模态线索。为了应对这一局限,我们在嵌入空间中提出了一种新颖的增强网络,称为多样化嵌入扩展网络(DEEN)。所提出的DEEN能够有效地生成多样化的嵌入,以学习具有丰富信息的特征表示,并减少可见光和红外图像之间的模态差异。此外,VIReID模型可能会受到剧烈光照变化的严重影响,而所有现有的VIReID数据集都是在充足光照条件下采集的,没有明显的光照变化。因此,我们提供了一个低光照跨模态(LLCM)数据集,该数据集包含由9台RGB/IR相机采集的1064个行人身份的46767个边界框。在SYSU-MM01、RegDB和LLCM数据集上进行的大量实验表明,所提出的DEEN优于其他几种最先进的方法。代码和数据集可在以下网址获取:https://github.com/ZYK100/LLCM 。

1.引言

图1展示了所提出的多样化嵌入扩展网络(DEEN)的设计动机,其目的是生成多样化的嵌入,使网络专注于利用具有丰富信息的特征表示进行学习,从而减小可见光(VIS)图像与红外(IR)图像之间的模态差异。

行人重识别(ReID)旨在将一个给定的行人与由不同相机拍摄的图库图像进行匹配[3, 9, 52]。现有的大多数行人重识别方法[22, 24, 30, 38, 50]只专注于匹配由可见光相机在白天拍摄的RGB图像。然而,当可见光相机在复杂条件下(例如在夜间或低光照环境中)无法有效地捕捉行人信息时,这些方法可能无法取得令人满意的结果。为了解决这个问题,一些可见光(VIS)-红外(IR)行人重识别(VIReID)方法[15, 39, 41, 48]被提出来,以便根据相应的红外(IR)图像来检索可见光(VIS)图像,或者根据可见光(VIS)图像来检索红外(IR)图像。

图2. 在SYSU-MM01(第一行)、RegDB(第二行)以及LLCM(第三行至第五行)数据集上的行人图像对比。每一行展示了两个行人身份的四张可见光图像和四张红外图像。很明显,我们的LLCM数据集包含了一个更具挑战性且更贴近现实的可见光-红外行人重识别环境。

与得到广泛研究的行人重识别(ReID)任务相比,可见光-红外行人重识别(VIReID)任务更具挑战性,因为可见光(VIS)图像和红外(IR)图像之间存在额外的跨模态差异[33, 45, 49, 51]。一般来说,有两种常见的方法来减少这种模态差异。

一类是特征层面的方法[5,11,16,35,40,42],这类方法试图将可见光和红外特征投影到一个公共的嵌入空间中,在这个空间里模态差异能够被最小化。然而,巨大的模态差异使得这些方法很难直接将跨模态图像投影到一个公共的特征空间中。

另一类是图像层面的方法[4,28,29,32],其旨在通过使用生成对抗网络(GANs)[8]将红外(或可见光)图像转换为对应的可见光(或红外)图像,以此来减少模态差异。尽管这些方法在减少模态差异方面取得了成功,但由于缺乏可见光-红外图像对,生成的跨模态图像通常会伴随一些噪声。

在本文中,我们针对可见光-红外行人重识别(VIReID)任务,在嵌入空间中提出了一种新颖的增强网络,称为多样化嵌入扩展网络(DEEN),它由一个多样化嵌入扩展(DEE)模块和一个多级特征聚合(MFA)模块组成。所提出的多样化嵌入扩展(DEE)模块可以生成更多的嵌入,随后通过一种新颖的中心引导对挖掘(CPM)损失函数来促使DEE模块专注于利用多样化的特征表示进行学习。如图1所示,通过利用生成的包含多样化信息的嵌入,所提出的DEE模块能够借助更多样化的嵌入来提升性能。所提出的多级特征聚合(MFA)模块可以聚合来自不同阶段的特征,以挖掘潜在的通道层面和空间层面的特征表示,这增强了网络挖掘不同层次多样化嵌入的能力。

此外,我们注意到现有的可见光-红外行人重识别(VIReID)数据集是在光照充足的环境下采集的。然而,VIReID方法的性能可能会受到剧烈的光照变化或低光照条件的严重影响。因此,我们收集了一个具有挑战性的低光照跨模态数据集,称为LLCM数据集,如图2所示。与其他VIReID数据集相比,LLCM数据集包含了更多的行人身份,并且其中的图像是在低光照场景下采集的,这为现实世界中的VIReID任务带来了更多的挑战。

综上所述,主要贡献如下:

  • 我们提出了一种新颖的多样化嵌入扩展(DEE)模块,该模块结合中心引导对挖掘(CPM)损失函数,能够生成更多的嵌入,以便学习多样化的特征表示。在可见光-红外行人重识别(VIReID)领域中,我们是首次在嵌入空间中对嵌入进行增强的。此外,我们还提出了一种有效的多级特征聚合(MFA)模块,用于挖掘潜在的通道层面和空间层面的特征表示。
  • 通过将多样化嵌入扩展(DEE)模块、中心引导对挖掘(CPM)损失函数以及多级特征聚合(MFA)模块整合到一个端到端的学习框架中,我们提出了一种有效的多样化嵌入扩展网络(DEEN),该网络能够有效地减小可见光(VIS)图像与红外(IR)图像之间的模态差异。
  • 我们收集了一个低光照跨模态(LLCM)数据集,该数据集包含在光照变化和低光照环境下采集的1064个行人身份的46767张图像。LLCM数据集具有更多新颖且重要的特征,这有助于可见光-红外行人重识别(VIReID)朝着实际应用方向的研究。
  • 大量实验表明,在三个具有挑战性的数据集上,针对可见光-红外行人重识别(VIReID)任务,所提出的多样化嵌入扩展网络(DEEN)优于其他最先进的方法。

2.相关工作

一般来说,在可见光-红外行人重识别(VIReID)领域中主要有两类方法:图像层面的方法和特征层面的方法。

图像层面的可见光-红外行人重识别(VIReID)方法试图将一种模态转换为另一种模态,以减少图像空间中可见光(VIS)图像与红外(IR)图像之间的模态差异。为此,一些基于生成对抗网络(GANs)的方法[4, 28, 29, 32]被提出来,用于执行保持身份的行人图像风格转换,以对齐跨模态图像并缓解数据有限的问题。这些方法通常会设计复杂的生成模型来对齐跨模态图像。然而,由于缺乏可见光-红外图像对,生成的图像不可避免地会伴随一些噪声。X模态方法[14]及其变体[34, 49]应用了一个轻量级网络来引入一种辅助的中间模态,以辅助跨模态检索任务。但是,这种中间模态与可见光/红外模态之间仍然存在模态差异。

将一种模态转换成另一种模态,就是将红外图像变成可见光图像,或者把可见光图像变成红外图像,从而减小模态差异。

GANs是生成对抗网络(Generative Adversarial Networks)的缩写,GANs主要用于生成逼真的新样本,在这里的主要作用就是用于数据增强

特征层面的方法旨在找到一个模态共享且具有特定模态特征的空间,在这个空间中模态差异可以被最小化。为此,多模态注意力融合网络(MAUM)[15]尝试在两个单向方向上学习跨模态度量,并通过基于记忆的增强方法进一步强化这些度量。残差特征匹配网络(RFM)[25]引入了一个跨中心损失函数,以探索更紧凑的类内分布。深度互补学习网络(DCLNet)[23]促使具有相同语义信息的正样本像素相互靠近,同时将负样本像素推开。跨模态生成对抗网络(cmGAN)[5]设计了一个先进的判别器,用于从不同模态中学习具有判别性的表示。然而,可见光(VIS)图像与红外(IR)图像之间巨大的模态差异使得直接将跨模态图像投影到一个公共空间中变得困难[7,18,21,26] 。

特征层面的方法,就是通过模型提取同一对象的可见光图像和红外图像的特征,特征的分布能尽量接近。

3.方法

图3. 所提出网络的流程,该网络包含一个多样化嵌入扩展(DEE)模块和一个多级特征聚合(MFA)模块。多样化嵌入扩展(DEE)模块能够利用一种新颖的中心引导对挖掘(CPM)损失函数生成更多的嵌入,以学习多样化的特征表示。多级特征聚合(MFA)模块可以聚合来自不同阶段的嵌入,从而挖掘多样化的通道层面和空间层面的特征表示。

图的上半部分展示了多样化嵌入扩展网络(DEEN)总体模型设计,呈现输入图像经各阶段处理到嵌入空间及相关损失函数作用的流程;下半部分分别展示了多样化嵌入扩展模块(Diverse Embedding Expansion Module)和多阶段特征聚合块(Multistage Feature Aggregation Block )这两种模块的设计细节 。

在前三个阶段,采用Backbone block和MFA block叠加,第四个阶段增加了DEE module,第五个阶段只用backbone block。经过 Stage - 4 后,特征图通过全局平均池化(GAP)和批量归一化(BN)处理,被映射到嵌入空间(Embedding Space)。在嵌入空间中,有多种损失函数(LceL_{ce}Lce​ 、LtriL_{tri}Ltri​ 、LcpmL_{cpm}Lcpm​ 、LortL_{ort}Lort​ )用于优化网络,它们分别从不同角度约束特征的学习。

3.1. 模型架构

图3展示了所提出的多样化嵌入扩展网络(DEEN)的总体架构,该网络采用双流ResNet-50网络[12, 44]作为主干网络。可见光-红外特征被输入到所提出的多样化嵌入扩展(DEE)模块中,以生成更多的嵌入。然后,我们提出了一种中心引导对挖掘(CPM)损失函数,使生成的嵌入尽可能多样化,以便学习到具有丰富信息的特征表示。此外,我们融入了一个有效的多级特征聚合(MFA)模块,用于聚合来自不同阶段的特征,以挖掘多样化的通道层面和空间层面的特征表示。在训练阶段,批量归一化(BN)层前后的所有特征都被输入到不同的损失函数中,以联合优化DEEN。

双流结构:该网络具有两个分支,即双流架构。通常一个分支处理可见光图像数据,另一个分支处理红外图像数据,这种设计可以同时利用不同模态图像的信息,有助于提高模型在跨模态任务(如可见 - 红外行人重识别)中的性能。 ResNet - 50 主体:每个分支都以 ResNet - 50 为基础架构。

3.2. 多样化嵌入扩展模块

所提出的多样化嵌入扩展(DEE)模块通过使用多分支卷积生成结构来生成更多的嵌入,以缓解训练数据不足的问题。具体而言,对于DEE的每个分支,我们首先使用三个不同膨胀率(1、2、3)的3×3膨胀卷积层φ3×31\varphi_{3 ×3}^{1}φ3×31​ 、φ3×32\varphi_{3 ×3}^{2}φ3×32​ 、φ3×33\varphi_{3 ×3}^{3}φ3×33​ ,将特征图fff的数量减少到其自身大小的四分之一,然后将它们合并为一个特征图来获得新的特征图,接着通过一个ReLU激活层FReLUF_{ReLU}FReLU​ 来提高DEE的非线性表示能力。然后,对得到的特征图应用另一个核大小为1×1的卷积层θ1×1\theta_{1 ×1}θ1×1​ ,将其维度变为与fff相同。因此,第iii个分支生成的嵌入f+if_{+}^{i}f+i​ 可以写成如下形式:

f+i=θ1×1(FReLU(φ3×31(f)+φ3×32(f)+φ3×33(f))).(1)f_{+}^{i}=\theta_{1 × 1}\left(F_{R e L U}\left(\varphi_{3 × 3}^{1}(f)+\varphi_{3 × 3}^{2}(f)+\varphi_{3 × 3}^{3}(f)\right)\right) . (1)f+i​=θ1×1​(FReLU​(φ3×31​(f)+φ3×32​(f)+φ3×33​(f))).(1)

然后,将所有生成的嵌入连接在一起,并用作主干网络下一阶段的输入。

膨胀卷积在标准卷积的基础上,通过在卷积核的元素之间插入空格(即 “空洞”)来增加卷积核的感受野,而不增加参数数量和计算量。具体来说,普通卷积核的每个元素在进行卷积操作时是紧密相连的,而膨胀卷积核的元素之间有一定的间隔,这个间隔由膨胀率(dilation rate)来控制。例如,膨胀率为 2 时,卷积核的每个元素之间会插入一个空格,使得卷积核在进行卷积操作时能够覆盖更大的区域,从而扩大了感受野。

3.3. 中心引导对挖掘损失函数

从上述操作中我们可以看出,多样化嵌入扩展(DEE)模块仅能通过使用多分支卷积模块来生成更多的嵌入。然而,这种操作并不能有效地获取多样化的嵌入。因此,我们采用以下三个特性来尽可能地约束所生成的嵌入,使其具有多样性,从而有效地减小可见光(VIS)图像与红外(IR)图像之间的模态差异:

特性1:生成的嵌入应该尽可能多样化,以便有效地学习到具有丰富信息的特征表示。这意味着我们需要增大生成的嵌入与原始嵌入之间的距离,从而学习多样化的特征,并挖掘多样化的跨模态线索。

这个就是希望通过DEEN生成的特征的距离要和原始的特征的距离尽量远

特性2:生成的嵌入应当有助于减小可见光(VIS)图像与红外(IR)图像之间的模态差异。这意味着我们需要拉近由可见光模态生成的嵌入与原始红外嵌入之间的距离。同样地,我们也需要拉近由红外模态生成的嵌入与原始可见光嵌入之间的距离。

让同一可见光样本的生成图像的特征和红外样本的原始特征的距离尽量的小

特性3:类内距离应该小于类间距离。根据特性2,它拉近了生成的嵌入与原始嵌入之间的距离,这可能会导致不同类别的嵌入变得接近。因此,有必要保持类内距离小于类间距离。

这个是基本的条件,同一类的样本之间的特征的距离应该要小于不同类的样本之间的特征的距离。

图4. 所提出的用于多样化嵌入扩展(DEE)模块的中心引导对挖掘(CPM)损失函数的图示。

如图4所示,对于由可见光(VIS)模态生成的嵌入,中心引导对挖掘(CPM)损失函数可以表示为如下形式:

L(fv,fn,fv+i)=[D(fnj,fv+i,j)−D(fvj,fv+i,j)−D(fvj,fvk)]+,(2)\mathcal{L}\left(f_{v}, f_{n}, f_{v+}^{i}\right)=\left[D\left(f_{n}^{j}, f_{v+}^{i, j}\right)-D\left(f_{v}^{j}, f_{v+}^{i, j}\right)-D\left(f_{v}^{j}, f_{v}^{k}\right)\right]_{+}, (2)L(fv​,fn​,fv+i​)=[D(fnj​,fv+i,j​)−D(fvj​,fv+i,j​)−D(fvj​,fvk​)]+​,(2)

其中,D(⋅,⋅)D(\cdot, \cdot)D(⋅,⋅) 表示两个嵌入之间的欧几里得距离。fvf_{v}fv​ 和 fnf_{n}fn​ 分别是来自可见光和红外(IR)模态的原始嵌入,fv+if_{v+}^{i}fv+i​ 是由可见光模态的第 iii 个分支生成的嵌入。jjj、kkk 是一个小批量数据中的不同身份,并且 [z]+=max⁡(z,0)[z]_{+}=\max (z, 0)[z]+​=max(z,0)。在公式(2)中,第一项可以将生成的嵌入 fv+if_{v+}^{i}fv+i​ 拉向原始红外模态的嵌入 fnf_{n}fn​,以减小 fv+i,jf_{v+}^{i, j}fv+i,j​ 与 fnjf_{n}^{j}fnj​ 之间的模态差异。第二项可以将生成的嵌入 fv+f_{v+}fv+​ 推离可见光模态的嵌入 fvf_{v}fv​,使 fv+f_{v+}fv+​ 能够学习到具有丰富信息的特征表示。第三项可以使类内距离小于类间距离。

这里的这三项,其实就对应了前面提到的三个特点。第一式对应了第二点,第二式对应了第一点,第三式对应了第三点。

然后,我们使用每个类别的嵌入中心 ccc 和 cnc_{n}cn​,让生成的嵌入中心 cv+ic_{v +}^{i}cv+i​ 和 cn+ic_{n +}^{i}cn+i​ 更具区分性,并引入一个间隔项 α\alphaα 来平衡公式 (2) 中的三项。因此,对于来自可见光(VIS)模态的嵌入,中心引导对挖掘(CPM)损失函数的公式如下:

L(cv,cn,cv+i)=[D(cnj,cv+i,j)−D(cvj,cv+i,j)−D(cvj,cvk)+α]+.\mathcal{L}\left(c_{v}, c_{n}, c_{v+}^{i}\right)=\left[D\left(c_{n}^{j}, c_{v+}^{i, j}\right)-D\left(c_{v}^{j}, c_{v+}^{i, j}\right)-D\left(c_{v}^{j}, c_{v}^{k}\right)+\alpha\right]_{+} .L(cv​,cn​,cv+i​)=[D(cnj​,cv+i,j​)−D(cvj​,cv+i,j​)−D(cvj​,cvk​)+α]+​.

和前面的式子一样,不过替换成了可见光图像聚类中心

同样地,对于由红外(IR)模态生成的嵌入的类中心cn+ic_{n+}^{i}cn+i​,我们有:

L(cv,cn,cn+i)=[D(cvj,cn+i,j)−D(cnj,cn+i,j)−D(cnj,cnk)+α]+.\mathcal{L}\left(c_{v}, c_{n}, c_{n+}^{i}\right)=\left[D\left(c_{v}^{j}, c_{n+}^{i, j}\right)-D\left(c_{n}^{j}, c_{n+}^{i, j}\right)-D\left(c_{n}^{j}, c_{n}^{k}\right)+\alpha\right]_{+} .L(cv​,cn​,cn+i​)=[D(cvj​,cn+i,j​)−D(cnj​,cn+i,j​)−D(cnj​,cnk​)+α]+​.

因此,最终的中心引导对挖掘(CPM)损失函数可以表示为如下形式:

Lcpm=L(cv,cn,cv+i)+L(cv,cn,cn+i).(5)\mathcal{L}_{c p m}=\mathcal{L}\left(c_{v}, c_{n}, c_{v+}^{i}\right)+\mathcal{L}\left(c_{v}, c_{n}, c_{n+}^{i}\right) . (5)Lcpm​=L(cv​,cn​,cv+i​)+L(cv​,cn​,cn+i​).(5)

此外,为了确保来自不同分支的生成嵌入能够捕捉到不同的具有信息性的特征表示,我们强制使不同分支生成的这些不同嵌入相互正交,以最小化重叠元素。因此,正交损失函数可以表示如下:

Lort=∑m=1i−1∑n=m+1i(f+mTf+n),\mathcal{L}_{ort }=\sum_{m = 1}^{i - 1}\sum_{n = m + 1}^{i}(f_{+}^{mT}f_{+}^{n}),Lort​=∑m=1i−1​∑n=m+1i​(f+mT​f+n​),

核心思想是使不同类别或不同任务相关的特征向量在特征空间中尽可能相互正交。在向量空间里,正交意味着向量之间的内积为 0 ,表示它们在方向上相互独立。通过在损失函数中加入对特征正交性的约束项,引导模型在训练过程中让不同类别的特征分布更加分离,减少特征间的混淆 。比如在多分类任务中,让属于不同类别的样本所对应的特征向量在特征空间中方向差异尽可能大,这样模型就能更容易区分不同类别。

其中,mmm和nnn分别是由原始嵌入生成的第mmm个和第nnn个嵌入。正交损失函数能够促使生成的嵌入学习到更多具有信息性的特征表示。

3.4. 多阶段特征聚合模块

不同层级的特征聚合已被证明对语义分割、分类和检测任务有帮助[1,54,55]。为了聚合来自不同阶段的特征,以挖掘多样化的通道层面和空间层面的特征表示,受文献[31]的启发,我们融入了一个有效的通道-空间多阶段特征聚合(MFA)模块来聚合多阶段特征。

接下来,我们详细介绍图 3 所示的多阶段特征聚合(MFA)模块。具体而言,对于主干网络每个阶段的通道 - 空间聚合模块,我们考虑两种类型的源特征:该阶段之前的低层次特征图 fl∈RCˉl×Hl×Wlf_{l} \in \mathbb{R}^{\bar{C}_{l} \times H_{l} \times W_{l}}fl​∈RCˉl​×Hl​×Wl​ 以及该阶段之后的高层次特征图 fh∈RCh×Hh×Whf_{h} \in \mathbb{R}^{C_{h} \times H_{h} \times W_{h}}fh​∈RCh​×Hh​×Wh​ ,其中 CCC、WWW 和 HHH 分别表示特征的通道数、宽度和高度。

首先,我们使用三个 1×11\times11×1 卷积层 ψq1\psi_{q}^{1}ψq1​、ψv1\psi_{v}^{1}ψv1​、ψk1\psi_{k}^{1}ψk1​ 将特征转换为三个紧凑的嵌入:ψq1(fh)\psi_{q}^{1}(f_{h})ψq1​(fh​)、ψv1(fl)\psi_{v}^{1}(f_{l})ψv1​(fl​) 和 ψk1(fl)\psi_{k}^{1}(f_{l})ψk1​(fl​) 。然后,我们通过矩阵乘法并应用 Softmax 函数来计算通道维度的相似度矩阵 Mc∈RC′×C′M^{c} \in \mathbb{R}^{C' \times C'}Mc∈RC′×C′ ,公式如下:

Mc=Fsoftmax(ψq1(fh)×ψk1(fl)).(7)M^{c}=F_{softmax }\left(\psi_{q}^{1}\left(f_{h}\right) \times \psi_{k}^{1}\left(f_{l}\right)\right) . (7)Mc=Fsoftmax​(ψq1​(fh​)×ψk1​(fl​)).(7)

因此,我们通过对ψv1(fl)\psi_{v}^{1}(f_{l})ψv1​(fl​)和McM^{c}Mc进行矩阵乘法来恢复通道维度,从而实现通道层面的多阶段特征聚合。在此之后,应用另一个1×11\times11×1卷积层ωc\omega^{c}ωc,将上述特征图的大小变换为fhf_{h}fh​的大小。最后,我们通过矩阵加法将fhf_{h}fh​与变换后的特征图相加,得到输出结果:

fhc=ωc(ψv1(fl)×Mc)+fh.(8)f_{h}^{c}=\omega^{c}\left(\psi_{v}^{1}\left(f_{l}\right) × M^{c}\right)+f_{h} . (8)fhc​=ωc(ψv1​(fl​)×Mc)+fh​.(8)

在那之后,将上述操作得到的fhcf_{h}^{c}fhc​与低层次特征图flf_{l}fl​用于执行空间特征聚合操作,这与通道层面的多阶段特征聚合操作类似。最后,我们得到多阶段特征聚合(MFA)模块的输出如下:

fhs=ωs(ψv2(fl)×Ms)+fhc,f_{h}^{s}=\omega^{s}\left(\psi_{v}^{2}\left(f_{l}\right) × M^{s}\right)+f_{h}^{c},fhs​=ωs(ψv2​(fl​)×Ms)+fhc​,

其中ωs\omega^{s}ωs和ψv2\psi_{v}^{2}ψv2​是两个1×11\times11×1卷积层,MsM^{s}Ms是空间相似度矩阵。

4.LLCM数据集

图5. 低光照条件监控(LLCM)图像在二维空间中的分布情况。可以看出,不同光照条件下的图像呈现出不同的风格,这进一步增大了可见光(VIS)图像与红外(IR)图像之间的模态差异。

这个数据集重点强调了可见光和红外图像的模态差异,从而带来挑战带来更好的训练效果

4.1. 数据集描述

表1. LLCM数据集与另外两个常用的可见光与红外行人重识别(VIReID)数据集的对比。

在本文中,我们收集了一个新的具有挑战性的低光照跨模态数据集,称为低光照跨模态(LLCM)数据集。LLCM数据集使用了部署在低光照环境中的一个九摄像头网络,该网络能够在白天捕获可见光(VIS)图像,在夜间捕获红外(IR)图像。为了保护个人隐私信息,我们使用多任务级联卷积神经网络(MTCNN)[47]来获取人脸的边界框,并对这些区域进行模糊处理。我们确保每个已标注身份的人都同时被可见光摄像头和红外摄像头拍摄到。LLCM数据集中的一些示例见图2。如表1所示,与现有的可见光与红外行人重识别(VIReID)数据集相比,LLCM数据集具有以下新的重要特征:

首先,LLCM数据集中的图像是在复杂的低光照环境下同时为可见光(VIS)和红外(IR)模态所捕获的,其中包含了剧烈的光照变化,这是现实场景中常见的问题。如图2和图5所示,恶劣的光照条件会改变人物衣服的颜色,并导致衣服纹理信息的丢失,这给可见光与红外行人重识别(VIReID)带来了巨大挑战。其次,LLCM数据集拥有更多的身份和边界框。该数据集包含1064个身份的46767个边界框,使其成为目前最大的可见光与红外行人重识别数据集(见表1)。第三,LLCM数据集是从1月到4月历时100多天收集而来的,并且考虑了不同的气候条件和服装风格。长期的数据收集有助于研究不同气候和服装风格下的可见光与红外行人重识别任务,这提高了可见光与红外行人重识别模型的泛化能力。

此外,考虑到实际应用场景,LLCM数据集还包含许多面临各种挑战的图像,例如运动模糊、姿态变化、相机视角改变、遮挡、低分辨率以及其他问题。总而言之,LLCM数据集对于可见光与红外行人重识别(VIReID)任务而言是一个具有挑战性的数据集,它能够进一步推动可见光与红外行人重识别技术朝着实际应用方向的研究发展。

我接下来要收集的数据集或许可以将重点放在遮挡上

4.2. 评估方案

我们将LLCM数据集按照大约2:1的比例划分为训练集和测试集。训练集包含713个身份的30,921个边界框(其中16,946个边界框来自可见光模态,13,975个边界框来自红外模态),测试集包含351个身份的13,909个边界框(其中8,680个边界框来自可见光模态,7,166个边界框来自红外模态)。与RegDB[19]数据集类似,从可见光到红外模式以及从红外到可见光模式都被用于评估可见光与红外行人重识别(VIReID)模型的性能。在测试阶段,对于每个摄像头,我们从每个身份的图像中随机选择一张图像来组成用于评估模型性能的图库集。我们对图库集进行随机划分并重复上述评估10次,然后报告平均性能。

5.实验

5.1. 数据集

SYSU-MM01数据集[36]包含由4个可见光(VIS)摄像头和2个红外(IR)摄像头拍摄的491个身份的图像,包括全搜索模式和室内搜索模式。在全搜索模式下,所有可见光摄像头拍摄的所有图像都用作图库集。在室内搜索模式下,只有两个室内可见光摄像头拍摄的图像被用作图库集。RegDB数据集[19]由412个身份组成,每个身份有由一对重叠摄像头拍摄的10张可见光图像和10张红外图像。

全搜索模式:在这种模式下,图库集包含从四个 RGB 相机(相机 1、2、4 和 5)采集的所有可见图像,查询集包含从红外相机 3 和 6 捕获的图像。此模式下,模型需要在所有的 RGB 图像中搜索与红外查询图像相匹配的行人,搜索范围涵盖了室内和室外的图像,场景较为复杂,挑战性较大。 室内搜索模式:图库集仅包含由两个室内 RGB 相机(相机 1 和 2)采集的样本,查询集同样是红外相机 3 和 6 采集的图像。由于图库集只涉及室内图像,场景相对单一,数据的变化范围较小,所以该模式的挑战性相对全搜索模式较小。

5.2. 实现细节

首先将所有输入图像调整大小为3×384×1443×384×1443×384×144,并且在训练阶段采用随机水平翻转和随机擦除[53]技术。初始学习率设置为1×10−21×10^{-2}1×10−2,然后在经过10个训练轮次并采用预热策略后,将其提升至1×10−11×10^{-1}1×10−1。在此之后,我们在第20个训练轮次时将学习率衰减至1×10−21×10^{-2}1×10−2,并分别在第60个训练轮次和第120个训练轮次时进一步衰减至1×10−31×10^{-3}1×10−3和1×10−41×10^{-4}1×10−4 ,直至总共完成150个训练轮次。在每个小批次中,我们随机选择6个身份的4张可见光(VIS)图像和4张红外(IR)图像用于训练。采用随机梯度下降(SGD)优化器进行训练,其中动量设置为0.90.90.9。对于RegDB数据集,我们移除第4阶段,并将所提出的DEE模块插入到第2阶段之后的DEEN中。

5.3. 与最先进(前沿)方法的比较

表2. 所提出的DEEN方法与一些最先进的方法在SYSU-MM01和RegDB数据集上的比较。

我们首先将所提出的深度跨模态嵌入网络(DEEN)与几种最先进的方法进行比较,以证明我们方法的优越性。在SYSU-MM01和RegDB数据集上的实验结果见表2,在我们的LLCM数据集上的实验结果见表3。

SYSU-MM01和RegDB数据集:从表2中我们可以看到,在这两个数据集上的结果表明,所提出的DEEN与所有其他最先进的方法相比,取得了最佳性能。具体而言,在SYSU-MM01数据集的全搜索模式下,DEEN的首位命中率(Rank-1 accuracy)达到了74.7%,平均精度均值(mAP)达到了71.8%。在室内搜索模式下,DEEN的首位命中率达到了80.3%,平均精度均值达到了83.3%。在RegDB数据集的从可见光(VIS)到红外(IR)模式下,DEEN的首位命中率达到了91.1%,平均精度均值达到了85.1%。在从红外到可见光模式下,所提出的DEEN也获得了89.5%的首位命中率和83.4%的平均精度均值。这些结果验证了我们方法的有效性。此外,这些结果还表明,所提出的DEEN能够有效地减少可见光和红外模态之间的模态差异。

表3. 各竞争方法在我们的LLCM数据集上所取得的性能表现。符号“*”表示我们使用随机擦除技术复现的方法。

LLCM数据集:表3展示了在我们的LLCM数据集上的实验结果。在这里,我们使用了几种具有代表性的开源方法来评估我们的LLCM数据集,并将它们与我们的方法进行比较。从表3中我们可以得出以下结论:在从红外(IR)到可见光(VIS)模式下,最佳方法也仅获得了54.9%的首位命中率(Rank-1 accuracy)和62.9%的平均精度均值(mAP)。现有方法在我们的LLCM数据集上的结果总体上并不令人满意。这表明,一方面,我们的LLCM数据集是一个极具挑战性的数据集。另一方面,光照的变化对可见光与红外行人重识别(VIReID)模型有严重影响。此外,所提出的DEEN在从可见光到红外模式以及从红外到可见光模式下均取得了最佳性能,这证明了所提出的DEEN在减少可见光和红外图像之间的模态差距方面的有效性。

5.4. 消融实验研究

表4. 各组件对所提出的深度跨模态嵌入网络(DEEN)性能的影响。

各组件的有效性:为了评估DEEN中每个组件的作用,我们在LLCM和SYSU-MM01数据集上进行了一些消融实验,通过从DEEN中移除特定模块来评估其对性能的影响。整体设置保持不变,只是将正在评估的模块添加到DEEN中或从DEEN中移除。如表4所示,尽管DEE模块可以使用多分支卷积块生成更多的嵌入,这略微提高了基线模型的性能,但结果并不理想。在受到所提出的CPM损失约束以生成多样化的嵌入后,DEE可以大幅提升模型的性能,并有效减少可见光(VIS)和红外(IR)图像之间的模态差异。此外,所提出的MFA模块可以通过聚合不同阶段的特征来挖掘多样化的通道和空间特征表示,从而提高基线模型的性能。通过将DEE、CPM和MFA纳入到一个端到端的学习框架中,DEEN在两个具有挑战性的可见光与红外行人重识别(VIReID)数据集上实现了显著的性能提升,这表明DEE和MFA可以相互促进,生成多样化的嵌入。

上面的消融实验用来验证了各个模块的有效性

表5. 在ResNet - 50的哪个阶段插入DEE模块的影响。

在ResNet-50的哪个阶段插入DEE模块所产生的影响。所提出的DEE模块可以插入到主干网络的任何一个阶段之后。在我们的实验中,我们使用ResNet-50作为主干网络,它有五个阶段:stage0到stage-4。我们将DEE插入到ResNet-50的不同阶段之后,以研究这将如何影响DEEN的性能。如表5所示,当DEE插入到stage-0到stage-3之后时,性能逐渐提升,这表明在网络的更深层中,模态差距变得更小,并且DEE的生成能力变得更强。当DEE插入到stage-3之后时,它在LLCM和SYSU-MM01两个数据集上都能取得最佳结果。然而,当DEE插入到stage-4之后时,性能会迅速下降,因为CPM损失直接作用于嵌入向量,增大了生成的嵌入向量与原始嵌入向量之间的距离,这增加了模型优化的难度。基于以上分析,如果没有特别说明,我们会将DEE插入到主干网络的stage-3之后。

有五个阶段是因为resnet-50有五个阶段,这个实验用来测试哪个阶段插入DEEN模块更合适

表6. 关于DEE适合多少个分支的研究。

关于多少个分支更适合DEE的有效性研究。所提出的DEE模块利用多分支卷积块来生成多样化的嵌入。在此,我们研究多少个分支适合DEE。如表6所示,随着DEE的分支数量从2增加到3,会生成更多的嵌入来减小模态差距,因此性能逐渐提升。然而,当分支数量超过3时,性能提升存在上限,因为DEE会生成过多冗余特征,这导致性能下降。结果是,具有三个分支的DEE在LLCM和SYSU-MM01数据集上都能取得最佳性能。这表明具有3个分支的DEE更适合生成多样化的嵌入。因此,如果没有特别说明,我们会为DEE使用3个分支。

这个实验找到了DEE模块的最佳分支数量

表7. 与非局部(NL)模块的比较。

与非局部(Non-Local)模块的比较。在本文中,受文献[31]中非局部(NL)模块的启发,我们提出了一个多特征聚合(MFA)模块,用于挖掘多样化的通道和空间特征表示。因此,我们对这两个模块进行比较,以探究哪个模块更有效。如表7所示,MFA模块在首位命中率(Rank1 accuracy)上比NL模块高出1.1%,在平均精度均值(mAP)上比NL模块高出2.2%。这些结果验证了我们的MFA模块的有效性。此外,结果还表明,MFA模块和DEE模块在生成多样化的嵌入以减小可见光(VIS)和红外(IR)图像之间的模态差距方面是相辅相成的。

图6. 不同的λ1\lambda_{1}λ1​、λ2\lambda_{2}λ2​和α\alphaα值对我们的LLCM数据集的影响。

超参数λ1\lambda_{1}λ1​、λ2\lambda_{2}λ2​和α\alphaα的影响。为了评估这三个超参数的影响,我们进行了定量比较,并在图6中报告了结果。正如我们所看到的,当λ1\lambda_{1}λ1​分别设置为0.80.80.8、λ2\lambda_{2}λ2​设置为0.10.10.1且α\alphaα设置为0.20.20.2时,能够取得最佳性能。

5.5. 可视化

图7. (a-e)展示了跨模态特征的类内距离和类间距离。类内距离和类间距离分别用蓝色和绿色表示。(f-j)展示了特征嵌入在二维特征空间中的分布情况,其中不同颜色的圆形和三角形分别代表可见光和红外模态。从测试集中总共选取了20个人。颜色相同的样本来自同一个人。“圆点”和“叉号”标记分别表示来自可见光和红外模态的图像。

特征分布。为了探究DEEN有效的原因,我们在我们的LLCM数据集上对类间距离和类内距离进行了可视化,如图7(a-e)所示。将图7(c-e)与图7(a-b)进行比较,类间距离和类内距离的均值(即垂直线)被MFA、DEE和DEEN拉大了,其中δ1<δ2<δ3\delta_{1}<\delta_{2}<\delta_{3}δ1​<δ2​<δ3​且δ1<δ2<δ4<δ5\delta_{1}<\delta_{2}<\delta_{4}<\delta_{5}δ1​<δ2​<δ4​<δ5​ 。这表明,与初始特征的类内距离(图7(a))和基线特征的类内距离(图7(b))相比,DEEN的类内距离显著减小。因此,DEEN能够有效地减少可见光(VIS)图像和红外(IR)图像之间的模态差异。同时,我们还使用t-SNE[27]在二维特征空间中对特征分布进行了可视化,如图7(f-j)所示,这表明MFA、DEE和DEEN能够有效地辨别并聚合同一个人的特征嵌入,并减少模态差异。

图8. 基线方法和所提出的DEEN在我们的LLCM数据集上得到的一些前8名检索结果。

检索结果。为了进一步展示DEEN的有效性,我们还在图8中展示了DEEN在我们的LLCM数据集上的一些检索结果。对于每个检索案例,带有绿色框的检索图像表示与给定查询相对应的正确匹配项,而带有红色框的图像则表示错误匹配项。总体而言,与基线方法相比,DEEN能够有效地改善排名结果,使更多正确匹配的图像排在靠前的位置。

6.结论

在本文中,我们针对可见光与红外行人重识别(VIReID)任务,在嵌入空间中提出了一种新颖的多样化嵌入扩展网络(DEEN)。所提出的DEEN能够生成多样化的嵌入,并挖掘多样化的通道和空间嵌入,以学习具有丰富信息的特征表示,从而减少可见光(VIS)图像和红外(IR)图像之间的模态差异。此外,我们还提供了一个具有挑战性的低光环境跨模态(LLCM)数据集,该数据集具有更多新的重要特征,能够进一步推动可见光与红外行人重识别(VIReID)在实际应用方面的研究。在SYSU-MM01、RegDB和LLCM数据集上进行的大量实验表明,所提出的DEEN优于其他几种最先进的方法。

7. 致谢

这项工作得到了中国国家重点研发计划的资助(项目编号:2022ZD0160402)、国家自然科学基金的资助(项目编号:U21A20514),以及福夏泉国家自主创新示范区协同创新平台项目的资助(项目编号:3502ZCQXT2022008)。

评论
0/100