论文Augmented Dual-Contrastive Aggregation Learning for Unsupervised Visible-Infrared Person Re-Identification发布于 2022 年 10 月 10 - 14 日的第 30 届 ACM 国际多媒体会议(MM ’22)。
摘要
可见光-红外行人重识别(VI-ReID)旨在从其他光谱相机捕获的图像库中搜索出对应的红外(可见光)图像。最近的研究主要集中在有监督的VI-ReID方法上,这些方法需要大量的跨模态(可见光-红外)身份标签,而获取这些标签的成本要高于单模态行人重识别中的标注成本。对于无监督学习的可见光-红外重识别(USL-VI-ReID)而言,较大的跨模态差异导致在没有任何标注的情况下,难以生成可靠的跨模态标签,也难以学习模态不变特征。为了解决这个问题,我们提出了一种新颖的增强双对比聚合(ADCA)学习框架。具体来说,我们提出了一种带有两个模态特定记忆的双路径对比学习框架,用于学习模态内的行人表征。为了关联正的跨模态身份,我们设计了一个具有计数优先级的跨模态记忆聚合模块,以选择高度相关的正样本,并在聚类级别聚合它们相应的记忆特征,确保优化过程明确聚焦于与模态无关的视角。大量实验表明,我们提出的ADCA在各种设置下都显著优于现有的无监督方法,甚至超过了一些有监督方法,有助于推动VI-ReID在实际中的应用部署。代码可在https://github.com/yangbincv/ADCA获取。
一、介绍
行人重识别(ReID)旨在跨不同摄像头匹配同一个人的图像[14, 17]。近年来,由于行人重识别在智能视频监控应用中的重要性,它受到了越来越多的关注[21, 36, 48]。然而,现有的大多数技术都针对白天可见光摄像头采集的人物图像,在光线条件较差的情况下,这些技术无法获取足够的人物信息,这限制了单模态行人重识别在实际监控中的应用[22, 38]。为了解决这一问题,跨模态的可见光 - 红外行人重识别(VI-ReID)技术应运而生,该技术用于匹配由可见光摄像头和红外(包括近红外[41]和远红外(热红外)[28])摄像头拍摄的人物图像。一些深度学习方法已对VI-ReID进行了初步尝试,以学习模态共享的特征表示[11, 18, 40, 43, 46]。然而,训练VI-ReID模型需要大量的跨模态(可见光-红外)身份标注,其获取成本比单模态行人重识别的标注更高,这使得有监督的VI-ReID方法在实际部署中的可扩展性较差。
基于上述动机,本文研究了具有挑战性的无监督学习可见光-红外行人重识别任务,即USL-VIReID。该任务旨在从未标注的可见光-红外数据集中学习模态不变知识,并匹配可见光和红外相机拍摄的同一人的图像。与现有的如H2H[24]这类无监督行人重识别工作不同,我们的工作在预训练过程中不使用任何标注数据集,却能实现更高的准确率。
当前最先进的方法通过对比学习来解决无监督单模态行人重识别(USL-ReID)问题[2, 16, 33, 35]。具体来说,它们构建一个包含所有身份特征的记忆模块。通过聚类算法为每个训练图像分配一个伪ID。在训练过程中,最小化训练数据特征与记忆模块之间的对比损失,以此训练特征提取器来学习良好的特征表示。这种基于伪标签的无监督学习流程在单模态USL行人重识别上取得了良好的效果。然而,对于无监督的可见光 - 红外行人重识别(USL-VI-ReID)而言,可见光相机和红外相机之间的差异导致了较大的跨模态差异,这使得生成正的跨模态标签变得困难。这无疑限制了跨两种模态检索同一人的性能。
图1:无监督可见光-红外行人重识别(USL-VI-ReID)主要思路示意图。五角星代表可见光样本,带虚线的五角星表示增强后的可见光样本。立方体表示红外样本。较大的模态差异阻碍了跨不同模态对同一人的检索。无监督联合同质学习和异质聚合在没有任何注释的情况下,在可见光和红外模态之间架起了一座桥梁。为应对无监督可见光-红外行人重识别(USL-VI-ReID)中的挑战,我们提出了一种无监督同构联合学习和异构聚合的解决方案。其基本原理是,我们可以进行无监督同构学习以捕捉模态内特征,同时使用像通道增强(CA)[46]这样强大的颜色增强方法来弥合可见光模态和红外模态之间的差距,并且在跨模态标签关联时,考虑跨模态正样本对的异构聚合,如图1所示。
基于上述见解,我们从先前的双流有监督VI-ReID方法中获得启发,提出了一种新颖的增强双对比聚合(ADCA)学习框架。它构建了一个具有两个模态特定记忆的双流对比学习框架,用于学习模态内的行人表征。为确保模型的模态泛化能力,可见光流采用了随机通道增强的颜色增强方法[46]进行联合对比学习。为应对模态间的变化,我们设计了一个跨模态记忆聚合(CMA)模块,用于选择高度相关的正样本,并聚合它们相应的记忆特征,以进行跨模态对比学习。CMA确保优化过程明确聚焦于与模态无关的视角。其主要优势在于,CMA在记忆簇级别关联跨模态信息,使得跨模态标签关联能够紧密耦合到对比学习中。与样本对样本的关联方式相比,这形成了一种相互强化且高效的解决方案。
主要贡献总结如下:
- 我们为无监督可见光 - 红外行人重识别(USL-VI-ReID)提出了一种具有两个模态特定记忆模块的双流对比学习框架。为了学习颜色不变特征,可见光流采用了一种强大的随机通道增强颜色增强方法,作为连接红外模态进行联合对比学习的桥梁。
- 我们设计了一个跨模态记忆聚合(CMA)模块,以无参数的方式选择可靠的正样本并聚合相应的记忆表示,这使得双流框架能够更好地学习模态不变知识,同时强化每个对比学习流。
- 我们在SYSU-MM01和RegDB数据集上进行了大量实验,结果表明我们的方法在各种设置下均优于现有的无监督方法,甚至超过了一些有监督方法,为无监督可见光 - 红外行人重识别任务提供了新的基线,并显著推动了可见光 - 红外行人重识别在实际中的应用部署。
二、相关工作
2.1 有监督的可见光-红外行人重识别
可见光-红外行人重识别(VI-ReID)是一个具有挑战性的跨模态人物识别问题。最关键的技术在于缩小可见光和红外模态下同一类人物图像之间的巨大模态差距[6, 18, 31, 43-45, 47, 49]。文献[41]率先进行尝试,通过零填充单流网络直接利用灰度图像进行训练和测试。文献[37]提出了一种双级差异建模方法,借助生成对抗网络(GANs)的发展来生成跨模态图像,在像素层面消除差异。文献[42]引入了一种联合模态和模式对齐网络,用于发现不同模式下可见光-红外行人重识别中的跨模态细微差别。此外,文献[46]引入了通道增强(CA)方法,通过随机交换颜色通道来均匀生成与颜色无关的图像,以用于可见光-红外行人重识别。
上述有监督的可见光-红外行人重识别方法需要大量的跨模态身份标注,这阻碍了其在新场景中的快速部署。在这项工作中,我们研究了完全无监督的可见光-红外行人重识别(USL-VI-ReID)任务,该任务无需身份标注,对可见光-红外行人重识别在现实世界中的部署具有重要意义。
2.2 无监督单模态行人重识别
无监督单模态行人重识别大致可分为无监督域适应(UDA)和完全无监督学习(USL)两类。UDA方法又分为基于伪标签的方法[1, 10, 12, 15, 16, 30]和基于域转换的方法[3, 4, 39, 52, 54],其中基于伪标签的方法性能最优。但所有这些基于UDA的方法都需要一个有标签的源数据集。完全无监督学习行人重识别(USL ReID)方法在部署上更具灵活性[25, 26, 33]。CAP[35]设计了一种相机感知代理学习框架,将每个单聚类拆分为多个代理。Cluster Contrast[7]通过在聚类级别计算对比损失来保持聚类一致性。ICE[2]利用实例间成对相似性分数来改进先前的类级别对比行人重识别方法。然而,上述方法在没有任何跨模态注释的情况下,无法针对较大的模态差异学习到有效的模态无关知识。
2.3 无监督可见光-红外行人重识别
无监督可见光 - 红外行人重识别(USL-VI-ReID)问题存在两个挑战。第一,与单模态行人重识别不同,USL-VI-ReID存在较大的跨模态差异,这会导致较大的类内变化,使得生成可靠的跨模态标签变得困难。第二,在USL-VI-ReID中没有可用的跨模态(可见光 - 红外)身份标签,这导致难以直接学习模态不变的特征表示。H2H[24]首次进行尝试,设计了一种两阶段方法来解决USL-VI-ReID任务,包括同构学习和异构学习。然而,H2H[24]使用Market-1501数据集[51]作为额外的有标签RGB数据集进行预训练,这使得该方法在实际部署中的可扩展性较差。在我们的研究中没有身份标签可用,这使得在同时学习用于跨模态检索的判别性和模态不变表示时,任务更具挑战性。
三、方法
3.1 概述
图2:增强型双对比学习聚合框架。它由两个部分组成:增强型双对比(ADC)学习和跨模态记忆聚合(CMA)模块。ADC拥有一个双路径对比学习框架(一条路径用于可见光模态,另一条用于红外模态)。CMA采用计数优先选择策略来挑选可靠的正跨模态标签对,以便聚合两种特定模态的记忆。我们针对无监督可见光-红外行人重识别(USL-VI-ReID)提出了一种增强双对比聚合(ADCA)学习框架,如图2所示。我们的ADCA包含两个部分,即增强双对比(ADC)学习和跨模态记忆聚合(CMA)模块。在ADC中,利用两个特定模态的浅层来捕捉不同模态的特定模态信息。模态共享层专注于学习一个多模态可共享空间,以弥合两种异构模态之间的差距。然后,构建两个特定模态的记忆,通过对比学习挖掘每个模态内的类间和类内信息。为确保模态泛化能力,我们按照文献[46]采用随机通道增强作为可见光流的额外输入进行联合学习。为了进一步探索两种模态之间的相关性,我们设计了一个跨模态记忆聚合(CMA)模块,用于选择可靠的正跨模态标签对并聚合相应的记忆,以确保跨模态特征的可区分性。这两个模块相互强化。CMA模块使ADC框架能够学习更好的模态不变特征,而ADC的模态泛化能力使CMA能够更好地挖掘两种模态之间关联的知识。
3.2 增强型双对比学习框架
增强双对比(ADC)学习框架如图2顶部所示。ADC有两条输入路径。可见光图像以及通过随机通道增强(CA)[46]获得的其增强图像被输入到可见光路径中,用于学习可见光特定特征,同时能够学习颜色不变信息。红外图像被送入红外路径,以获取红外特定特征。最终的嵌入向量由共享层提取,用于学习模态可共享信息。两个特定模态的记忆通过动量策略进行更新。特征提取器的参数通过双对比学习进行更新。
文章中提到的 CA 即 Channel Augmentation(通道增强),是一种用于可见 - 红外行人重识别(VI - ReID)的方法,主要有以下两方面作用:
- 缩小模态差距:通过随机交换颜色通道,使生成的图像在颜色特征上更具一致性,从而减少可见模态和红外模态之间的差异,有助于模型学习到更通用的特征表示。在可见 - 红外行人重识别任务中,由于可见图像和红外图像的模态差异较大,CA 方法能够通过这种颜色通道的随机交换,在一定程度上使可见图像的颜色特征更接近红外图像,从而缩小模态间的差距。
- 学习颜色无关特征:使模型能够学习到与颜色无关的特征,增强模型对不同颜色变化的鲁棒性,提高在不同光照条件和颜色变化情况下的识别性能。对于可见图像,不同的光照条件会导致颜色信息的变化,这可能会干扰模型对行人身份的识别。而 CA 方法通过随机改变颜色通道,让模型学会忽略颜色的具体变化,专注于更关键的身份特征,从而提高识别的准确性和稳定性。
通过CA模块,从原始图像得到了近似于红外图像的增强图像。然后分别通过shallow layers提取到红外图像和可见光图像的信息。最后把提取到的信息送到共享层,共享层用于学习多模态的信息,以弥合两种模态之间的差异。
提取出来的特征被放入memory(这里采用动量更新),用于后续的对比学习,以更新特征提取器(两个shallow layers和一个shared layers)的参数。
为了便于描述我们的方法,我们首先介绍本文中使用的符号。
设表示包含个实例的红外图像集。
和分别表示包含个实例的可见光训练集和增强后的可见光训练集。
遵循通道增强(CA)方法[46]中的设置。
和分别表示由红外特征提取器和可见光特征提取器提取的相应特征。
和分别是由和提取的查询实例特征。
特定模态记忆初始化。两种特定模态记忆的初始化过程如图3所示。在每个训练周期开始时,红外和可见光模态的每个聚类的表示分别存储在红外和可见光记忆字典中,用于特定模态的记忆初始化。这个过程可以表示为: 其中表示红外或可见光模态中的第个聚类集合,表示每个聚类中的实例数量。
特定模态记忆更新。在训练过程中,我们从每个模态的训练集中为每个身份采样个人的身份以及个实例。然后,我们一批中总共得到张查询图像,其中包括红外、可见光以及增强后的可见光行人图像。我们通过动量更新策略来更新两个特定模态的记忆: 其中是增强后的查询实例特征。是动量更新因子。是迭代次数。
联合学习损失函数。在每次迭代中,特定模态的浅层和共享层通过三种类型的聚类对比(ClusterNCE)损失函数[7]进行联合更新,这三种损失函数分别是红外损失、可见光损失和增强可见光损失,由以下公式给出: 其中是与查询的伪标签相对应的聚类的正表示向量,是一个温度超参数,采用聚类对比方法[7]中的设定。
图3:特定模态的记忆初始化过程。总损失。当然,设计了三种类型的聚类对比(ClusterNCE)损失函数来学习具有判别性的表示:
总的来说,总损失等于红外损失、可见光损失和增强可见光损失之和。
当接近其正聚类表示且与所有其他聚类特征不相似时,损失值就会较低。这个过程相当于两个特定模态的基于softmax的分类器,它们试图将分类为,并将与一起分类为。是用于学习颜色不变信息的通道增强特征的查询,因此,在联合增强学习的帮助下,特征编码器具有一定的模态泛化能力。
讨论。与H2H[24]中的学习方法不同,我们将两种模态的同构学习整合到一个具有部分共享结构的双流网络中。因此,我们的方法能够同时学习特定模态的表示和模态不变特征。此外,联合增强学习进一步对齐了两种模态的特征空间,使模型具有更强的模态泛化能力。
3.3 跨模态记忆聚合
文中有两个记忆库,一个是红外记忆库,一个是可见光记忆库。记忆聚合就是把不同记忆库的记忆结合到一起,文中主要是从可见光记忆库中挑选出可靠正跨模态标签对,加入到红外记忆库中。
得益于增强型双对比学习框架,该模型具备一定的模态泛化能力和跨模态检索能力,但两种模态样本之间的相关性尚未得到充分挖掘,且无法应对较大的跨模态变化带来的挑战。为了解决这一问题,我们设计了一个跨模态记忆聚合(CMA)模块,该模块包含计数优先选择策略和记忆聚合策略。如图2所示,CMA可以在每个训练周期开始时,选择可靠的正跨模态标签对,并聚合相应的记忆。
对于每一对跨模态实例,我们通过以下公式计算它们的相似度:
然后,我们可以通过一个阈值来匹配实例对: 在我们的工作中,阈值。和分别是和的伪标签。这是一个初步的相似度约束,它可以过滤掉简单的负样本对,以减少计算量。
这里是对所有实例之间进行一个相似度计算,用来过滤掉简单的负样本对。这样就得到了集合R。
计数优先选择。为了关联可靠的正跨模态聚类对,我们认为每一个伪标签对的数量代表了跨模态标签匹配的可靠性。具体来说,我们对集合中的标签对进行计数并排序。一个可见光标签可以匹配多个红外标签,而对应数量最多的标签对可以被视为最可靠的伪标签对,如图2所示。这些伪标签对被选中用于聚合相应的记忆。
文章认为,一个可见光标签匹配到了多个红外标签,数量最多的就是最可靠的伪标签对。

表1:在SYSU-MM01数据集上不同记忆更新策略的比较。报告了Rank@r准确率(%)、平均精度均值(mAP,%)以及平均互信息精度(mINP,%)。记忆聚合。我们采用动量更新策略对选定的记忆进行聚合,公式如下: 其中,是动量更新因子。和是在第个训练周期与选定的标签对相对应的记忆。值得注意的是,我们并非双向聚合,具体而言,我们只是将可见光模态的记忆聚合到红外模态的记忆中。这意味着,如公式12所示,红外模态的记忆不会改变,而可见光模态的记忆会通过公式13聚合到红外模态的记忆中。这种聚合方法使模型具备更好的处理跨模态变化的能力。我们将在4.5节中通过比较不同的聚合策略来证明这一点。具体细节见算法1。
讨论。与常见的标签细化方法不同,我们通过聚合记忆模块来关联跨模态样本。这有两个优点:1)在对比学习中,记忆模块为特征学习提供了监督信息。记忆模块的直接聚合使得跨模态标签关联在对比学习中能够紧密耦合,这是一种相互强化的关系。2)记忆的聚合是在聚类层面上的融合与关联,相较于样本到样本的关联方法,这种方式更加高效。
图4:来自SYSU-MM01数据集(前两行)和RegDB数据集(最后一行)的示例图像以及随机通道增强图像。每一行表示来自三种不同模态的同一身份的图像。四、实验
4.1 数据集与评估协议
我们采用了两个公开可用的跨模态行人重识别数据集(RegDB[28]数据集和SYSU-MM01数据集[41])来进行评估。我们在图4中绘制了来自这两个数据集的一些示例图像,同时展示了通道增强后的图像。
SYSU-MM01数据集是一个跨模态行人图像数据集,由2个近红外摄像头和4个可见光摄像头采集得到。SYSU-MM01包含395个训练身份的图像,其中包括在室内外环境下采集的22258张可见光图像和11909张近红外图像。我们采用全搜索和室内搜索两种评估模式。
RegDB数据集是由两个对齐的摄像头(一个可见光摄像头和一个热成像摄像头)系统采集的,包含412个身份的图像。我们在两种测试模式下评估我们的方法,即从热成像到可见光以及从可见光到热成像。我们严格按照现有的方法对图库集的选择进行十次试验[37, 47],并计算平均性能。
评估协议。参照已有研究成果[44],将平均精度均值(mAP)和累积匹配特性(CMC)作为评估指标进行计算。
4.2 实施细节
我们所提出的框架是在PyTorch中实现的。两个浅层的设置遵循AGW[48]的方式,并且我们使用ResNet50[20]作为共享层,该共享层使用ImageNet预训练权重[8]进行初始化。在测试过程中,我们提取广义均值池化(GeM)[29]层的特征来计算余弦相似度。在每个训练周期开始时,采用密度峰值聚类算法(DBSCAN)[9]分别在每个模态中生成伪标签。
在训练过程中,我们从每个模态的训练集中采样16个人的身份,并且针对每个身份采样16个实例。为了进行训练,我们对图像应用随机水平翻转、随机擦除以及随机裁剪(尺寸为288×144)的操作。对于增强的可见光流,我们采用随机通道增强(CA)方法[46]。使用Adam优化器来训练模型。初始学习率设置为,并且每20个训练周期将学习率降低为先前值的十分之一。我们总共训练模型100个周期,其中前50个周期用于预训练ADC框架,而后50个周期执行跨模态记忆聚合(CMA)模块。对比学习参数的其他设置遵循文献[7]。聚合动量值设置为0.1。
表2:在SYSU-MM01数据集和RegDB数据集上的消融研究。“DC”表示没有联合增强的双对比学习。“ADC”指的是第3.2节中所述的增强型联合双对比学习框架。“CMA”代表第3.3节中的跨模态记忆聚合模块。报告了Rank@𝑟准确率(%)、平均精度均值(mAP,%)以及平均互信息精度(mINP,%)。
表3:在SYSU-MM01数据集上与当前最先进方法的比较。其包含两组,即无监督行人重识别(ReID)方法和有监督的可见光行人重识别(VI-ReID)方法。∗cm-SSFT [22] 通过使用所有图库样本作为辅助信息报告了更高的匹配准确率,但这在许多应用场景中并不可行。报告了Rank@r准确率(%)、平均精度均值(mAP,%)以及平均互信息精度(mINP,%)。4.3 与当前最先进方法的比较
对于无监督学习的可见光行人重识别(USLVI-ReID),相应的当前最先进的方法数量有限。为了弥补这一点,我们参考了来自文献H2H [24] 的3种无监督方法,并在无监督学习的可见光行人重识别任务上实现了6种先进的无监督方法。同时,我们还报告了16种当前最先进的有监督方法用于比较。SPCL [16]、MMT[15] 和H2H [24] 使用Market1501作为额外的带标注的RGB数据集进行训练。在SYSU-MM01和RegDB数据集上的比较结果分别报告于表3和表4中。
与无监督方法的比较。实验表明,我们的ADCA(增强型联合双对比学习与跨模态记忆聚合方法)在各种设置下显著优于现有的无监督方法。具体而言,在SYSU-MM01和RegDB任务中,我们分别比现有的单模态无监督方法在平均精度均值(mAP)上高出约20%和40%。此外,与H2H [24](该方法使用额外的带标注RGB数据集进行无监督跨模态行人重识别)相比,在SYSU-MM01(全搜索模式)和RegDB(从可见光到红外模式)上,我们分别在mAP上取得了明显的13.33%和45.18%的提升。
表4:在RegDB数据集上与当前最先进方法的比较。其包含两组,即无监督行人重识别(ReID)方法和有监督的可见光行人重识别(VI-ReID)方法。∗cm-SSFT [22] 通过使用所有图库样本作为辅助信息报告了更高的匹配准确率,但这在许多应用场景中并不可行。报告了Rank@𝑟准确率(%)、平均精度均值(mAP,%)以及平均互信息精度(mINP,%)。与有监督方法的比较。我们的ADCA方法超越了包括零填充(Zero - Padding)[41]、增强双分支动态训练与重加权(eBDTR)[45]、混合语义嵌入(HSME)[19]、双动态关系推理()[37]以及对齐生成对抗网络(AlignGAN)[34]在内的一些有监督方法。
这是一个令人鼓舞的结果,表明无监督跨模态行人重识别在逼近有监督可见光行人重识别效果方面很有前景。这些显著的提升得益于我们针对无监督学习的可见光行人重识别方法的巧妙设计。我们的方法有三个主要优点:
- 无需任何额外的标注数据。这一特性使得我们提出的框架更适用于实际部署。
- 我们的解决方案简单、高效且易于实现。我们认为,如果引入先进的对比学习方法,性能还会进一步提升。
- 所学习到的特征对于不同的跨模态数据集和匹配设置具有很强的鲁棒性。
4.4 消融研究
ADCA框架在无监督学习的可见光行人重识别(USL-VI-ReID)任务中的性能提升,主要源自所提出的增强型双对比(ADC)学习和跨模态记忆聚合(CMA)模块。我们通过在SYSU-MM01和RegDB数据集上进行消融研究,来验证每个组件的有效性。结果见表2。
指标1中的基线模型表示,我们使用基于聚类对比(Cluster Contrast)[7]方法的单流对比学习,直接在SYSU-MM01和RegDB数据集的任务上训练模型。尽管聚类对比方法在单模态无监督行人重识别任务上表现良好,但可以看到,该基线模型在SYSU-MM01数据集(全搜索模式)上仅达到了22.00%的平均精度均值(mAP),在RegDB数据集(从可见光到红外模式)上仅达到了11.76%的mAP。因此,直接使用单模态无监督行人重识别方法很难解决无监督学习的可见光行人重识别(USL-VI-ReID)问题。
双对比学习(DC)的有效性。指标2表示没有联合增强学习的双对比学习。与基线模型相比,双对比学习(DC)在SYSU-MM01数据集(全搜索模式)和RegDB数据集(从可见光到红外模式)上,平均精度均值(mAP)分别提升了7.40%和18.67%。其主要的性能提升得益于双路径网络的设计,该设计使模型能够在互不干扰的情况下进行同类学习,并通过共享嵌入层捕捉到某些模态不变特征。
图5:记忆聚合动量值对SYSU-MM01数据集的影响。增强型双对比学习(ADC)的有效性。指标3代表增强型双对比学习,该方法将随机通道增强(CA)作为联合学习的辅助分支。与双对比学习(DC)相比,增强型双对比学习(ADC)在所有设置下都带来了持续的性能提升。在SYSU-MM01数据集(全搜索模式)和RegDB数据集(从可见光到红外模式)上,平均精度均值(mAP)分别提升了5.18%和7.63%。性能提升的原因有两方面。首先,随机通道增强方法[46]促使模型学习可见光图像的每个颜色通道与单通道红外图像之间的明确关系。其次,联合学习策略在不修改网络结构的情况下充分利用了通道增强后的图像,这有助于学习跨模态特征。
跨模态记忆聚合(CMA)模块的有效性。指标4和指标5分别表示带有CMA模块的双对比学习(DC)和增强型双对比学习(ADC)。与DC和ADC的结果相比,显著的性能提升证明了CMA的有效性。CMA能够选择可靠的正样本跨模态标签对,并聚合相应的记忆信息,以确保在聚类层面上跨模态特征具有可区分性,这比点对点的关联方法更加有效。
4.5 进一步分析
图6:随机选取的20个身份的t-SNE可视化结果。颜色表示不同的身份。圆形代表可见光模态,叉号代表红外模态。从双对比学习(DC)方法到增强型联合双对比学习与跨模态记忆聚合(ADCA)方法,椭圆形区域内两种模态的样本点逐渐靠近。记忆聚合动量值。我们采用动量更新策略来聚合两种特定模态的记忆。公式12和公式13中的控制着记忆聚合的速度。如图5所示,当 时,增强型联合双对比学习与跨模态记忆聚合(ADCA)方法取得了最佳效果。
记忆更新策略。我们在表1中展示了不同的记忆更新策略。表1中的平均记忆表示我们通过以下方式更新两种记忆:
表1中的可见光记忆表示,我们使用可见光记忆按如下方式更新两种记忆:
表1中的红外记忆意味着我们通过公式12和公式13来更新这两种记忆。结果表明,使用红外记忆的更新策略取得了最佳性能。
可视化。我们绘制了从SYSU-MM01数据集中随机选取的20个身份的t-SNE[32]图,如图6所示。从初始状态到采用增强型联合双对比学习与跨模态记忆聚合(ADCA)方法,红外和可见光的正样本点逐渐靠近。最终,在ADCA方法中,模型学习到了更好的跨模态特征分布。这一可视化结果进一步验证了我们方法的有效性。我们也注意到,同一身份的一些样本点没有聚集在一起,并且在无监督学习的可见光行人重识别(USL-VI-ReID)任务中仍有很大的改进空间。
五、结论
本文引入了无监督学习的可见光-红外行人重识别(USL-VI-ReID)任务,以缓解昂贵的跨模态标注问题。为了解决无监督学习的可见光-红外行人重识别任务中因较大的跨模态差异所导致的问题,我们提出了一种全新的增强型双对比聚合(ADCA)学习框架。该框架基于同类联合学习和异类聚合的理念,提升了无监督跨模态识别能力。该框架已在两项不同的任务中得到验证,显著优于当前最先进的无监督方法,甚至超过了一些有监督方法,推动了无监督的可见光-红外行人重识别技术在实际场景中的应用。我们将在其他可见光-红外应用中进一步研究这一方法。