“Shallow-Deep Collaborative Learning for Unsupervised Visible-Infrared Person Re-Identification” 由 Bin Yang 等人撰写。论文提出了一种基于 Transformer 的浅层 - 深层协作学习(SDCL)框架,有效解决了无监督可见光 - 红外行人重识别(US-VI-ReID)任务中的跨模态差异问题,在多个数据集上超越了现有方法。
2024年发表于计算机视觉领域顶级会议 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 的会议论文集。
摘要
无监督可见光-红外行人重识别(US-VI-ReID)旨在学习一种无需标签的跨模态检索模型,减少对昂贵的跨模态人工标注的依赖。以往的无监督可见光-红外行人重识别工作倾向于利用从最后一层提取的深度特征来学习跨模态信息。然而,受多种差异的干扰,仅依靠深度特征不足以准确学习模态不变特征,从而导致负优化。浅层的浅层特征包含细微的细节信息,这对有效的跨模态学习至关重要,但遗憾的是现有方法忽视了这些信息。为解决上述问题,我们设计了一种基于Transformer的浅深协作学习(SDCL)框架,采用浅深对比学习,并融入协作邻居学习(CNL)和协作排序关联(CRA)模块。具体而言,CNL揭示了内在的同质性和异质性协作关系,用于邻居对齐,以动态方式增强模型的鲁棒性。此外,CRA将跨模态标签与浅层和深层特征之间的排序关联联系起来,为跨模态学习提供有价值的监督。大量实验验证了我们方法的优越性,甚至优于某些有监督的方法。
1.介绍
图1. 研究动机示意图。以往先进的无监督可见光-红外行人重识别(US-VI-ReID)工作主要集中于学习特征,并将跨模态标签与深层特征相关联。然而,受多种差异的干扰,仅依靠深层特征不足以准确学习模态不变特征,从而导致负优化,如图(a)所示。在本文中,我们通过协作学习和标签关联,将浅层和深层特征结合起来,以解决这些问题,如图(b)所示。
行人重识别(ReID)旨在匹配由非重叠摄像头拍摄的同一人的图像。近年来,行人重识别在计算机视觉研究领域备受关注,这是因为它在智能视频监控应用中起着关键作用[参考文献2, 18, 19, 23, 25, 28 - 30, 39, 41, 44, 46, 57, 59, 62, 63]。在有监督的行人重识别中,一等精度(rank-1 accuracy)已取得了令人鼓舞的成果。值得注意的是,这些行人图像通常是在光照良好的环境中由可见光相机获取的。然而,必须认识到,可见光相机在低光照条件下往往无法捕捉到个人的足够信息,因此限制了单模态行人重识别在夜间监控场景中的实用性[参考文献1, 7, 15, 21, 40, 42, 45, 53, 61] 。
相比之下,最近部署的相机具备在夜间操作时无缝切换到远红外/近红外模式的能力[50, 55]。人们提出了各种技术[12, 20, 22, 27, 34, 47, 52, 54 - 58, 62]来进行可见光 - 红外行人重识别(VIReID),并取得了不错的准确率。值得注意的是,这些成果的取得得益于大量人工标注的跨模态数据集。然而,与单模态行人重识别数据集的标注相比,跨模态数据集的标注需要更多资源。这项复杂的标注任务是一个巨大且关键的挑战,最终催生了无监督可见光 - 红外行人重识别(US-VI-ReID)这一重要任务,以降低昂贵的跨模态标注成本。
一些先前的研究[4, 5, 24, 33, 37, 48, 50, 51]已经针对无监督可见光 - 红外行人重识别(US-VI-ReID)提出了初步解决方案。这些解决方案倾向于利用从最后一层提取的深度特征来学习跨模态特征。然而,受多种差异(即模态内变化和模态间差异)的干扰,仅依靠深度特征不足以准确学习模态不变特征,从而导致负优化,如图1所示。需要认识到的是,源自特定模态浅层的浅层特征蕴含着丰富的、与行人属性相关的细微细节信息,这对于无监督跨模态表示学习至关重要,但遗憾的是现有方法却忽视了这些信息。
为了充分挖掘浅层信息的潜力,我们设计了一种基于Transformer的全面的浅深协作学习(SDCL)框架,该框架采用浅深对比学习,并融入了协作邻居学习(CNL)和协作排序关联(CRA)模块。具体而言,CNL揭示了内在的同质性和异质性协作关系,以此作为寻找可靠的模态内和模态间邻居学习的约束条件,从而以动态的方式确保学习到模态不变且具有判别力的表示。此外,CRA从全局视角出发,利用深层和浅层特征之间的跨模态排序一致性,以协作的方式关联两种模态的标签,为跨模态学习提供有价值的跨模态监督。最终,在包含CNL和CRA模块的浅深协作学习框架内,我们获得了强大的特征表示,有效地缓解了无监督条件下的跨模态差异。
主要贡献总结如下:
我们提出了一种基于Transformer架构的浅深协作学习框架。该框架有助于学习强大的特征表示,通过浅层和深层特征的协作有效应对跨模态差异。
我们提出了协作邻居学习模块,用于构建可靠的模态内和跨模态邻居学习机制,使模型能够捕捉模态不变且具有判别力的特征。
我们提出了协作排序关联模块,用于探索模态内和跨模态的排序一致性,统一跨模态标签,并提供宝贵的跨模态监督。
大量实验验证,我们的SDCL框架在两个主流的可见光-红外行人重识别基准测试中优于现有方法,持续提升了无监督跨模态检索性能。
2.相关工作
2.1 监督式可见光-红外行人重识别
目前,先进的监督式可见光 - 红外行人重识别主要聚焦于弥合两种模态之间的差距,并学习能够抵御模态差异的鲁棒特征表示。Ye等人[55]开发了一种动态三层关系挖掘(DTRM)框架,同时探索通道级、模态内部件级和图级的跨模态关系线索。CAJ[56]提出了一种通道混合学习方法,通过随机交换颜色通道来处理模态内和跨模态的变化。SGIEL[11]提出了一种形状擦除特征学习范式,在一个子空间中联合学习与形状相关的特征,在其正交补空间中学习形状擦除特征。
然而,这些方法所展现出的卓越性能依赖于大量人工标注的跨模态数据集。在本研究中,我们将重点转向无监督可见光 - 红外行人重识别领域,该领域不存在身份标注信息,却在现实世界的可见光 - 红外行人重识别部署中有着重要应用。
2.2 无监督单模态行人重识别
无监督单模态行人重识别致力于使用可见光相机捕获的未标记数据来训练行人重识别模型。大多数研究采用聚类算法来生成伪标签,以优化模型。“聚类对比”方法[9]利用独特的聚类表示来描绘每个聚类,解决了聚类不一致的问题。Chen等人[3]提出了实例间对比编码(ICE)方法,该方法利用实例间的成对相似性分数来增强之前基于类别的对比行人重识别方法。IICS[49]通过将相似性计算分解为两个阶段,即分别进行域内和域间计算,来应对无监督行人重识别的挑战。Dai等人[8]提出了一种双重优化方法,在离线聚类阶段同时增强伪标签,在在线训练阶段优化特征,提高了标签纯度和特征可辨别性。
上述方法致力于解决单模态行人重识别中的问题。当将这些方法应用于无监督可见光 - 红外行人重识别(US-VI-ReID)时,它们会面临来自跨模态差异以及缺乏跨模态(可见光 - 红外)身份标签所带来的挑战。这阻碍了跨模态特征的学习以及可靠的跨模态伪标签的生成。
2.3 无监督可见光-红外行人重识别
有几项研究[24, 37, 48, 50]开启了无监督可见光-红外行人重识别(US-VI-ReID)领域的初步探索。Yang等人[50]提出了一种全新的增强双对比聚合(ADCA)学习框架,该框架基于同构联合学习和异构聚合的原理,为纯无监督的可见光-红外行人重识别建立了一个坚实的基准。PGM[48]开发了一种渐进式图匹配方法,用于系统地提取跨模态对应关系,将对应关系挖掘表述为一个图匹配过程。H2H[24]通过两阶段学习引入了一种从同构到异构的方法,并将Market1501[64]作为额外的标注数据。CHCR[33]提出了一种跨模态层次聚类和优化方法,通过促进模态不变特征学习和提高伪标签的可靠性来实现。
然而,上述方法主要集中于利用深层特征进行特征学习。但是,受模态内变化和模态间差异的干扰,仅依靠深层特征不足以准确学习模态不变特征,会导致负优化。我们的方法通过协作特征学习和跨模态标签关联,将浅层和深层特征结合起来,这与以往的工作不同,超越了现有无监督可见光 - 红外行人重识别(US-VI-ReID)方法的性能。
3.方法
图2. 浅深协作学习示意图。它包括浅深对比学习、协作邻居学习和协作排序关联。浅深协作学习(SDCL)通过浅深协作找到可靠的邻域和跨模态标签,增强了所学特征表示的鲁棒性。
浅深协作学习(SDCL)框架如图2所示,它集成了协作邻居学习(CNL)和协作排序关联(CRA)模块。SDCL采用具有双对比学习的双路径Transformer架构[50],该架构有两个特定模态的浅层补丁嵌入层和一个模态共享的Transformer。为每个模态内的浅层嵌入和深层特征构建实例记忆和聚类记忆。实例记忆存储所有训练图像的特征。聚类记忆是通过对具有相同伪标签的实例特征求平均构建而成的。利用上述记忆,SDCL开发了CNL模块,将同质性和异质性协作作为约束条件,以寻找可靠的模态内和模态间邻居学习。CRA探索跨模态浅层嵌入和深层特征的排序一致性,以关联可靠的跨模态身份。通过CNL和CRA模块中浅层嵌入和深层特征的协作,SDCL能够学习到更适合跨模态检索的特征表示。
3.1 浅深对比学习
我们首先基于增强的双对比学习[50]以及双路径Transformer架构来引入浅深对比学习。
聚类记忆初始化 。在每个训练周期开始时,我们通过对每个模态的浅层特征和深层特征求平均,为每个模态构建浅层聚类记忆和深层聚类记忆,其表示如下:
ϕ k v s = 1 ∣ H k v ∣ ∑ u n v s ∈ y k v u n v s , \phi_{k}^{v s}=\frac{1}{\left|\mathcal{H}_{k}^{v}\right|} \sum_{u_{n}^{v s} \in y_{k}^{v}} u_{n}^{v s}, ϕ k v s = ∣ H k v ∣ 1 ∑ u n v s ∈ y k v u n v s ,
ϕ k v d = 1 ∣ H k v ∣ ∑ u n v d ∈ y k v u n v d , \phi_{k}^{v d}=\frac{1}{\left|\mathcal{H}_{k}^{v}\right|} \sum_{u_{n}^{v d} \in y_{k}^{v}} u_{n}^{v d}, ϕ k v d = ∣ H k v ∣ 1 ∑ u n v d ∈ y k v u n v d ,
ϕ l r s = 1 ∣ H l r ∣ ∑ u n r s ∈ y l r u n r s , \phi_{l}^{r s}=\frac{1}{\left|\mathcal{H}_{l}^{r}\right|} \sum_{u_{n}^{r s} \in y_{l}^{r}} u_{n}^{r s}, ϕ l r s = ∣ H l r ∣ 1 ∑ u n r s ∈ y l r u n r s ,
ϕ l r d = 1 ∣ H l r ∣ ∑ u n r d ∈ y l r u n r d , \phi_{l}^{r d}=\frac{1}{\left|\mathcal{H}_{l}^{r}\right|} \sum_{u_{n}^{r d} \in y_{l}^{r}} u_{n}^{r d}, ϕ l r d = ∣ H l r ∣ 1 ∑ u n r d ∈ y l r u n r d ,
其中,u n r ∗ u_{n}^{r *} u n r ∗ 和 u n v ∗ u_{n}^{v *} u n v ∗ 分别是红外实例特征和可见光实例特征。u n ∗ s u_{n}^{* ~s} u n ∗ s 和 u n ∗ d u_{n}^{* d} u n ∗ d 分别是浅层实例特征和深层实例特征。H k H_{k} H k 表示第 k k k 个聚类集合,∣ ⋅ ∣ \vert\cdot\vert ∣ ⋅ ∣ 计算集合中的样本数量。同时,我们将实例特征存储在浅层和深层的红外及可见光实例记忆 U r s U^{r s} U r s 、U r d U^{r d} U r d 、U v s U^{v s} U v s 和 U v d U^{v d} U v d 中。
聚类记忆更新 。在每次训练迭代过程中,两种模态的深层和浅层聚类记忆采用动量更新策略进行更新:
ϕ k ( δ ) ← α ϕ k ( δ − 1 ) + ( 1 − α ) q , q ∈ y k , ( 5 ) \phi_{k}^{(\delta)} \leftarrow \alpha \phi_{k}^{(\delta - 1)}+(1 - \alpha) q, q \in y_{k}, (5) ϕ k ( δ ) ← α ϕ k ( δ − 1 ) + ( 1 − α ) q , q ∈ y k , ( 5 )
其中,q q q 是在每次训练迭代中从训练集中采样得到的查询特征。α \alpha α 是动量因子。δ \delta δ 是训练迭代次数。
对比损失 。给定浅层和深层的可见光以及红外查询特征q v s q^{v s} q v s 、q v d q^{v d} q v d 、q r s q^{r s} q r s 和q r s q^{r s} q r s ,我们通过以下公式计算可见光模态的对比损失:
L i d v s = − log exp ( q v s ⋅ ϕ + v s / τ ) ∑ k = 0 K exp ( q v s ⋅ ϕ k v s / τ ) , \mathcal{L}_{i d}^{v s}=-\log \frac{\exp \left(q^{v s} \cdot \phi_{+}^{v s} / \tau\right)}{\sum_{k = 0}^{K} \exp \left(q^{v s} \cdot \phi_{k}^{v s} / \tau\right)}, L i d v s = − log ∑ k = 0 K e x p ( q v s ⋅ ϕ k v s / τ ) e x p ( q v s ⋅ ϕ + v s / τ ) ,
L i d v d = − log exp ( q v d ⋅ ϕ + v d / τ ) ∑ k = 0 K exp ( q v d ⋅ ϕ k v d / τ ) , \mathcal{L}_{i d}^{v d}=-\log \frac{\exp \left(q^{v d} \cdot \phi_{+}^{v d} / \tau\right)}{\sum_{k = 0}^{K} \exp \left(q^{v d} \cdot \phi_{k}^{v d} / \tau\right)}, L i d v d = − log ∑ k = 0 K e x p ( q v d ⋅ ϕ k v d / τ ) e x p ( q v d ⋅ ϕ + v d / τ ) ,
其中,ϕ + \phi_{+} ϕ + 是与查询q q q 的伪标签相对应的正样本记忆,τ \tau τ 是温度参数。红外模态的对比损失L i d r s L_{id }^{rs } L i d r s 和L i d r d L_{id }^{rd } L i d r d 通过相同的方式获得。
我们通过结合深层和浅层对比损失来优化特定模态的浅层嵌入层和模态共享的深层:
L i d = L i d v d + L i d r d + L i d v s + L i d r s \mathcal{L}_{i d}=\mathcal{L}_{i d}^{v d}+\mathcal{L}_{i d}^{r d}+\mathcal{L}_{i d}^{v s}+\mathcal{L}_{i d}^{r s} L i d = L i d v d + L i d r d + L i d v s + L i d r s
3.2. 协作邻居学习
协作邻居学习(CNL)模块的基本原理是,浅层特征和深层特征是互补的,它们内在的一致性关系可用于约束模态内和跨模态的优化过程,构建协作学习机制以增强对模态内和跨模态变化的鲁棒性。从上述角度来看,协作邻居学习(CNL)探索了重要的同质性和异质性的浅深协作关系,以寻求可靠的模态内和跨模态邻居学习方式。
同质性与异质性协作 。给定一个查询q q q ,我们可以通过以下公式得到查询与训练集中每个实例之间的相似度s ( q i , u j ) s(q_{i}, u_{j}) s ( q i , u j ) :
s ( q i , u j ) = q i ⋅ u j ∥ q i ∥ 2 ∥ u j ∥ 2 , ( 9 ) s\left(q_{i}, u_{j}\right)=\frac{q_{i} \cdot u_{j}}{\left\| q_{i}\right\| _{2}\left\| u_{j}\right\| _{2}}, \quad(9) s ( q i , u j ) = ∥ q i ∥ 2 ∥ u j ∥ 2 q i ⋅ u j , ( 9 )
其中q i q_{i} q i 和u j u_{j} u j 分别来自可见光或红外模态的浅层或深层特征,由此可得到多种类型的同质性和异质性的浅层或深层的查询-实例相似度,即s ( q i v s , u j v s ) s(q_{i}^{v s}, u_{j}^{v s}) s ( q i v s , u j v s ) 、s ( q i r s , u j r s ) s(q_{i}^{r s}, u_{j}^{r s}) s ( q i r s , u j r s ) 、s ( q i v s , u j r s ) s(q_{i}^{v s}, u_{j}^{r s}) s ( q i v s , u j r s ) 、s ( q i r s , u j v s ) s(q_{i}^{r s}, u_{j}^{v s}) s ( q i r s , u j v s ) 、s ( q i v d , u j v d ) s(q_{i}^{v d}, u_{j}^{v d}) s ( q i v d , u j v d ) 、s ( q i r d , u j r d ) s(q_{i}^{r d}, u_{j}^{r d}) s ( q i r d , u j r d ) 、s ( q i v d , u j r d ) s(q_{i}^{v d}, u_{j}^{r d}) s ( q i v d , u j r d ) 以及s ( q i r d , u j v d ) s(q_{i}^{r d}, u_{j}^{v d}) s ( q i r d , u j v d ) 。
借助上述多种类型的相似度,我们寻找可靠的浅层和深层的模态内以及跨模态邻居,从而构建协作邻居学习。模态内邻居可定义如下:
N v ( q i v ) = { N v ( q i v s ) ∩ N v ( q i v d ) } , ( 10 ) \mathcal{N}^{v}\left(q_{i}^{v}\right)=\left\{\mathcal{N}^{v}\left(q_{i}^{v s}\right) \cap \mathcal{N}^{v}\left(q_{i}^{v d}\right)\right\}, \quad(10) N v ( q i v ) = { N v ( q i v s ) ∩ N v ( q i v d ) } , ( 10 )
N r ( q i r ) = { N r ( q i r s ) ∩ N r ( q i r d ) } , ( 11 ) \mathcal{N}^{r}\left(q_{i}^{r}\right)=\left\{\mathcal{N}^{r}\left(q_{i}^{r s}\right) \cap \mathcal{N}^{r}\left(q_{i}^{r d}\right)\right\}, \quad(11) N r ( q i r ) = { N r ( q i r s ) ∩ N r ( q i r d ) } , ( 11 )
其中,N v ( q i v ∗ ) N^{v}(q_{i}^{v *}) N v ( q i v ∗ ) 和 N r ( q i r ∗ ) N^{r}(q_{i}^{r *}) N r ( q i r ∗ ) 分别是通过可见光-可见光和红外-红外相似度搜索得到的邻居集。∗ ∈ s , d * \in{s, d} ∗ ∈ s , d 表示浅层和深层特征。N v ( q i v s ) N^{v}(q_{i}^{v s}) N v ( q i v s ) 和 N r ( q i v d ) N^{r}(q_{i}^{v d}) N r ( q i v d ) 可通过以下公式得到:
N v ( q i v s ) = { u j v s ∣ s ( q i v s , u j v s ) > γ ⋅ max j = 1... N v s ( q i v s , u j v s ) } , ( 12 ) \mathcal{N}^{v}\left(q_{i}^{v s}\right)=\left\{u_{j}^{v s} | s\left(q_{i}^{v s}, u_{j}^{v s}\right)>\gamma \cdot \max _{j = 1 ... N^{v}} s\left(q_{i}^{v s}, u_{j}^{v s}\right)\right\}, \quad(12) N v ( q i v s ) = { u j v s ∣ s ( q i v s , u j v s ) > γ ⋅ max j = 1... N v s ( q i v s , u j v s ) } , ( 12 )
N v ( q i v d ) = { u j v d ∣ s ( q i v d , u j v d ) > γ ⋅ max j = 1... N v s ( q i v d , u j v d ) } , ( 13 ) \mathcal{N}^{v}\left(q_{i}^{v d}\right)=\left\{u_{j}^{v d} | s\left(q_{i}^{v d}, u_{j}^{v d}\right)>\gamma \cdot \max _{j = 1 ... N^{v}} s\left(q_{i}^{v d}, u_{j}^{v d}\right)\right\},(13) N v ( q i v d ) = { u j v d ∣ s ( q i v d , u j v d ) > γ ⋅ max j = 1... N v s ( q i v d , u j v d ) } , ( 13 )
其中,N v N^{v} N v 表示可见光实例的数量,γ \gamma γ 是正邻居选择范围。N r ( q i r s ) N^{r}(q_{i}^{r s}) N r ( q i r s ) 和 N r ( q i r d ) N^{r}(q_{i}^{r d}) N r ( q i r d ) 可以用类似的方式计算。
给定查询q i v q_{i}^{v} q i v 或q i r q_{i}^{r} q i r ,跨模态邻居可表示为:
N r ( q i v ) = { N r ( q i v s ) ∩ N r ( q i v d ) } , ( 14 ) \mathcal{N}^{r}\left(q_{i}^{v}\right)=\left\{\mathcal{N}^{r}\left(q_{i}^{v s}\right) \cap \mathcal{N}^{r}\left(q_{i}^{v d}\right)\right\}, \quad(14) N r ( q i v ) = { N r ( q i v s ) ∩ N r ( q i v d ) } , ( 14 )
N v ( q i r ) = { N v ( q i r s ) ∩ N v ( q i r d ) } , ( 15 ) \mathcal{N}^{v}\left(q_{i}^{r}\right)=\left\{\mathcal{N}^{v}\left(q_{i}^{r s}\right) \cap \mathcal{N}^{v}\left(q_{i}^{r d}\right)\right\}, \quad(15) N v ( q i r ) = { N v ( q i r s ) ∩ N v ( q i r d ) } , ( 15 )
其中N r ( q i v s ) N^{r}(q_{i}^{v s}) N r ( q i v s ) 和N r ( q i v d ) N^{r}(q_{i}^{v d}) N r ( q i v d ) 定义如下:
N r ( q i v s ) = { u j r s ∣ s ( q i v s , u j r s ) > γ ⋅ max j = 1... N r s ( q i v s , u j r s ) } , ( 16 ) \mathcal{N}^{r}\left(q_{i}^{v s}\right)=\left\{u_{j}^{r s} | s\left(q_{i}^{v s}, u_{j}^{r s}\right)>\gamma \cdot \max _{j = 1 ... N^{r}} s\left(q_{i}^{v s}, u_{j}^{r s}\right)\right\}, \quad(16) N r ( q i v s ) = { u j r s ∣ s ( q i v s , u j r s ) > γ ⋅ max j = 1... N r s ( q i v s , u j r s ) } , ( 16 )
N r ( q i v d ) = { u j r d ∣ s ( q i v d , u j r d ) > γ ⋅ max j = 1... N r s ( q i v d , u j r d ) } , ( 17 ) \mathcal{N}^{r}\left(q_{i}^{v d}\right)=\left\{u_{j}^{r d} | s\left(q_{i}^{v d}, u_{j}^{r d}\right)>\gamma \cdot \max _{j = 1 ... N^{r}} s\left(q_{i}^{v d}, u_{j}^{r d}\right)\right\}, \quad(17) N r ( q i v d ) = { u j r d ∣ s ( q i v d , u j r d ) > γ ⋅ max j = 1... N r s ( q i v d , u j r d ) } , ( 17 )
这里N r N^{r} N r 表示红外实例的数量。类似地,我们可以得到N v ( q i r s ) N^{v}(q_{i}^{r s}) N v ( q i r s ) 和N v ( q i r d ) N^{v}(q_{i}^{r d}) N v ( q i r d ) 。通过上述过程,我们得到了N v ( q i v ) N^{v}(q_{i}^{v}) N v ( q i v ) 、N r ( q i r ) N^{r}(q_{i}^{r}) N r ( q i r ) 、N r ( q i v ) N^{r}(q_{i}^{v}) N r ( q i v ) 和N v ( q i r ) N^{v}(q_{i}^{r}) N v ( q i r ) ,这些是通过同质性或异质性浅深协作约束搜索得到的可靠邻居集。
协作邻居学习。利用邻居集N v ( q i v ) N^{v}(q_{i}^{v}) N v ( q i v ) 、N r ( q i r ) N^{r}(q_{i}^{r}) N r ( q i r ) 、N r ( q i v ) N^{r}(q_{i}^{v}) N r ( q i v ) 和N v ( q i r ) N^{v}(q_{i}^{r}) N v ( q i r ) ,我们可以执行邻居学习。给定查询q i v s q_{i}^{v s} q i v s 和q i v s q_{i}^{v s} q i v s ,我们可以通过以下方式获得可见光-可见光浅层和深层邻居学习的表达式:
L s v v = − 1 N b ∑ i = 1 N b ∑ j ∈ N v ( q i v ) log exp ( s ( q i v s , u j v s ) / τ ) ∑ n = 1 N v exp ( s ( q i v s , u n v s ) / τ ) , \mathcal{L}_{s}^{v v}=-\frac{1}{N^{b}} \sum_{i=1}^{N^{b}} \sum_{j \in \mathcal{N}^{v}\left(q_{i}^{v}\right)} \log \frac{\exp \left(s\left(q_{i}^{v s}, u_{j}^{v s}\right) / \tau\right)}{\sum_{n=1}^{N^{v}} \exp \left(s\left(q_{i}^{v s}, u_{n}^{v s}\right) / \tau\right)}, L s v v = − N b 1 ∑ i = 1 N b ∑ j ∈ N v ( q i v ) log ∑ n = 1 N v e x p ( s ( q i v s , u n v s ) / τ ) e x p ( s ( q i v s , u j v s ) / τ ) ,
L d v v = − 1 N b ∑ i = 1 N b ∑ j ∈ N v ( q i v ) log exp ( s ( q i v d , u j v d ) / τ ) ∑ n = 1 N v exp ( s ( q i v d , u n v d ) / τ ) , \mathcal{L}_{d}^{v v}=-\frac{1}{N^{b}} \sum_{i=1}^{N^{b}} \sum_{j \in \mathcal{N}^{v}\left(q_{i}^{v}\right)} \log \frac{\exp \left(s\left(q_{i}^{v d}, u_{j}^{v d}\right) / \tau\right)}{\sum_{n=1}^{N^{v}} \exp \left(s\left(q_{i}^{v d}, u_{n}^{v d}\right) / \tau\right)}, L d v v = − N b 1 ∑ i = 1 N b ∑ j ∈ N v ( q i v ) log ∑ n = 1 N v e x p ( s ( q i v d , u n v d ) / τ ) e x p ( s ( q i v d , u j v d ) / τ ) ,
L v v = L d v v + λ s L s v v , ( 20 ) \mathcal{L}^{v v}=\mathcal{L}_{d}^{v v}+\lambda_{s} \mathcal{L}_{s}^{v v}, \quad(20) L v v = L d v v + λ s L s v v , ( 20 )
其中N b N^{b} N b 是查询q i q_{i} q i 的批量大小。类似地,红外-红外L r r L^{r r} L r r 、红外-可见光L r v L^{r v} L r v 和可见光-红外L v r L^{v r} L v r 的邻居学习可以通过类似方式获得。邻居学习的最终优化由以下组合表示:
L n e i g h b o r = L v v + L r r + L r v + L v r . ( 21 ) \mathcal{L}_{neighbor }=\mathcal{L}^{v v}+\mathcal{L}^{r r}+\mathcal{L}^{r v}+\mathcal{L}^{v r}. (21) L n e i g hb or = L v v + L r r + L r v + L v r . ( 21 )
浅深协作学习(SDCL)的总损失表示为:
L t o t a l = L n e i g h b o r + L i d ( 22 ) \mathcal{L}_{total }=\mathcal{L}_{neighbor }+\mathcal{L}_{id } (22) L t o t a l = L n e i g hb or + L i d ( 22 )
讨论 。与文献[30]中的邻居学习不同,[30]完全依赖深层特征来选择正样本邻居。在多种差异的情况下,单个深层特征的相似性并不可靠,这会导致错误地选择邻居并产生负优化。我们的方法采用协作邻居学习,通过浅层和深层的协作动态地优化跨模态监督,实现有效的跨模态特征对齐。
3.3. 协作排序关联
协作排序关联(CRA)模块基于双重原理:(1)两种模态的浅层和深层特征应具有相同的排序一致性。(2)单一模态内的浅层和深层特征的排序一致性应更为准确。因此,协作排序关联模块包含两个过程,即跨模态排序关联和模态内排序平滑。
跨模态排序关联 。利用相似度s ( u i v s , u j r s ) s(u_{i}^{v s}, u_{j}^{r s}) s ( u i v s , u j r s ) 和s ( u i v d , u j r d ) s(u_{i}^{v d}, u_{j}^{r d}) s ( u i v d , u j r d ) ,对于u i v s u_{i}^{v s} u i v s 和u i v d u_{i}^{v d} u i v d ,我们可以得到两个可见光 - 红外排序列表s ( u i v s , u j r s ) {s(u_{i}^{v s}, u_{j}^{r s})} s ( u i v s , u j r s ) ,j ∈ [ 1 , N r ] j \in[1, N^{r}] j ∈ [ 1 , N r ] 和s ( u i v d , u j r d ) {s(u_{i}^{v d}, u_{j}^{r d})} s ( u i v d , u j r d ) ,j ∈ [ 1 , N r ] j \in[1, N^{r}] j ∈ [ 1 , N r ] ,将其表示为R s v r ( u i v s ) R_{s}^{v r}(u_{i}^{v s}) R s v r ( u i v s ) 和R d v r ( u i v d ) R_{d}^{v r}(u_{i}^{v d}) R d v r ( u i v d ) 。两个排序列表中第k k k 个相似红外实例的标签可以表示为:
y ~ u i v s v r [ k ] = y u j r s , u j r s = R s v r ( u i v s ) [ k ] , ( 23 ) \tilde{y}_{u_{i}^{v s}}^{v r}[k]=y_{u_{j}^{r s}}, u_{j}^{r s}=\mathcal{R}_{s}^{v r}\left(u_{i}^{v s}\right)[k], \quad(23) y ~ u i v s v r [ k ] = y u j r s , u j r s = R s v r ( u i v s ) [ k ] , ( 23 )
y ~ u i v d v r [ k ] = y u j r d , u j r d = R d v r ( u i v d ) [ k ] , ( 24 ) \tilde{y}_{u_{i}^{v d}}^{v r}[k]=y_{u_{j}^{r d}}, u_{j}^{r d}=\mathcal{R}_{d}^{v r}\left(u_{i}^{v d}\right)[k], \quad(24) y ~ u i v d v r [ k ] = y u j r d , u j r d = R d v r ( u i v d ) [ k ] , ( 24 )
其中y ~ u i v s v r [ k ] \tilde{y}_{u_{i}^{v s}}^{v r}[k] y ~ u i v s v r [ k ] 和y ~ u i v d v r [ k ] \tilde{y}_{u_{i}^{v d}}^{v r}[k] y ~ u i v d v r [ k ] 是通过可见光 - 红外浅层和深层相似度排序得到的u i v s u_{i}^{v s} u i v s 和u i v d u_{i}^{v d} u i v d 的第k k k 个跨模态标签。基于原理(1),我们建议将跨模态标签与两个标签集的交集相关联,以研究协作排序一致性:
I u i v ( k ) = { y ~ u i v d v r [ k ] ∩ { y ~ u i v s v r [ n ] } n = 1 N } , ( 25 ) I_{u_{i}^{v}}(k)=\left\{\tilde{y}_{u_{i}^{v d}}^{v r}[k] \cap\left\{\tilde{y}_{u_{i}^{v s}}^{v r}[n]\right\}_{n = 1}^{N}\right\}, \quad(25) I u i v ( k ) = { y ~ u i v d v r [ k ] ∩ { y ~ u i v s v r [ n ] } n = 1 N } , ( 25 )
其中I u i v ( k ) I_{u_{i}^{v}}(k) I u i v ( k ) 记录了从排名第1 1 1 到排名第N N N 的实例中,前k k k 个具有相同身份的样本。u i v u_{i}^{v} u i v 的可靠细化跨模态标签可以用I u i v ( k ) I_{u_{i}^{v}}(k) I u i v ( k ) 中数量最多的标签来表示:
y ‾ u i v c m = y ‾ u i v d v r [ k ] , k = arg max k ( { ∣ I u i v ( k ) ∣ , k ∈ [ 1 , K ] } ) , ( 26 ) \overline{y}_{u_{i}^{v}}^{c m}=\overline{y}_{u_{i}^{v d}}^{v r}[k], k=\underset{k}{\arg\max}\left(\left\{\left|I_{u_{i}^{v}}(k)\right|, k \in[1, K]\right\}\right), \quad(26) y u i v c m = y u i v d v r [ k ] , k = k arg max ( { I u i v ( k ) , k ∈ [ 1 , K ] } ) , ( 26 )
其中∣ ⋅ ∣ \vert\cdot\vert ∣ ⋅ ∣ 表示计数函数。arg max \arg\max arg max 操作遍历I u i v ( k ) I_{u_{i}^{v}}(k) I u i v ( k ) ,并将数量最多的标签作为跨模态细化标签。然后,我们将标签列表y ~ u v c m , i ∈ [ 1 , N v ] {\tilde{y}_{u v}^{c m}, i \in[1, N^{v}]} y ~ uv c m , i ∈ [ 1 , N v ] 转换为独热编码矩阵Y ~ c m ∈ R N v × C r \tilde{Y}^{c m} \in \mathbb{R}^{N^{v} ×C^{r}} Y ~ c m ∈ R N v × C r ,根据细化标签将相应列设为1 1 1 ,其余设为0 0 0 ,其中C r C^{r} C r 是红外模态的类别数。
模态内协作平滑 。基于原理(2),构建两个浅层和深层的同质性浅层P s v v P_{s}^{vv} P s v v 和深层P d v v P_{d}^{vv} P d v v 相似性矩阵,用于研究模态内的排序一致性,通过以下方式提高细化后的跨模态伪标签的精度:
P s v v ( i , j ) = s ( u i v s , u j v s ) , ( 27 ) P_{s}^{vv}(i, j)=s(u_{i}^{vs}, u_{j}^{vs}), \quad(27) P s v v ( i , j ) = s ( u i v s , u j v s ) , ( 27 )
P d v v ( i , j ) = s ( u i v d , u j v d ) , ( 28 ) P_{d}^{vv}(i, j)=s(u_{i}^{vd}, u_{j}^{vd}), \quad(28) P d v v ( i , j ) = s ( u i v d , u j v d ) , ( 28 )
其中P ∗ v v ∈ R N v × N v P_{*}^{vv} \in \mathbb{R}^{N^{v} \times N^{v}} P ∗ v v ∈ R N v × N v 表示模态内的相似性结构。为了探索模态内的浅层和深层协作,我们通过以下公式计算P s v v ( i , j ) P_{s}^{vv}(i, j) P s v v ( i , j ) 和P d v v ( i , j ) P_{d}^{vv}(i, j) P d v v ( i , j ) 的和:
P v v ( i , j ) = P s v v ( i , j ) + P d v v ( i , j ) P^{vv}(i, j)=P_{s}^{vv}(i, j)+P_{d}^{vv}(i, j) P v v ( i , j ) = P s v v ( i , j ) + P d v v ( i , j )
其中P v v P^{vv} P v v 表示浅层和深层相似性矩阵的一致性。我们将P e v P^{ev} P e v 每行的前5 5 5 个最大值设为1 1 1 ,其余设为0 0 0 ,从而得到排序关系。模态内排序平滑过程可表示为:
Y c m = P v v Y ~ c m , ( 30 ) Y^{cm}=P^{vv} \tilde{Y}^{cm}, \quad(30) Y c m = P v v Y ~ c m , ( 30 )
其中Y c m ∈ R N v × C r Y^{cm} \in \mathbb{R}^{N^{v} \times C^{r}} Y c m ∈ R N v × C r 是可见光实例的最终细化跨模态标签矩阵。在Y c m Y^{cm} Y c m 中,每行最大值的列号就是样本的细化标签。在我们的工作中,我们将可见光模态的伪标签细化到红外模态,并利用可见光模态内的浅层和深层相似性对跨模态标签进行平滑处理。然后,红外标签和细化后的可见光标签将用于构建一个模态共享记忆,用于两种模态内的对比学习[51]。
讨论 。我们的协作排序关联(CRA)本质上是在每个训练周期开始时从全局角度对浅层和深层排序过程的协作,这与以往采用单一模式深层特征相似性的工作[37, 48, 50, 51]不同。在CRA中对双模式相似性施加协作一致性约束具有明显优势,有助于探索更可靠的跨模态关系,并提供有价值的跨模态监督。
4.实验
4.1. 数据集与评估协议
数据集 。我们在两个广泛使用的可见光-红外行人重识别数据集上评估所提出的浅深协作学习(SDCL)框架,即 SYSU-MM01 [45] 和 RegDB [32]。SYSU-MM01 数据集由 6 个不同的相机采集,包含 395 个训练身份的 22258 张可见光图像和 11909 张近红外图像。我们对图库集选择进行十次试验 [53],并按照现有方法在全搜索和室内搜索测试模式下计算平均性能。RegDB 数据集由两个对齐的可见光和热成像相机系统采集,对于可见光-红外行人重识别(VI-ReID)来说,其挑战性较小。我们从 206 个身份中选取 2060 张图像用于训练,并按照 [54] 的方法重复此过程 10 次,然后在可见光到热成像以及热成像到可见光的测试模式下计算平均性能。
评估协议 。遵循现有研究,将累积匹配特性(CMC)、平均精度均值(mAP)和平均逆负惩罚(mINP)[57] 作为评估指标进行计算。
4.2. 实现细节
所提出的框架是使用PyTorch实现的。浅深对比学习(SDCL)采用了来自TransReID [17] 的特征提取器作为主干网络,并结合了增强的双对比学习 [50]。浅层补丁嵌入层是通过实例批量归一化(IBN)和卷积神经网络(CNN)模块 [31] 构建的。浅层和深层类别标记的拼接用于计算检索的余弦相似度。采用密度峰值聚类算法(DBSCAN) [10] 来生成伪标签。在进入网络之前,可见光和红外图像被调整为尺寸288×144。在一个批次内,对于每个模态,我们对每个伪身份采样8个伪身份和16个实例。采用通道增强 [56]、随机裁剪、水平翻转和随机擦除来进行数据增强。我们采用随机梯度下降(SGD)优化器,初始学习率为3.5e -4 来训练模型。该模型总共训练50个轮次。在最后20个轮次中添加协作排序关联(CRA)模块。公式20中的λ s \lambda_{s} λ s 设置为0.5。公式12、公式13、公式16和公式17中的γ \gamma γ 设置为0.9。对于SYSU-MM01数据集,公式25和公式26中的N N N 和K K K 分别设置为20,对于RegDB数据集,N N N 和K K K 分别设置为10。对比学习的设置遵循 [50]。
4.3. 与最先进的方法进行比较
表1. 在SYSU-MM01和RegDB数据集上与最先进方法的比较。报告了r排名准确率(%)、平均精度均值(mAP,%)和平均逆负惩罚(mINP,%)。
在表1中,我们的浅深对比学习(SDCL)方法与有监督和无监督的可见光-红外行人重识别(VI-ReID)方法在包括SYSU-MM01和RegDB在内的两个基准数据集上进行了比较。
与无监督方法的比较。如表1所示,与当前先进的无监督方法相比,我们的方法表现出更优越的性能。更确切地说,我们的浅深对比学习(SDCL)方法在SYSU-MM01数据集(全搜索模式)上的一级排名准确率达到了显著的64.49%,在RegDB数据集(从可见光到红外模式)上的一级排名准确率达到了86.91%。与当前最佳方法GUR [51]相比,我们的方法在SYSU-MM01数据集(全搜索模式)上的一级排名准确率比其高出约1%,在RegDB数据集(从可见光到红外模式)上的一级排名准确率比其高出约10%。与采用可见光注释进行训练的单半监督方法DPIS [35]相比,我们的SDCL方法仍然保持领先地位。
与有监督方法的比较。我们的比较还纳入了14种知名的有监督方法作为参考。与这些方法的比较明确表明,我们的浅深对比学习(SDCL)框架优于包括AGW [57]、MSO [12]和DDAG [54]在内的几种有监督方法,并且与MCLNet [16]相比,取得了具有竞争力的性能。这些显著的提升得益于浅深协作学习框架的精妙设计。我们的方法通过浅层和深层特征的协同协作,有助于培养模态不变特征。在我们创新解决方案的指导下,浅深对比学习(SDCL)超越了现有的无监督方法。
4.4. 消融研究
表2. 在SYSU-MM01和RegDB数据集上的消融研究。报告了r排名准确率(%)、平均精度均值(mAP,%)和平均逆负惩罚(mINP,%)。
在本小节中,我们精心开展了消融实验,以验证每个模块的单独效能。结果见表2。
基线指的是具有双路径Transformer架构的增强型双对比学习框架 [50]。对网络的优化仅使用深层特征,也就是说,使用L i d v d + L i d r d L_{i d}^{v d}+L_{i d}^{r d} L i d v d + L i d r d 来训练模型。
深浅对比学习的有效性 。与基线相比,纳入L i d v s + L i d r s L_{id}^{vs} + L_{id}^{rs} L i d v s + L i d r s 在SYSU-MM01和RegDB数据集上使一级排名准确率提高了4%至7%。尽管浅层对比学习主要是在模态内针对特征学习对行人重识别(ReID)模型进行优化,但研究结果强调了它增强跨模态检索的能力。
对比邻域学习(CNL)的有效性 。与基线相比,在SYSU-MM01和RegDB数据集上,CNL使性能提升了6%至10%。主要的性能提升得益于通过浅层和深层协作一致性来捕捉可靠的同质性和异质性邻域的设计,这是一种动态优化,减少了聚类中标签噪声的影响,并增强了对多种差异的鲁棒性。
协作排序关联(CRA)的有效性 。与基线相比,CRA模块显著提高了准确率。CRA通过浅层和深层的协作排序关系,在两种模态的标签之间建立了联系,在整个训练集中构成了全局关联,并有效地增强了模态不变特征。
浅深对比学习(SDCL)的有效性 。对比邻域学习(CNL)与协作排序关联(CRA)的融合在不同的设置下显著提高了一级排名准确率。这一观察结果证实了SDCL背后的原理。CRA以离线的方式在每个训练周期开始时提供跨模态监督,而CNL则以在线的方式在训练迭代过程中动态学习跨模态特征。通过结合离线标签关联和在线特征学习,SDCL从不同角度学习到了更好的特征表示。
4.5. 进一步分析
图3. 超参数
λ s \lambda_{s} λ s (左)和
γ \gamma γ (右)的评估。结果基于SYSU-MM01数据集的全搜索模式。报告了一级排名准确率(%)和平均精度均值(mAP,%)。
图4. 随机选取身份的t-SNE(第一行)和相似度分布(第二行)可视化结果。在t-SNE可视化中,身份用颜色表示,其中圆形代表可见光模态,三角形代表红外模态。
超参数λ s \lambda_{s} λ s 和γ \gamma γ 的分析。如图3所示,我们探究了公式20中的超参数λ s \lambda_{s} λ s 以及公式12、公式13、公式16和公式17中的γ \gamma γ 所产生的影响。λ s \lambda_{s} λ s 控制着在深层和浅层邻域学习中L d L_{d} L d 和L s L_{s} L s 之间的平衡。当λ s = 0 \lambda_{s} = 0 λ s = 0 时,L s L_{s} L s 被排除在外。当λ b a s e = 0.5 \lambda_{base}=0.5 λ ba se = 0.5 时,基线方法在深层和浅层邻域学习中实现了平衡。γ \gamma γ 用于控制对比邻域学习(CNL)中正向邻域的选择范围。将γ = 0 \gamma = 0 γ = 0 时,邻域选择失效。当γ = 0.9 \gamma = 0.9 γ = 0.9 时,对比邻域学习(CNL)显著加强了跨模态学习。
可视化。我们对浅深对比学习(SDCL)进行了特征空间(t-SNE [36] 映射)和相似度分布的可视化,结果如图4所示。从图(a)和图(b)中可以明显看出,浅深对比学习(SDCL)使红外和可见光的正样本点靠得更近,并且有效地增强了跨模态正/负样本分布的分离性。这证明了我们的方法在处理模态差异方面的有效性。此外,浅层和深层特征图的可视化结果见补充材料。
5.结论
本文研究了一个极其重要且具有挑战性的问题,即无监督的可见光-红外行人重识别(US-VI-ReID)任务,减轻了对昂贵的跨模态标注的依赖。为了解决多种差异问题,我们提出了一个基于Transformer架构的综合性浅深对比学习(SDCL)框架,融入了协作邻域学习(CNL)和协作排序关联(CRA)模块。浅深对比学习(SDCL)显著促进了对鲁棒特征表示的学习,通过浅层补丁嵌入和深层模态共享特征之间的协作,有效地应对了跨模态差异,并捕捉到了更具判别性的表示,以用于跨模态检索。在两个公开基准数据集上进行的实验证实,我们的方法大幅超越了现有的方法。此外,它甚至优于某些有监督的方法,推动了可见光-红外行人重识别(VI-ReID)向实际应用的方向发展。