论文思路收集
对比学习相关论文
1.MoCo:Momentum Contrast for Unsupervised Visual Representation Learning
- 这篇论文通过动量更新的方式,解决了传统的基于记忆库的对比学习的一致性问题,同时也解决了传统的对比学习的高显存要求的问题,是对比学习的一个里程碑,后续的对比学习架构基本都是基于这个方式进行的。
无监督行人重识别相关论文
1.ICE: Inter-instance Contrastive Encoding for Unsupervised Person Re-identification
论文《ICE: Inter-instance Contrastive Encoding for Unsupervised Person Re-identification》于 2021 年发表于计算机视觉领域国际顶级会议 ICCV(International Conference on Computer Vision) 。
- 这篇论文通过DBSCAN算法为数据集打上伪标签,实现了完全无监督的行人重识别。
- 采用动量更新的方式来训练其中的两个模型。
可见光/红外行人重识别相关论文
发表于 CVPR 2023(IEEE/CVF Conference on Computer Vision and Pattern Recognition 2023),即 2023 年的计算机视觉与模式识别会议。
- 采用有监督方法
- 这篇论文采用的是特征层面的方法来对可见光图像和红外图像进行融合,通过训练模型(多样化嵌入扩展网络(DEEN))让同一目标的可见光图像和红外图像提取出来的特征尽量接近(特征层面的方法旨在找到一个模态共享且具有特定模态特征的空间)。
- 文中采用了中心引导对挖掘损失函数(CPM),让生成的特征更多样化、让同一对象的红外图像和可见光图像的特征更接近、让不同类别的图像之间的特征距离更远,采用的是有监督。
- 文章提供了一个低光照数据集,比现有的红外数据集的光照条件更加复杂。
发布于 2022 年 10 月 10 - 14 日的第 30 届 ACM 国际多媒体会议(MM ’22)
- 这篇论文用CA对可见光图像进行增强得到与颜色无关的图像,旨在挖掘与颜色无关的信息。
- 采用无监督方法
- 文中采用了名为ADCA的学习框架,简单来说是提取了可见光和红外图像特征的记忆库的对比学习方法。(这篇文章也是基于特征层面的方法进行默模态融合)
- 文章还设计了一个跨模态记忆聚合模块(CMA),用于从可见光记忆库中挑选可靠的特征加入到红外记忆库中,让模型能更好的适应模态变化。
该论文发布于 2023 年,发表在计算机视觉领域顶级会议 IEEE/CVF Conference on Computer Vision and Pattern Recognition(CVPR)的会议论文集中 。
- 这篇论文的主干网络和ADCA的主干网络相似。
- 文中采用了渐进图匹配的方式,找到更可靠的跨模态对应关系。
- 文中采用了交替交叉对比学习来减小模态差异,以及减小噪声的影响。
4.Shallow-Deep Collaborative Learning for Unsupervised Visible-Infrared Person Re-Identification(SDCL)
2024年发表于计算机视觉领域顶级会议 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 的会议论文集。
- 和前面的ADCA是同一个作者。代码也是在ADCA的基础上做的修改
- 这篇论文采用了双流transfomer替代了原先的双流cnn
- 用深浅协作模块来利用到了浅层的特征
5.Visible-Infrared Person Re-Identification via Semantic Alignment and Affinity Inference
- 2023年发表于ICCV
- 这篇文章主要解决局部特征错位问题:主流基于局部的方法采用 “水平分割” 提取局部特征(如将人体按高度分为上、中、下三部分),但行人不规则运动(如手臂摆动、弯腰)会导致局部特征语义错位(如 “手臂” 特征被分配到错误的水平区域),降低特征判别性。
- 文章主要提出了语义对齐特征学习(SAFL):动态提取语义一致的局部特征
- SAFL 的核心思想是:通过 “可学习原型(Learnable Prototypes)” 聚合具有相似语义的像素特征,动态生成语义一致的局部特征,而非依赖固定水平分割,同时实现跨模态特征对齐。
- 2025年发布于该论文发布于IEEE Transactions on Information Forensics and Security
- 采用无监督方法
- 核心方法:PCAL 框架
- PCAL 整合三个关键模块,分阶段实现模态不变特征学习,具体如下:
- 三模态对抗学习(TAL):将通道增强(CA)图像作为额外模态,通过对抗机制使可见、红外和 CA 模态的特征分布对齐,以 CA 分布为参考缩小模态差距,为后续跨模态关联挖掘奠定基础。
- 跨模态邻居扩展(CNE):针对 KNN 聚类中的模态偏差问题,采用无模态偏向融合策略,平衡不同模态邻居信息的贡献,尽可能关联潜在跨模态邻居,生成可靠的跨模态伪标签。
- 模态不变对比学习(MCL):利用 CNE 生成的伪标签构建模态不变记忆库,通过对比学习强化跨模态聚类的区分度,进一步细化跨模态关联,提升模态不变特征的学习效果。
- 这篇论文全面综述了基于深度学习的行人重识别(Re-ID)研究,明确了闭世界与开世界两种设置的核心差异,提出了新的评估指标和强基线模型,并指出了未来研究方向。
- 新评估指标 mINP:弥补现有 CMC 和 mAP 指标的不足,衡量找到所有正确匹配的成本,为实际应用提供更全面的评估依据。
- AGW 强基线模型:融合非局部注意力、广义均值池化和加权正则三元组损失,在 12 个数据集的四种 Re-ID 任务上取得最优或可比性能,为后续研究提供可靠基准。
- 未来研究方向
- 不可控数据收集:应对多异构数据和衣物变化等实际场景挑战。
- 减少人工标注:通过主动学习、虚拟数据生成等方式降低标注成本。
- 领域特定 / 通用架构设计:开发更适配 Re-ID 任务的网络架构,提升模型的泛化能力。
- 动态模型更新:适应摄像头网络的动态变化和新增数据。
- 高效模型部署:设计快速检索、轻量化模型,满足实际应用的资源需求。
- 这篇论文和ADCA以及SDCL都是同一个作者,是在SDCL之前的论文,也是在ADCA的基础上进行改进的。
- 这篇论文针对无监督可见光 - 红外行人重识别(USL-VI-ReID)的层级差异问题,提出了 - grand 统一表示(GUR)学习框架,有效提升了跨模态检索性能,缩小了无监督与有监督方法的差距。
- 层级差异由相机变化和模态差异共同构成,会导致聚类不一致和跨模态标签关联模糊。例如,可见光相机对光线更敏感,易造成身份分裂,而红外相机相对稳定,两者聚类数量差异大,增加了跨模态匹配难度。
- GUR 框架通过自下而上的域学习策略,结合跨记忆关联嵌入和跨模态标签统一模块,学习鲁棒的统一表示。
- 自下而上的域学习策略
- 分为三个训练阶段,逐步学习相机不变和模态不变特征:
- 相机内训练:在每个相机域内单独执行增强双对比(ADC)学习,基于相机内相似度聚类生成伪标签。
- 相机间训练:通过相机级跨记忆关联嵌入(CAE)模块计算样本与各相机记忆的关联概率,生成统一嵌入用于单模态内聚类,再通过 ADC 学习相机不变特征。
- 模态间训练:利用模态级 CAE 模块计算样本与各模态记忆的关联概率,生成统一嵌入用于跨模态聚类,最终通过 ADC 学习统一特征。
遮挡相关论文
这篇文章于 2023 年 11 月 1 日发布在 arXiv 上。
- 该文章主要讲述了遮挡行人重识别近些年的主要方法以及进行了分析。
- 方法主要包括卷积网络、ViT、3D行人重识别以及多模态行人重识别。
论文是2023年WACV会议的开源版本,由计算机视觉基金会提供。最终发表版本可在IEEE Xplore上获取。WACV会议聚焦计算机视觉应用领域,在该领域具有较高的影响力,为相关研究成果的交流和传播提供了重要平台。 该文章是有监督的遮挡行人重识别论文,利用了身份标签监督以及通过 PifPaf 姿态估计模型生成的人体解析标签
语义分割
1.sam2代码
2.基于Segment Anything Model模型的大梁水库裂缝检测方法
这篇文章主要采用了CrackSAM框架,采用了适配器结构和裂缝区域自动化提取等技术,提高了模型在复杂背景下的鲁棒性和检测效率。实验结果表明,改进后的 SAM 模型在验证数据集上的裂缝检测准确率和精细度均有显著提升。
3.SAM 及 其 改 进 模 型 在 图 像 分 割 中 的 应 用 综 述
- SAM是2023年由Meta提出的首个CV领域的基础模型
- SAM通过提示工程技术允许用户通过点、框等提示信息进行分割,也可以无需提示进行全景分割
- 这篇文章还提到了多种SAM的改进版本
- 通过引入适配器(Adapter)模块可以使模型仅微调这些模块,不改变模型的预训练部分就可以快速适应不同需求。
- SAM-Adapter通 过 适 配 器 模 块 和 视 觉提示生成器来调整 SAM 的特 征 表 示 并 生 成 相 关 提示,提升模型在伪装物体检测、阴影检测等复杂分割任务中的表现。
- 域适应方法:为提升模型的跨领域泛化能力,ZHANG 等提 出 了 基 于 自 训 练 的 域 适 应 方 法。该方法通 过 弱 监 督 框 架 建 立 伪 预 测 之 间 的 对 应 关系,帮助模型自适应不同领域的数据,增强了其跨领域表现。
- 框提示的表现一般优于点提示,但是我认为在大体型目标识别下采用框提示,精细目标采用点提示更合适。
- EFU-Net采用一种半 自 动 标 注 方 法,通 过 阈值分割初步定位缺陷区域,生成缺陷的外接矩形框,然后由人工对矩形 框 进 行 精 细 化 修 改 和 完 善,最 终作为提示输 入 SAM。这 种 半 自 动 标 注 方 法 不 仅 减轻了人工标 注 的 负 担,还 能 为 SAM 提 供 更 精 准 的提示输入,尤其是在数据匮乏的情况下,有助于提高模型的分割精度和泛化能力。
- 这篇文章基于SAM提出了一种球团图像提示点生成模型,主要是希望通过自动生成提示点,利用SAM对球团图像进行语义分割。
- 先通过OTSU分割得到前景和背景的隶属度图,用前景区域的重心作为初始提示点,然后通过提示点优化纠正算法得到优化后的提示点
- 该算法在通过提示点输入SAM得到输出后,还会对得到的掩膜进行过滤和修复,主要是通过连通域的数量来进行判断(这个办法应该不太适用于人体分割的场景,不过应该可以去除一部分来自背景的噪声点)
5.SAM-Res_Net:一种金银花害虫智能分割与别方法_张庆达
这篇文章用带提示点标注的害虫图像,输入到SAM进行分割,帮助识别任务,对SAM没有进行微调。
- 这篇论文聚焦于解决通用图像分割模型 Segment Anything (SAM) 在特定场景下的性能缺陷,提出了一种轻量级适配方法 SAM-Adapter,通过融合任务特定知识与 SAM 的通用能力,在阴影检测和伪装目标检测等挑战性任务中实现了性能突破。
- SAM-Adapter 的核心思想是通过轻量级适配器(Adapter)向 SAM 注入任务特定知识,而非微调 SAM 的主体结构,从而实现 “通用能力 + 任务专精” 的结合。
- 在代码仓库中有提到现在已经有支持SAM2的SAM2-Adapter架构
- SAM Adapter以及SAM2 Adapter的显卡要求都达到了4张A100,2张4090是否可行还需要调整
- 以上两篇文章都是对行人图像进行了语义分割,将行人与背景分割开来,没有精细到身体的各个部分
- 文章8的人体语义分割网络采用deeplabV3+作为主干网络,主要的作用就是把人体和背景分离开来,排除背景的干扰。
10.SPReID
- 代码
- 这篇文章是最早的将语义分割应用在行人重识别的论文
- 这篇文章通过改进的InceptionV3将行人分割成了前景(整个人体)、头、上躯、下躯、鞋五个部分,通过局部特征提高识别精度
- 文章在“Look into Person”(LIP)的数据集上训练语义分割模型,这个数据集有20个语义标签,根据语义合并成了5个粗粒度的标签。如 “Hat”“Hair”“Face” 等与头部紧密相关的标签合并为 “Head”
- 然后在Market-1501等数据集上进行行人重识别的训练
- 行人重识别主干网络(如 Inception-V3)生成 2048 通道的特征张量后,SPReID 框架利用人体语义分割模型输出的 5 个语义区域(前景、头部、上半身、下半身、鞋子)的概率图,对这些特征张量进行加权聚合。每个概率图作为权重,与主干网络的特征进行空间上的加权求和,得到对应区域的 2048 维特征向量。之后,对头部、上半身、下半身、鞋子的特征向量执行元素级最大值操作,再将结果与前景特征以及全图的全局特征拼接,最终形成用于行人重识别的综合特征
11.Mask-Guided Contrastive Attention Model for Person Re-Identification
- 这篇文章主要通过预训练人体语义分割模型将行人图像分割成了前景和背景
- 在某些场景下舍弃背景会导致性能下降,因为背景中也有帮助分辨行人的信息,而且分割模型的效果可能不太好分割结果糟糕
- 所以这篇文章采用双流结构,一路输入分割后的行人前景,另一路则输入原图像
14.sapiens
- 代码仓库
- Sapiens 是 Meta 公司推出的专注于人类相关视觉任务的 AI 模型系列,在为 2D 姿势估计、身体部位分割、深度估计和表面法线预测等以人为中心的视觉任务,提供高性能统一框架。
- 2D 姿态估计:可检测人体关键点位置,改进了骨架系统,最多能识别 308 个关键点,其中面部关键点达 243 个,相比之前模型,能捕捉更精细的细节,用于分析姿势和动作。
- 身体部位分割:能对图像中的人体部位进行像素级分类,分割类别扩展到 28 个,涵盖头发、嘴唇、牙齿等细致部位,在虚拟试穿、医学成像等领域有重要应用。
- Sapiens 在身体部位分割任务上成绩斐然。在 Humans-2K 测试集中,以平均交并比(mIoU)和平均准确率(mAcc)为评估指标,Sapiens 超越了众多现有方法。如最小的 Sapiens-0.3B 模型,凭借更高的分辨率和大规模以人为中心的预训练,其 mIoU 达到 76.7% ,超越了像 Mask2Former(58.7%)和 DeepLabV3+(64.1%)等当时的先进分割方法,提升幅度达 12.6 mIoU。而 Sapiens-2B 模型表现更为出色,实现了 81.2 mIoU 和 89.4 mAcc 的最佳性能,相比之前的方法,在 mIoU 上提高了 17.1,展现出强大的分割能力。