工业场景缺陷检测
针对工业多模态缺陷检测难题,提出基于归一化流的多模态多尺度缺陷检测方法。利用双 Transformer提取图像与点云特征构建金字塔,通过点特征对齐与对比学习实现无监督多模态融合,引入信息瓶颈抑制噪声,并采用多尺度归一化流完成特征交互。在 MVTec-3D AD数据集测试,多项指标表现优异,对低感知度、尺寸各异缺陷检测效果良好,泛化性较强。
工业场景缺陷检测
针对工业多模态缺陷检测难题,提出基于归一化流的多模态多尺度缺陷检测方法。利用双 Transformer提取图像与点云特征构建金字塔,通过点特征对齐与对比学习实现无监督多模态融合,引入信息瓶颈抑制噪声,并采用多尺度归一化流完成特征交互。在 MVTec-3D AD数据集测试,多项指标表现优异,对低感知度、尺寸各异缺陷检测效果良好,泛化性较强。
工业缺陷检测逐步由人工检测转向深度学习方案,标注样本稀缺促使无监督方法成为主流。现有单模态方法难以识别低感知度缺陷,各类多模态方案存在模态特征冲突、忽视低层空间信息、噪声干扰、缺乏多尺度设计或依赖标注等不足。针对上述问题,提出基于归一化流的多模态多尺度缺陷检测方法,并通过实验验证其有效性。
工业缺陷检测逐步由人工检测转向深度学习方案,标注样本稀缺促使无监督方法成为主流。现有单模态方法难以识别低感知度缺陷,各类多模态方案存在模态特征冲突、忽视低层空间信息、噪声干扰、缺乏多尺度设计或依赖标注等不足。针对上述问题,提出基于归一化流的多模态多尺度缺陷检测方法,并通过实验验证其有效性。
缺陷在不同模态的感知度以及不同产品上占比示意图原图
本方法包含 RGB 特征提取、3D 点云特征提取、无监督特征融合与多尺度归一化流四大模块,分两阶段训练。先抽取双模态多层特征,借助信息瓶颈机制降噪,再经无监督融合生成多模态表征;随后将表征输入多尺度归一化流,完成缺陷检测与定位。
本方法包含 RGB 特征提取、3D 点云特征提取、无监督特征融合与多尺度归一化流四大模块,分两阶段训练。先抽取双模态多层特征,借助信息瓶颈机制降噪,再经无监督融合生成多模态表征;随后将表征输入多尺度归一化流,完成缺陷检测与定位。
模型结构图原图
1. RGB特征提取
选用基于 ImageNet 数据集、采用 DINO 方式预训练的 ViT-B/8 作为 RGB 特征提取器,提取 RGB 图像第 1、3、11 层输出特征,用于构建多层级多模态表征。
2. 3D点云特征提取
采用 ShapeNet 预训练的 Point Transformer提取3D点云第1、3、11块特征。采用最远点采样降低计算开销,经分组提取特征后,利用反距离权重插值还原至原始点云维度;再结合点坐标与相机参数将点云特征投影至 RGB 图像平面,无投影点位置像素置零,实现模态空间对齐。
3. 无监督特征融合
RGB 图像与3D点云特征具备互补性,融合二者有助于提升缺陷检测效果。本方案构建三层基于特征块的对比矩阵实现无监督特征融合,借助InfoNCE损失增大同层级跨模态特征互信息;利用 MLP 挖掘模态交互,并映射得到键、值特征向量开展相似度匹配,完成特征优化。
1. RGB特征提取
选用基于 ImageNet 数据集、采用 DINO 方式预训练的 ViT-B/8 作为 RGB 特征提取器,提取 RGB 图像第 1、3、11 层输出特征,用于构建多层级多模态表征。
2. 3D点云特征提取
采用 ShapeNet 预训练的 Point Transformer提取3D点云第1、3、11块特征。采用最远点采样降低计算开销,经分组提取特征后,利用反距离权重插值还原至原始点云维度;再结合点坐标与相机参数将点云特征投影至 RGB 图像平面,无投影点位置像素置零,实现模态空间对齐。
3. 无监督特征融合
RGB 图像与3D点云特征具备互补性,融合二者有助于提升缺陷检测效果。本方案构建三层基于特征块的对比矩阵实现无监督特征融合,借助InfoNCE损失增大同层级跨模态特征互信息;利用 MLP 挖掘模态交互,并映射得到键、值特征向量开展相似度匹配,完成特征优化。
无监督特征融合模块的结构原图
4. 无监督信息瓶颈机制
单模态特征噪声会干扰多模态融合并衍生新噪声。传统信息瓶颈为有监督方法,难以适配标注稀缺场景。本文以重建误差作为代理任务,将其拓展至无监督形式;RGB与点云分别采用 VQ-VAE、PointFlow重建模块,拼接降噪特征与原始特征。重新设定优化约束,借助变分下界与蒙特卡洛近似优化目标,在保留有效信息的同时滤除冗余噪声。
5. 多尺度归一化流
本方案采用多尺度归一化流处理不同尺寸缺陷,该结构由平行流与融合流构成。平行流针对低、中、高层特征分别设置 2、5、12 个流块,以适配不同尺度信息。融合流通过融合网络整合各尺度特征,经池化、拼接与卷积实现信息交互。最终,图像级检测采用加法聚合,像素级定位采用乘法聚合,输出检测结果。
4. 无监督信息瓶颈机制
单模态特征噪声会干扰多模态融合并衍生新噪声。传统信息瓶颈为有监督方法,难以适配标注稀缺场景。本文以重建误差作为代理任务,将其拓展至无监督形式;RGB与点云分别采用 VQ-VAE、PointFlow重建模块,拼接降噪特征与原始特征。重新设定优化约束,借助变分下界与蒙特卡洛近似优化目标,在保留有效信息的同时滤除冗余噪声。
5. 多尺度归一化流
本方案采用多尺度归一化流处理不同尺寸缺陷,该结构由平行流与融合流构成。平行流针对低、中、高层特征分别设置 2、5、12 个流块,以适配不同尺度信息。融合流通过融合网络整合各尺度特征,经池化、拼接与卷积实现信息交互。最终,图像级检测采用加法聚合,像素级定位采用乘法聚合,输出检测结果。
融合网络结构图原图
1. 数据集
实验采用2021年提出的 MVTec-3 AD 数据集,为3D工业缺陷检测权威数据集,包含10个类别、2656份训练样本与1137份测试样本,各类别细分多种缺陷子类。样本同步配备同视角工业相机采集的 RGB 图像,以及 3D 传感器高分辨率扫描获取位置信息构成的三维点云。
2. 评估指标
采用I-AUCROC、P-AUPRO、P-AUCROC 评估模型在 MVTec-3D AD 数据集10个类别上的效果,并统计各类平均指标。图像级缺陷检测、像素级缺陷定位依靠AUCROC衡量;ROC曲线反映不同阈值下TPR与FPR的关系,AUCROC 越高区分能力越强,数值为 1 代表最优,0.5 等效随机预测。AUPRO 表征预测缺陷区域与真实缺陷区域重叠程度的平均值。
3. 结构分析
为验证方法有效性,对比本文算法与现有模型在 MVTec-3D AD不同模态下的性能,缺陷定位可视化,部分模型无法计算 P-AUPRO、P-AUCROC 故不作展示。可视化结果表明,融合 3D 点云可检出 RGB 图像中不易辨识的缺陷。
多模态方案 I-AUCROC、P-AUPRO、P-AUCROC 分别为 93.3%、96.1%、98.9%,整体优于多数对比方法;仅P-AUCROC略低于 PatchCore+FPFH,部分指标不及3D-ST。上述方法依靠专用特征描述子提取精细局部空间特征,缺陷定位能力更强。采用Point Transformer,同时挖掘点云上下文与长程依赖,能够有效降低漏检。PatchCore+FPFH 图像级指标仅有 86.5%,低于本方法,证明仅关注局部特征易造成漏检,上下文信息对缺陷检测不可或缺。
1. 数据集
实验采用2021年提出的 MVTec-3 AD 数据集,为3D工业缺陷检测权威数据集,包含10个类别、2656份训练样本与1137份测试样本,各类别细分多种缺陷子类。样本同步配备同视角工业相机采集的 RGB 图像,以及 3D 传感器高分辨率扫描获取位置信息构成的三维点云。
2. 评估指标
采用I-AUCROC、P-AUPRO、P-AUCROC 评估模型在 MVTec-3D AD 数据集10个类别上的效果,并统计各类平均指标。图像级缺陷检测、像素级缺陷定位依靠AUCROC衡量;ROC曲线反映不同阈值下TPR与FPR的关系,AUCROC 越高区分能力越强,数值为 1 代表最优,0.5 等效随机预测。AUPRO 表征预测缺陷区域与真实缺陷区域重叠程度的平均值。
3. 结构分析
为验证方法有效性,对比本文算法与现有模型在 MVTec-3D AD不同模态下的性能,缺陷定位可视化,部分模型无法计算 P-AUPRO、P-AUCROC 故不作展示。可视化结果表明,融合 3D 点云可检出 RGB 图像中不易辨识的缺陷。
多模态方案 I-AUCROC、P-AUPRO、P-AUCROC 分别为 93.3%、96.1%、98.9%,整体优于多数对比方法;仅P-AUCROC略低于 PatchCore+FPFH,部分指标不及3D-ST。上述方法依靠专用特征描述子提取精细局部空间特征,缺陷定位能力更强。采用Point Transformer,同时挖掘点云上下文与长程依赖,能够有效降低漏检。PatchCore+FPFH 图像级指标仅有 86.5%,低于本方法,证明仅关注局部特征易造成漏检,上下文信息对缺陷检测不可或缺。
部分产品的缺陷定位效果图原图
部分产品不同模态下缺陷定位效果图原图
4.消融实验
构建6组消融实验(前5组消融配置,第6组为完整模型,结果见表)。第4组测试 {1,2,5,12,13}种流块数量;第5组移除融合流,对比加法、乘法融合策略;无UFF模块时直接通道拼接双模态特征。
实验分析:多模态融合性能优于单模态,RGB作用高于3D点云;缺少UFF直接拼接特征易产生模态冲突,效果劣于单RGB。适度增加流块可提升性能,数量达到13易出现过拟合。信息瓶颈可抑制特征噪声,融合流实现多尺度特征交互,二者均能提升检测效果。
4.消融实验
构建6组消融实验(前5组消融配置,第6组为完整模型,结果见表)。第4组测试 {1,2,5,12,13}种流块数量;第5组移除融合流,对比加法、乘法融合策略;无UFF模块时直接通道拼接双模态特征。
实验分析:多模态融合性能优于单模态,RGB作用高于3D点云;缺少UFF直接拼接特征易产生模态冲突,效果劣于单RGB。适度增加流块可提升性能,数量达到13易出现过拟合。信息瓶颈可抑制特征噪声,融合流实现多尺度特征交互,二者均能提升检测效果。
不同模态以及模块下方法的性能
针对工业缺陷尺度多变、单模态缺陷难以识别的问题,提出基于归一化流的多模态多尺度缺陷检测方法。该方法借助无监督特征融合整合双模态特征,引入信息瓶颈抑制单模态噪声,并构建特征金字塔改善模型对多变缺陷尺度的适配能力,在MVTec-3D AD数据集上性能优于多数现有算法。消融实验表明RGB图像与点云对检测任务贡献不同,后续将研究双模态最优权重分配,更加充分地挖掘多模态信息。
针对工业缺陷尺度多变、单模态缺陷难以识别的问题,提出基于归一化流的多模态多尺度缺陷检测方法。该方法借助无监督特征融合整合双模态特征,引入信息瓶颈抑制单模态噪声,并构建特征金字塔改善模型对多变缺陷尺度的适配能力,在MVTec-3D AD数据集上性能优于多数现有算法。消融实验表明RGB图像与点云对检测任务贡献不同,后续将研究双模态最优权重分配,更加充分地挖掘多模态信息。