工业场景缺陷检测

针对工业多模态缺陷检测难题,提出基于归一化流的多模态多尺度缺陷检测方法。利用双 Transformer提取图像与点云特征构建金字塔,通过点特征对齐与对比学习实现无监督多模态融合,引入信息瓶颈抑制噪声,并采用多尺度归一化流完成特征交互。在 MVTec-3D AD数据集测试,多项指标表现优异,对低感知度、尺寸各异缺陷检测效果良好,泛化性较强。

[视觉检测]

  • 图像分类
  • 目标检测
  • 语义分割
  • 实例分割
  • 特征提取
  • 卷积神经网络CNN
  • 图像预处理
  • 光学字符识别OCR
  • 人脸识别
  • 图像匹配
  • 目标跟踪
  • 数据集标注
  • 模型推理
  • 图像增强
  • 多模态视觉
  • 缺陷检测

工业场景缺陷检测

针对工业多模态缺陷检测难题,提出基于归一化流的多模态多尺度缺陷检测方法。利用双 Transformer提取图像与点云特征构建金字塔,通过点特征对齐与对比学习实现无监督多模态融合,引入信息瓶颈抑制噪声,并采用多尺度归一化流完成特征交互。在 MVTec-3D AD数据集测试,多项指标表现优异,对低感知度、尺寸各异缺陷检测效果良好,泛化性较强。

[视觉检测]

研究背景

       工业缺陷检测逐步由人工检测转向深度学习方案,标注样本稀缺促使无监督方法成为主流。现有单模态方法难以识别低感知度缺陷,各类多模态方案存在模态特征冲突、忽视低层空间信息、噪声干扰、缺乏多尺度设计或依赖标注等不足。针对上述问题,提出基于归一化流的多模态多尺度缺陷检测方法,并通过实验验证其有效性。

研究背景

       工业缺陷检测逐步由人工检测转向深度学习方案,标注样本稀缺促使无监督方法成为主流。现有单模态方法难以识别低感知度缺陷,各类多模态方案存在模态特征冲突、忽视低层空间信息、噪声干扰、缺乏多尺度设计或依赖标注等不足。针对上述问题,提出基于归一化流的多模态多尺度缺陷检测方法,并通过实验验证其有效性。

缺陷在不同模态的感知度以及不同产品上占比示意图原图

缺陷在不同模态的感知度以及不同产品上占比示意图原图

方法

       本方法包含 RGB 特征提取、3D 点云特征提取、无监督特征融合与多尺度归一化流四大模块,分两阶段训练。先抽取双模态多层特征,借助信息瓶颈机制降噪,再经无监督融合生成多模态表征;随后将表征输入多尺度归一化流,完成缺陷检测与定位。

方法

       本方法包含 RGB 特征提取、3D 点云特征提取、无监督特征融合与多尺度归一化流四大模块,分两阶段训练。先抽取双模态多层特征,借助信息瓶颈机制降噪,再经无监督融合生成多模态表征;随后将表征输入多尺度归一化流,完成缺陷检测与定位。

模型结构图原图

模型结构图原图

1. RGB特征提取
       选用基于 ImageNet 数据集、采用 DINO 方式预训练的 ViT-B/8 作为 RGB 特征提取器,提取 RGB 图像第 1、3、11 层输出特征,用于构建多层级多模态表征。

2. 3D点云特征提取
       采用 ShapeNet 预训练的 Point Transformer提取3D点云第1、3、11块特征。采用最远点采样降低计算开销,经分组提取特征后,利用反距离权重插值还原至原始点云维度;再结合点坐标与相机参数将点云特征投影至 RGB 图像平面,无投影点位置像素置零,实现模态空间对齐。

3. 无监督特征融合
       RGB 图像与3D点云特征具备互补性,融合二者有助于提升缺陷检测效果。本方案构建三层基于特征块的对比矩阵实现无监督特征融合,借助InfoNCE损失增大同层级跨模态特征互信息;利用 MLP 挖掘模态交互,并映射得到键、值特征向量开展相似度匹配,完成特征优化。

1. RGB特征提取
       选用基于 ImageNet 数据集、采用 DINO 方式预训练的 ViT-B/8 作为 RGB 特征提取器,提取 RGB 图像第 1、3、11 层输出特征,用于构建多层级多模态表征。

2. 3D点云特征提取
       采用 ShapeNet 预训练的 Point Transformer提取3D点云第1、3、11块特征。采用最远点采样降低计算开销,经分组提取特征后,利用反距离权重插值还原至原始点云维度;再结合点坐标与相机参数将点云特征投影至 RGB 图像平面,无投影点位置像素置零,实现模态空间对齐。

3. 无监督特征融合
       RGB 图像与3D点云特征具备互补性,融合二者有助于提升缺陷检测效果。本方案构建三层基于特征块的对比矩阵实现无监督特征融合,借助InfoNCE损失增大同层级跨模态特征互信息;利用 MLP 挖掘模态交互,并映射得到键、值特征向量开展相似度匹配,完成特征优化。

无监督特征融合模块的结构原图

无监督特征融合模块的结构原图

4. 无监督信息瓶颈机制
       单模态特征噪声会干扰多模态融合并衍生新噪声。传统信息瓶颈为有监督方法,难以适配标注稀缺场景。本文以重建误差作为代理任务,将其拓展至无监督形式;RGB与点云分别采用 VQ-VAE、PointFlow重建模块,拼接降噪特征与原始特征。重新设定优化约束,借助变分下界与蒙特卡洛近似优化目标,在保留有效信息的同时滤除冗余噪声。

5. 多尺度归一化流
       本方案采用多尺度归一化流处理不同尺寸缺陷,该结构由平行流与融合流构成。平行流针对低、中、高层特征分别设置 2、5、12 个流块,以适配不同尺度信息。融合流通过融合网络整合各尺度特征,经池化、拼接与卷积实现信息交互。最终,图像级检测采用加法聚合,像素级定位采用乘法聚合,输出检测结果。

4. 无监督信息瓶颈机制
       单模态特征噪声会干扰多模态融合并衍生新噪声。传统信息瓶颈为有监督方法,难以适配标注稀缺场景。本文以重建误差作为代理任务,将其拓展至无监督形式;RGB与点云分别采用 VQ-VAE、PointFlow重建模块,拼接降噪特征与原始特征。重新设定优化约束,借助变分下界与蒙特卡洛近似优化目标,在保留有效信息的同时滤除冗余噪声。

5. 多尺度归一化流
       本方案采用多尺度归一化流处理不同尺寸缺陷,该结构由平行流与融合流构成。平行流针对低、中、高层特征分别设置 2、5、12 个流块,以适配不同尺度信息。融合流通过融合网络整合各尺度特征,经池化、拼接与卷积实现信息交互。最终,图像级检测采用加法聚合,像素级定位采用乘法聚合,输出检测结果。

融合网络结构图原图

融合网络结构图原图

实验结构及分析

1. 数据集
       实验采用2021年提出的 MVTec-3 AD 数据集,为3D工业缺陷检测权威数据集,包含10个类别、2656份训练样本与1137份测试样本,各类别细分多种缺陷子类。样本同步配备同视角工业相机采集的 RGB 图像,以及 3D 传感器高分辨率扫描获取位置信息构成的三维点云。

2. 评估指标
       采用I-AUCROC、P-AUPRO、P-AUCROC 评估模型在 MVTec-3D AD 数据集10个类别上的效果,并统计各类平均指标。图像级缺陷检测、像素级缺陷定位依靠AUCROC衡量;ROC曲线反映不同阈值下TPR与FPR的关系,AUCROC 越高区分能力越强,数值为 1 代表最优,0.5 等效随机预测。AUPRO 表征预测缺陷区域与真实缺陷区域重叠程度的平均值。

3. 结构分析
       为验证方法有效性,对比本文算法与现有模型在 MVTec-3D AD不同模态下的性能,缺陷定位可视化,部分模型无法计算 P-AUPRO、P-AUCROC 故不作展示。可视化结果表明,融合 3D 点云可检出 RGB 图像中不易辨识的缺陷。 多模态方案 I-AUCROC、P-AUPRO、P-AUCROC 分别为 93.3%、96.1%、98.9%,整体优于多数对比方法;仅P-AUCROC略低于 PatchCore+FPFH,部分指标不及3D-ST。上述方法依靠专用特征描述子提取精细局部空间特征,缺陷定位能力更强。采用Point Transformer,同时挖掘点云上下文与长程依赖,能够有效降低漏检。PatchCore+FPFH 图像级指标仅有 86.5%,低于本方法,证明仅关注局部特征易造成漏检,上下文信息对缺陷检测不可或缺。

实验结构及分析

1. 数据集
       实验采用2021年提出的 MVTec-3 AD 数据集,为3D工业缺陷检测权威数据集,包含10个类别、2656份训练样本与1137份测试样本,各类别细分多种缺陷子类。样本同步配备同视角工业相机采集的 RGB 图像,以及 3D 传感器高分辨率扫描获取位置信息构成的三维点云。

2. 评估指标
       采用I-AUCROC、P-AUPRO、P-AUCROC 评估模型在 MVTec-3D AD 数据集10个类别上的效果,并统计各类平均指标。图像级缺陷检测、像素级缺陷定位依靠AUCROC衡量;ROC曲线反映不同阈值下TPR与FPR的关系,AUCROC 越高区分能力越强,数值为 1 代表最优,0.5 等效随机预测。AUPRO 表征预测缺陷区域与真实缺陷区域重叠程度的平均值。

3. 结构分析
       为验证方法有效性,对比本文算法与现有模型在 MVTec-3D AD不同模态下的性能,缺陷定位可视化,部分模型无法计算 P-AUPRO、P-AUCROC 故不作展示。可视化结果表明,融合 3D 点云可检出 RGB 图像中不易辨识的缺陷。 多模态方案 I-AUCROC、P-AUPRO、P-AUCROC 分别为 93.3%、96.1%、98.9%,整体优于多数对比方法;仅P-AUCROC略低于 PatchCore+FPFH,部分指标不及3D-ST。上述方法依靠专用特征描述子提取精细局部空间特征,缺陷定位能力更强。采用Point Transformer,同时挖掘点云上下文与长程依赖,能够有效降低漏检。PatchCore+FPFH 图像级指标仅有 86.5%,低于本方法,证明仅关注局部特征易造成漏检,上下文信息对缺陷检测不可或缺。

  • 部分产品的缺陷定位效果图原图

  • 部分产品不同模态下缺陷定位效果图原图

  • 部分产品的缺陷定位效果图原图

  • 部分产品不同模态下缺陷定位效果图原图

4.消融实验
       构建6组消融实验(前5组消融配置,第6组为完整模型,结果见表)。第4组测试 {1,2,5,12,13}种流块数量;第5组移除融合流,对比加法、乘法融合策略;无UFF模块时直接通道拼接双模态特征。
       实验分析:多模态融合性能优于单模态,RGB作用高于3D点云;缺少UFF直接拼接特征易产生模态冲突,效果劣于单RGB。适度增加流块可提升性能,数量达到13易出现过拟合。信息瓶颈可抑制特征噪声,融合流实现多尺度特征交互,二者均能提升检测效果。

4.消融实验
       构建6组消融实验(前5组消融配置,第6组为完整模型,结果见表)。第4组测试 {1,2,5,12,13}种流块数量;第5组移除融合流,对比加法、乘法融合策略;无UFF模块时直接通道拼接双模态特征。
       实验分析:多模态融合性能优于单模态,RGB作用高于3D点云;缺少UFF直接拼接特征易产生模态冲突,效果劣于单RGB。适度增加流块可提升性能,数量达到13易出现过拟合。信息瓶颈可抑制特征噪声,融合流实现多尺度特征交互,二者均能提升检测效果。

不同模态以及模块下方法的性能

不同模态以及模块下方法的性能

结论

       针对工业缺陷尺度多变、单模态缺陷难以识别的问题,提出基于归一化流的多模态多尺度缺陷检测方法。该方法借助无监督特征融合整合双模态特征,引入信息瓶颈抑制单模态噪声,并构建特征金字塔改善模型对多变缺陷尺度的适配能力,在MVTec-3D AD数据集上性能优于多数现有算法。消融实验表明RGB图像与点云对检测任务贡献不同,后续将研究双模态最优权重分配,更加充分地挖掘多模态信息。

结论

       针对工业缺陷尺度多变、单模态缺陷难以识别的问题,提出基于归一化流的多模态多尺度缺陷检测方法。该方法借助无监督特征融合整合双模态特征,引入信息瓶颈抑制单模态噪声,并构建特征金字塔改善模型对多变缺陷尺度的适配能力,在MVTec-3D AD数据集上性能优于多数现有算法。消融实验表明RGB图像与点云对检测任务贡献不同,后续将研究双模态最优权重分配,更加充分地挖掘多模态信息。

相关案例