人脸表情识别

人脸表情识别是计算机视觉重点问题。本方案构建融合时空特征的深度网络,借助三元组度量融合提取峰值图像空域特征,利用人脸关键点轨迹 CNN 获取时域特征,并采用微调策略融合特征。模型在 CK+、MMI、Oulu-CASIA 数据集取得优异精度,性能领先,有效提升视频人脸表情识别效果。

[视觉识别]

  • 图像分类
  • 目标检测
  • 语义分割
  • 实例分割
  • 特征提取
  • 卷积神经网络CNN
  • 图像预处理
  • 光学字符识别OCR
  • 人脸识别
  • 图像匹配
  • 目标跟踪
  • 数据集标注
  • 模型推理
  • 图像增强
  • 多模态视觉
  • 缺陷检测

人脸表情识别

人脸表情识别是计算机视觉重点问题。本方案构建融合时空特征的深度网络,借助三元组度量融合提取峰值图像空域特征,利用人脸关键点轨迹 CNN 获取时域特征,并采用微调策略融合特征。模型在 CK+、MMI、Oulu-CASIA 数据集取得优异精度,性能领先,有效提升视频人脸表情识别效果。

[视觉识别]

研究背景

人脸表情识别应用广泛,现有视频表情识别存在帧信息冗余、难以利用人脸部件先验知识等缺陷。本方案提出融合时空特征的深度网络:采用多阈值三元组度量融合从峰值图像提取空域特征;依托人脸关键点轨迹 CNN 获取时域特征,并设计微调融合策略整合两类特征。方法在 CK+、MMI、Oulu-CASIA 数据集实现优异识别效果,具备四项核心创新,识别性能优于多数现有算法。

研究背景

人脸表情识别应用广泛,现有视频表情识别存在帧信息冗余、难以利用人脸部件先验知识等缺陷。本方案提出融合时空特征的深度网络:采用多阈值三元组度量融合从峰值图像提取空域特征;依托人脸关键点轨迹 CNN 获取时域特征,并设计微调融合策略整合两类特征。方法在 CK+、MMI、Oulu-CASIA 数据集实现优异识别效果,具备四项核心创新,识别性能优于多数现有算法。

基于不同三元组阈值学习得到的特征所进行的类间变化分布可视化原图

基于不同三元组阈值学习得到的特征所进行的类间变化分布可视化原图

算法

1. 基于深度度量融合的空域特征提取
       深度度量学习旨在学习特征嵌入,让同类表情样本特征距离更近、异类更远,依靠三元组损失并设置阈值约束。本方案提出深度度量融合技术,采样多阈值构建多种特征嵌入。DMF子网络由DCNN与N-Metric模块构成,基于VGG16-Face提取基础特征,多条分支在不同三元组损失监督下学习多样表情特征,级联融合后输出高鲁棒性空域特征。

2. 基于人脸关键点轨迹的时域特征提取
       为规避3D CNN巨大计算开销,设计基于人脸关键点轨迹的2D卷积网络LTCNN提取表情时域特征。先对视频均匀采样11帧,检测51个人脸关键点得到运动轨迹,构造类特征图。提供两种输入方案:单通道LTCNN-1CL与双通道LTCNN-2CL,分别采用不同坐标组合方式构建网络输入特征图。

算法

1. 基于深度度量融合的空域特征提取
       深度度量学习旨在学习特征嵌入,让同类表情样本特征距离更近、异类更远,依靠三元组损失并设置阈值约束。本方案提出深度度量融合技术,采样多阈值构建多种特征嵌入。DMF子网络由DCNN与N-Metric模块构成,基于VGG16-Face提取基础特征,多条分支在不同三元组损失监督下学习多样表情特征,级联融合后输出高鲁棒性空域特征。

2. 基于人脸关键点轨迹的时域特征提取
       为规避3D CNN巨大计算开销,设计基于人脸关键点轨迹的2D卷积网络LTCNN提取表情时域特征。先对视频均匀采样11帧,检测51个人脸关键点得到运动轨迹,构造类特征图。提供两种输入方案:单通道LTCNN-1CL与双通道LTCNN-2CL,分别采用不同坐标组合方式构建网络输入特征图。

LTCNN子网络:基于人脸关键点轨迹的卷积神经网络结构原图

LTCNN子网络:基于人脸关键点轨迹的卷积神经网络结构原图

3. DMF 与 LTCNN 子网络的最优融合
       本方案网络整合空域DMF与时域LTCNN子网络。对比两类传统方案:决策融合独立训练网络,忽略特征互补;直接特征融合难以适配模块收敛差异。为此提出微调式特征融合策略:先单独训练两个子网络,再拼接特征并端到端微调,设计四种微调方案。实验表明后三种方案可实现特征互补,整体微调获得最优识别精度。

3. DMF 与 LTCNN 子网络的最优融合
       本方案网络整合空域DMF与时域LTCNN子网络。对比两类传统方案:决策融合独立训练网络,忽略特征互补;直接特征融合难以适配模块收敛差异。为此提出微调式特征融合策略:先单独训练两个子网络,再拼接特征并端到端微调,设计四种微调方案。实验表明后三种方案可实现特征互补,整体微调获得最优识别精度。

  • 基于决策融合的后期融合策略原图

  • 基于特征融合的前期融合策略原图

  • 基于决策融合的后期融合策略原图

  • 基于特征融合的前期融合策略原图

实验结果

       DMF与LTCNN两大子网络训练方案:对峰值帧做人脸预处理、多方式数据增强,采用批次难例挖掘构建三元组;设置7组阈值搭建DMF多分支结构并完成端到端训练。LTCNN借助DAN检测关键点,坐标归一化后实施数据增强,确定网络结构与训练参数。多组实验验证:多阈值 DMF优于单阈值;双通道LTCNN特征图效果更佳;整体微调融合策略性能最优。对比现有算法,该时空融合模型在 CK+、MMI、Oulu-CASIA 数据集综合表现突出,仅部分相似表情易产生混淆。

实验结果

       DMF与LTCNN两大子网络训练方案:对峰值帧做人脸预处理、多方式数据增强,采用批次难例挖掘构建三元组;设置7组阈值搭建DMF多分支结构并完成端到端训练。LTCNN借助DAN检测关键点,坐标归一化后实施数据增强,确定网络结构与训练参数。多组实验验证:多阈值 DMF优于单阈值;双通道LTCNN特征图效果更佳;整体微调融合策略性能最优。对比现有算法,该时空融合模型在 CK+、MMI、Oulu-CASIA 数据集综合表现突出,仅部分相似表情易产生混淆。

DMF子网络中不同分支上的特征可视化结果原图

DMF子网络中不同分支上的特征可视化结果原图

  • 单分支 DMF 网络在不同阈值的识别精度

  • 不同融合策略的识别精度

  • 单分支 DMF 网络在不同阈值的识别精度

  • 不同融合策略的识别精度

结论

       本方案面向视频人脸表情识别,构建融合时空特征网络:利用多阈值三元组度量融合提取空域特征,依托关键点轨迹 2D CNN 获取时域特征,采用整体微调策略融合特征。在 CK+、MMI、Oulu-CASIA 数据集验证算法性能优越。最后从多模态融合、特征融合方案、跨数据集泛化三方面提出后续研究方向。

结论

       本方案面向视频人脸表情识别,构建融合时空特征网络:利用多阈值三元组度量融合提取空域特征,依托关键点轨迹 2D CNN 获取时域特征,采用整体微调策略融合特征。在 CK+、MMI、Oulu-CASIA 数据集验证算法性能优越。最后从多模态融合、特征融合方案、跨数据集泛化三方面提出后续研究方向。

相关案例