分心驾驶行为识别
针对CNN分心驾驶识别模型全局特征提取不足、ViT难以捕捉局部特征且参数量大的问题,提出融合全局与局部特征的两阶段ViT识别方法。构建token信息补充模块、特征交互模块与两阶段注意力模块,融合ViT全局特征与MobileNetV3局部特征并降低计算开销。在公开客运车辆数据集测试,准确率分别达99.69%、96.87%,精度优于ViT-B_16与TransFG,FLOPs明显降低。该方法可精准识别真实场景分心驾驶行为,鲁棒性良好,为图像分类任务提供新思路。
分心驾驶行为识别
针对CNN分心驾驶识别模型全局特征提取不足、ViT难以捕捉局部特征且参数量大的问题,提出融合全局与局部特征的两阶段ViT识别方法。构建token信息补充模块、特征交互模块与两阶段注意力模块,融合ViT全局特征与MobileNetV3局部特征并降低计算开销。在公开客运车辆数据集测试,准确率分别达99.69%、96.87%,精度优于ViT-B_16与TransFG,FLOPs明显降低。该方法可精准识别真实场景分心驾驶行为,鲁棒性良好,为图像分类任务提供新思路。
分心驾驶是道路安全重大隐患,亟需实现实时可靠的行为识别。识别技术分为接触式与计算机视觉非接触方案,后者综合优势显著。CNN擅长局部特征提取,但难以建模全局语义;ViT 可有效捕获全局信息,却存在局部特征提取不足、参数量与计算开销大的问题,不适用于车载嵌入式场景。针对上述缺陷,提出融合ViT全局特征与CNN局部特征的两阶段分心驾驶识别方法。设计token信息补充模块充分利用多层特征;构建特征交互模块,借助自注意力与交叉注意力完成特征交互;提出两阶段注意力机制,通过token筛选策略削减计算量,兼顾识别精度与推理效率。
分心驾驶是道路安全重大隐患,亟需实现实时可靠的行为识别。识别技术分为接触式与计算机视觉非接触方案,后者综合优势显著。CNN擅长局部特征提取,但难以建模全局语义;ViT 可有效捕获全局信息,却存在局部特征提取不足、参数量与计算开销大的问题,不适用于车载嵌入式场景。针对上述缺陷,提出融合ViT全局特征与CNN局部特征的两阶段分心驾驶识别方法。设计token信息补充模块充分利用多层特征;构建特征交互模块,借助自注意力与交叉注意力完成特征交互;提出两阶段注意力机制,通过token筛选策略削减计算量,兼顾识别精度与推理效率。
1.State Farm数据集
现有分心驾驶研究多采用State Farm公开数据集,其包含10类驾驶行为、27879幅RGB图像,按8:2划分训练、测试集并完成类别标注。但该数据集源于模拟驾驶环境,存在动作范式单一、场景背景匮乏、采集视角固定等问题,无法贴合真实驾驶的复合操作行为。仿真数据与实景存在语义差异,致使模型真实场景泛化能力与识别精度偏低。为此,本方案构建真实道路场景下的客运车辆分心驾驶数据集,有效弥补仿真数据缺陷,显著提升模型的实景适配能力与识别性能。
1.State Farm数据集
现有分心驾驶研究多采用State Farm公开数据集,其包含10类驾驶行为、27879幅RGB图像,按8:2划分训练、测试集并完成类别标注。但该数据集源于模拟驾驶环境,存在动作范式单一、场景背景匮乏、采集视角固定等问题,无法贴合真实驾驶的复合操作行为。仿真数据与实景存在语义差异,致使模型真实场景泛化能力与识别精度偏低。为此,本方案构建真实道路场景下的客运车辆分心驾驶数据集,有效弥补仿真数据缺陷,显著提升模型的实景适配能力与识别性能。
State Farm数据集类别示意图原图
2. 自建数据集
针对State Farm模拟数据集场景单一、泛化性差的问题,依托车载红外与高清监控设备,采集多车辆、多路况、全天候、多气象条件下的真实驾驶视频数据。通过视频筛选、固定帧采样与相似度去重预处理,构建含34477幅图像的客运车辆分心驾驶数据集。结合职业驾驶员行为特征,将数据划分为安全驾驶、打电话、玩手机、抽烟四类,并采用八视角采集方式,能够全面、精准表征真实复杂路况下的驾驶员分心行为特征。
2. 自建数据集
针对State Farm模拟数据集场景单一、泛化性差的问题,依托车载红外与高清监控设备,采集多车辆、多路况、全天候、多气象条件下的真实驾驶视频数据。通过视频筛选、固定帧采样与相似度去重预处理,构建含34477幅图像的客运车辆分心驾驶数据集。结合职业驾驶员行为特征,将数据划分为安全驾驶、打电话、玩手机、抽烟四类,并采用八视角采集方式,能够全面、精准表征真实复杂路况下的驾驶员分心行为特征。
客运车辆分心驾驶行为数据集多视角图原图
基于TransFG架构改进,提出融合全局与局部特征的两阶段ViT识别算法TS-ViT。算法采用分级推理机制实现高效识别:第一阶段通过粗细粒度斑块筛选与ViT轻量化推理,依据置信度阈值快速输出可靠结果,筛选疑难样本;第二阶段针对复杂场景难样本,融合ViT全局特征与MobileNetV3局部特征,通过特征交互模块完成精细推理。模型采用双阶段参数共享机制降低计算开销,并引入token信息补充、特征交互与两阶段注意力模块,有效提升复杂场景下分心驾驶行为的识别精度与推理效率。
1. 特征交互模块
传统CNN与Transformer特征融合方式较为简单,难以充分挖掘全局与局部特征的互补关联,融合效果有限。为此,设计特征交互模块,依托Transformer与MobileNetV3的QKV交叉交互实现双特征深度融合。模块通过多层注意力聚合与二值空间掩码抑制背景噪声、强化前景特征;同时构建双路径特征增强分支,结合深度可分离卷积完成特征维度对齐,并通过自注意力与交叉注意力机制实现精细特征交互,有效提升模型在复杂驾驶场景下的细粒度特征辨识能力。
基于TransFG架构改进,提出融合全局与局部特征的两阶段ViT识别算法TS-ViT。算法采用分级推理机制实现高效识别:第一阶段通过粗细粒度斑块筛选与ViT轻量化推理,依据置信度阈值快速输出可靠结果,筛选疑难样本;第二阶段针对复杂场景难样本,融合ViT全局特征与MobileNetV3局部特征,通过特征交互模块完成精细推理。模型采用双阶段参数共享机制降低计算开销,并引入token信息补充、特征交互与两阶段注意力模块,有效提升复杂场景下分心驾驶行为的识别精度与推理效率。
1. 特征交互模块
传统CNN与Transformer特征融合方式较为简单,难以充分挖掘全局与局部特征的互补关联,融合效果有限。为此,设计特征交互模块,依托Transformer与MobileNetV3的QKV交叉交互实现双特征深度融合。模块通过多层注意力聚合与二值空间掩码抑制背景噪声、强化前景特征;同时构建双路径特征增强分支,结合深度可分离卷积完成特征维度对齐,并通过自注意力与交叉注意力机制实现精细特征交互,有效提升模型在复杂驾驶场景下的细粒度特征辨识能力。
TS-ViT网络结构原图
特征交互模块原图
2. token信息补充模块
标准ViT仅依托最后一层类别令牌完成分类,丢失网络浅层与中层特征信息,细粒度表征能力受限。针对该问题,本文提出令牌信息补充模块,抽取多层Transformer的类别令牌进行多分支预测,通过加权交叉熵损失融合各层输出,充分挖掘多层特征互补信息。同时, TS-ViT算法构建双阶段损失函数,分别对应两阶段推理任务,通过超参数自适应平衡双阶段损失权重,联合优化模型整体参数,进一步提升分心驾驶行为识别的精准度与稳定性。
3.两阶段注意力
为解决多头注意力机制可扩展性差、计算开销大的问题,提出动态查询感知稀疏注意力机制,采用“粗筛选+细计算”的分级策略降低模型运算复杂度。该机制首先对输入特征图进行区域划分,通过区域特征均值计算生成语义邻接矩阵,量化不同特征区域的关联程度;再依据拓扑相关性筛选各区域的核心关联区域,剔除无效冗余键值对,实现注意力稀疏降维;最后基于筛选后的有效特征区域执行逐token细粒度注意力计算,完成特征加权与全局特征重组。该方法在保留关键语义关联的前提下,大幅削减冗余计算,有效提升模型推理效率,适配车载场景的轻量化部署需求。
2. token信息补充模块
标准ViT仅依托最后一层类别令牌完成分类,丢失网络浅层与中层特征信息,细粒度表征能力受限。针对该问题,本文提出令牌信息补充模块,抽取多层Transformer的类别令牌进行多分支预测,通过加权交叉熵损失融合各层输出,充分挖掘多层特征互补信息。同时, TS-ViT算法构建双阶段损失函数,分别对应两阶段推理任务,通过超参数自适应平衡双阶段损失权重,联合优化模型整体参数,进一步提升分心驾驶行为识别的精准度与稳定性。
3.两阶段注意力
为解决多头注意力机制可扩展性差、计算开销大的问题,提出动态查询感知稀疏注意力机制,采用“粗筛选+细计算”的分级策略降低模型运算复杂度。该机制首先对输入特征图进行区域划分,通过区域特征均值计算生成语义邻接矩阵,量化不同特征区域的关联程度;再依据拓扑相关性筛选各区域的核心关联区域,剔除无效冗余键值对,实现注意力稀疏降维;最后基于筛选后的有效特征区域执行逐token细粒度注意力计算,完成特征加权与全局特征重组。该方法在保留关键语义关联的前提下,大幅削减冗余计算,有效提升模型推理效率,适配车载场景的轻量化部署需求。
token信息补充模块细节图原图
两阶段注意力原图
基于PyTorch框架、Tesla V-100 GPU完成模型训练与测试,以准确率与浮点运算量作为核心评价指标。实验以ViT-B_16、MobileNetV3-Large分别作为两阶段主干网络,统一设置训练参数与图像预处理方案,并根据数据集特性适配各模块超参与分层特征选取策略。在公开与自建数据集上的对比实验表明,所提TS-ViT模型精度显著优于主流CNN、Transformer及特征融合算法,仅小幅增加计算开销。混淆矩阵与注意力可视化结果证实,模型可有效聚焦驾驶人脸与手部关键区域,抗背景干扰能力强,仅在姿态、特征高度相似或弱光复杂场景存在少量误判,整体泛化性能优异。参数实验确定了最优推理阈值与分层特征组合,有效平衡识别精度与计算成本。消融实验验证了本文特征交互、token信息补充、两阶段注意力三大模块的有效性,其中特征交互模块增益最为显著,多模块协同可进一步提升模型综合识别性能。
基于PyTorch框架、Tesla V-100 GPU完成模型训练与测试,以准确率与浮点运算量作为核心评价指标。实验以ViT-B_16、MobileNetV3-Large分别作为两阶段主干网络,统一设置训练参数与图像预处理方案,并根据数据集特性适配各模块超参与分层特征选取策略。在公开与自建数据集上的对比实验表明,所提TS-ViT模型精度显著优于主流CNN、Transformer及特征融合算法,仅小幅增加计算开销。混淆矩阵与注意力可视化结果证实,模型可有效聚焦驾驶人脸与手部关键区域,抗背景干扰能力强,仅在姿态、特征高度相似或弱光复杂场景存在少量误判,整体泛化性能优异。参数实验确定了最优推理阈值与分层特征组合,有效平衡识别精度与计算成本。消融实验验证了本文特征交互、token信息补充、两阶段注意力三大模块的有效性,其中特征交互模块增益最为显著,多模块协同可进一步提升模型综合识别性能。
识别结果的混淆矩阵原图
两阶段注意力可视化信息原图
两阶段可视化信息原图
针对 ViT 参数量大、算力成本高及复杂场景识别不佳的问题,本方案融合 ViT 全局特征与 MobileNetV3 局部特征,提出两阶段分心驾驶识别模型 TS-ViT。模型分阶段优化识别效果,有效剔除背景干扰,实现性能与推理效率的平衡。后续将引入姿态估计,解决模型类别误判问题。
针对 ViT 参数量大、算力成本高及复杂场景识别不佳的问题,本方案融合 ViT 全局特征与 MobileNetV3 局部特征,提出两阶段分心驾驶识别模型 TS-ViT。模型分阶段优化识别效果,有效剔除背景干扰,实现性能与推理效率的平衡。后续将引入姿态估计,解决模型类别误判问题。