国内刊号:11-5602/TP
国际刊号:1673-9418
发布日期:
作者:何允栋, 李平, 平晨昊
单位:杭州电子科技大学 计算机学院,杭州 310018
关键词:动作识别,点云,自监督学习,掩码,注意力机制
点云动作识别方法可以提供精准的三维动作监测与识别服务,在智能交互、智能安防和医疗健康等领域具有广阔应用前景。现有方法通常利用大量标注的点云数据训练模型,但点云视频包含大量的三维坐标,精准标注点云非常昂贵,同时点云视频高度冗余,点云信息在视频中分布不均,这些问题都增大了标注的难度。为解决上述问题并获得更好的点云动作识别性能,提出一种无需人工标注即可捕获点云视频时空结构的掩码自监督动作识别方法MSTD-Transformer。将点云视频划分为点管并根据重要性进行自适应视频级掩码,通过点云重构和运动预测双流自监督学习点云视频的外观和运动特征。为了更好地捕获运动信息,MSTD-Transformer从点云关键点的位移中提取动态注意力并嵌入Transformer,使用双分支结构进行差异化学习,分别捕获运动信息和全局结构。在标准数据集MSRAction-3D上的实验结果表明,提出的方法对24帧点云视频动作识别准确率为96.17%,较现有最好方法提高2.09个百分点,证实了掩码策略和动态注意力的有效性。
来源:2024年第12期
《计算机科学与探索》期刊编辑部