3D CNN 动作识别:体育手势识别应用
1. 动作识别方法概述
在动作识别领域,有多种方法和模型被提出,以提高视频分类和理解的准确性。
1.1 基于深度学习的模型
- I3D 模型 :在 ImageNet 和 Kinetics - 400 数据集上进行训练,Kinetics - 400 数据集比 UCF101 更复杂,有 400 个类别。使用 Kinetics 数据集后,在 UCF101 上的性能从 93.4% 提升到 98%,在 Kinetics - 400 数据集上的准确率达到 74.2%。Inception 模块在 ImageNet 数据集的图像分类中已证明其有效性,并成功应用于 I3D 模型中。
- LTC CNN :由 [VLS18] 引入,通过试验不同时间大小的输入视频片段来改进分类。考虑更多帧作为输入时,能获得更好的准确率,尤其对于具有较长时间支持的持久动作。
- STPP :[WGW + 18] 引入了时空金字塔池化层(STPP),使用 3D 卷积在由 RGB 和光流(OF)流提供的双流网络中。输出作为 LSTM 网络的输入,LSTM 允许对任意大小和长度的视频进行分类。RGB 和 OF 流的准确率分别为 85% 和 83.8%,融合后该方法的准确率达到 92.6%。
- BERT 层 :[KKA20] 引入了来自 Transformer 的双向编码器表示(BERT)层,以更好地利用 BERT 注意力机制的时间信息。将 BERT 层融入 R
超级会员免费看
订阅专栏 解锁全文


被折叠的 条评论
为什么被折叠?



