机器学习笔记 - 使用3D卷积神经网络进行视频分类

坐望云起

已于 2023-12-17 10:50:05 修改

阅读量1.2k

点赞数

CC 4.0 BY-SA版权

分类专栏：深度学习从入门到精通文章标签： cnn 人工智能神经网络 3D CNN 视频分类 keras

于 2023-10-14 10:56:51 首次发布

本文链接：https://blog.youkuaiyun.com/bashendixie5/article/details/133706062

深度学习从入门到精通专栏收录该内容

798 篇文章 ¥99.90 ¥299.90

订阅专栏

本文介绍了如何使用(2+1)D卷积神经网络（3D ResNet18）进行视频分类。详细讲述了模型创建、数据预处理、训练过程，并提供了相关参考代码链接。通过分解空间和时间维度，这种模型能有效减少参数数量，提高效率。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

1、导入相应的库

3D CNN 使用三维滤波器来执行卷积。内核能够在三个方向上滑动，而在 2D CNN 中它可以在二维上滑动。

首先安装并导入必要的库，用于处理ZIP文件内容的Remotezip 、用于使用进度条的tqdm 、用于处理视频文件的OpenCV 、用于执行更复杂的张量操作的einops，以及用于在 Jupyter Notebook 中嵌入数据的库。

import tqdm
import random
import pathlib
import itertools
import collections

import cv2
import einops
import numpy as np
import remotezip as rz
import seaborn as sns
import matplotlib.pyplot as plt

import tensorflow as tf
import keras
from keras import layers

了解本专栏