论文Convolutional Naural Networks for Sentence Classification--TensorFlow实现篇

最新推荐文章于 2024-04-06 19:12:50 发布

原创

最新推荐文章于 2024-04-06 19:12:50 发布 · 9.4k 阅读

21 ·

CC 4.0 BY-SA版权

文章标签：

#神经网络 #cnn #tensorflow #文本分类 #深度学习

这篇博客介绍了如何使用TensorFlow实现论文中提出的卷积神经网络（CNN）进行文本分类。作者参考了Denny Britz的博文，并针对Movie Review数据集进行了实验。文章详细解释了数据预处理、CNN网络结构，包括卷积层、池化层等，并提供了训练代码。最后，讨论了训练过程和TensorBoard的可视化结果。

其实该论文作者已经将文章代码提供了出来，该代码用的是Theano实现的，但是因为最近看了TensorFlow，所以想着用用练练手，所以本文主要参考Denny Britz的一篇博文来实现CNN和本篇论文，其代码也上传到了github上。说到Denny Britz，大神就是大神，之前也读过他一篇介绍CNN在NLP领域应用场景和方法的文章，写的很透彻也被很多国内网友翻译和转载，他的博客上有很多好的文章，有事Ian一定要好好读一遍，瞻仰和膜拜一下==

因为刚接触TensorFlow，之前只是安装好跑过一两个例子，对其大致了解了一下，知道了Graph、Tensor、Session等一些基本概念。这里就分析一下大神的代码，自己按着撸一遍，边学习TensorFlow边实现论文仿真。好了，废话不多说，开始看代码。

1，实验数据

实验所用的数据集是Movie Review data from Rotten Tomatoes，即MR电影评论数据，其中包含10662条评论，一半正面评论，一般负面。共包含18758个单词（vocab_size），最长的评论有56个单词（Padding，sequence_len），保存在data目录下的rt-polarity.neg和rt-poliarity.pos文件中。这里我们使用10%作为验证集，剩下的作为训练集。数据预处理部分写在data_helpers.py文件中，其实代码很简单，这里仅对load_data_and_labels函数进行介绍：

def load_data_and_labels(positive_data_file, negative_data_file):
    #读取正面、负面评论保存在列表中
    positive_examples = list(open(positive_data_file, "r").readlines())
    positive_examples = [s.strip() for s in positive_examples]
    negative_examples = list(open(negative_data_file, "r").readlines())
    negative_examples = [s.strip() for s in negative_examples]
    #调用clean_str()函数对评论进行处理，安单词进行分割，保存在x_text列表中
    x_text = positive_examples + negative_examples
    x_text = [clean_str(sent) for sent in x_text]
    #为每个评论添加标签，并保存在y中
    positive_labels = [[0, 1] for _ in positive_examples]
    negative_labels = [[1, 0] for _ in negative_examples]
    y = np.concatenate([positive_labels, negative_labels], 0)
    return [x_text, y]

读取完之后还要对样本进行处理以获得vocabulary并将每个样本转化为单词索引列表。这一部分的代码在train.py中实现。代码入下：

#载入实验数据
x_text, y = data_helpers.load_data_and_labels(FLAGS.positive_data_file, FLAGS.negative_data_file)

#获得句子的最大长度，用于padding。这里其值为56
max_document_length = max([len(x.split(" ")) for x in x_text])
#调用tf内部函类VocabularyProcessor，其会读取x_text，按照词语出现顺序构建vocabulary，并给每个单词以索引，然后返回的x是形如[[1,2,3,4...],...,[55,66,777...]]的嵌套列表。内列表代表每个句子，其值是评论中每个词在vocabulary中的索引。所以x是10662*56维
vocab_processor = learn.preprocessing.VocabularyProcessor(max_document_length)
x = np.array(list(vocab_processor.fit_transform(x_text)))

# Randomly shuffle data将数据进行随机打乱
np.random.seed(10)
shuffle_indices = np.random.permutation(np.arange(len(y)))
x_shuffled = x[shuffle_indices]
y_shuffled = y[shuffle_indices]

# Split train/test set构建训练集和验证集
dev_sample_index = -1 * int(FLAGS.dev_sample_percentage * float(len(y)))
x_train, x_dev = x_shuffled[:dev_sample_index], x_shuffled[dev_sample_index:]
y_train, y_dev = y_shuffled[:dev_sample_index

最低0.47元/天解锁文章

4 条评论

旺仔的算法coding笔记 2019.06.27
conv2d处，"padding：“SAME”或者“VALID”，意味着宽卷积和窄卷积。”same为进行补0，valid为不补，舍弃。

旺仔的算法coding笔记 2019.06.27
conv2d处，"padding：“SAME”或者“VALID”，意味着宽卷积和窄卷积。”same为进行补0，valid为不补，舍弃。

Fancy G 2019.06.17
博主，可以分享以下数据集吗？这个数据集不能下载了，万分感谢，邮箱：942071614@qq.com

wzs要努力鸭 2019.04.26
博主你好这个数据集在哪下载呢找不到[face]monkey:0.gif[/face] 您能分享一下吗

霍姆格雷特 2018.04.10
博主你好，请教一下。这里l2_reg_lambda：正则化强度。默认为0 。l2正则系数默认为0的话，是不是意味着没有进行l2正则处理？
- JepsonWong回复霍姆格雷特 2018.04.26
  [reply]HOMEGREAT[/reply] 是呀，源代码默认0呀，你可以自己设置系数看看效果呀

超超92 2018.01.28
展开成两维Tensor[None,384] 请问这里的目的是什么？
- liuchongee回复超超92 2018.02.04
  [reply]gouchao92[/reply] 不是有这个变量吗，num_epochs。执行这么多个循环就会停止。
- 超超92回复liuchongee 2018.02.03
  [reply]liuchonge[/reply] 请问 train_step 神经网络的停止条件是什么？里面没有设置迭代次数之类的吧
- 超超92回复liuchongee 2018.02.03
  [reply]liuchonge[/reply] 谢谢作者。请问每一次train_step 的停止条件是什么？
- liuchongee回复超超92 2018.01.29
  [reply]gouchao92[/reply] 因为接下来要把这个向量输入全连接层，所以把其进行flatten方便将每个卷积的输出都变成一个维度进行计算