目标数据:统计上市公司年报全篇总词数和环保类关键词词数。
以长春高新(000661)2021年年度报告为例。
首先,由于年报文件为pdf格式,jieba无法直接处理,因此我们用pdfplumber读取pdf文件所有内容,并将其拼接成一整个字符串。代码如下:
import pdfplumber
path = '000661:2021年年度报告.pdf'
pdf = pdfplumber.open(path)
text_all = ""
for page in pdf.pages:
text = page.extract_text()
text_all = text_all+'\n'+text #字符串拼接
print(text_all)
运行得到该pdf所有内容的字符串,部分结果截图如下:
其次,使用jieba分词器对所得字符串进行分词切割,并导入停用词词典备用,停用词参考链接:https://www.cnblogs.com/demo-deng/p/9771593.html。代码如下:
import jieba
words = jieba.cut(text_all)
stop = open("stopwords.txt", "r", encoding='utf-8&