Pyecharts绘制词云图（权重值）

clearAutumn

于 2021-06-14 16:52:20 发布

阅读量1.5k

点赞数

文章标签： python 大数据爬虫

本文链接：https://blog.youkuaiyun.com/m0_58152036/article/details/117907590

版权

数据

代码

效果图展示

数据

爬取学校官网的任意一篇新闻的内容，然后使用jieba模块对该新闻的内容进行关键字提取，使用得到的提取结果的权重值最高的前50个词语，绘制一个词云图。（这里爬的是我学校的官网）

代码

from urllib.request import urlopen
from bs4 import BeautifulSoup
from jieba.analyse import extract_tags
from pyecharts import WordCloud
response = urlopen("http://www.gxstnu.edu.cn/info/1024/10188.htm")
source = response.read()
source = str(source,encoding="utf-8")
soup01 = BeautifulSoup(source,features="html.parser")
div_content = soup01.find("div",attrs={"class":"v_news_content"})
# print(div_content)
soup02 = BeautifulSoup(str(div_content),features="html.parser")
p_list = soup02.find_all("p")
a_str = ""
for i in p_list:
    a_str = a_str + i.text
# print(a_str)
# 计算权重 取出