豆瓣是一个社区网站,创立于2005年3月6日。该网站以书影音起家,提供关于书籍,电影,音乐等作品信息,其描述和评论都是由用户提供的,是Web2.0网站中具有特色的一个网站。
豆瓣电影top250网址:https://movie.douban.com/top250?start=0&filter=
BeautifulSoup解析提取信息的具体过程请看BeautifulSoup爬取豆瓣电影top250信息 ,我在其中具体讲解了BeautifulSoup的用法,下面的内容是我把它输出的内容写入Excel表格。
把上面的信息改为写进表格,源码如下:
#!/usr/bin/env python3
# -*- coding: utf-8 -*-
import re
import urllib.request
from bs4 import BeautifulSoup
import xlwt
urls = "https://movie.douban.com/top250"
html = urllib.request.urlopen(urls).read()
soup = BeautifulSoup(html, "html.parser")
all_page=[]
print(u'网站名称:', soup.title.string.replace("\n", ""))
# 定位代码范围、爬虫部分
def part(url):
html = urllib.request.urlopen(url).read()
soup = BeautifulSoup(html, "html.parser")
for tag in soup.find_all(attrs={
"class": "item"}):
try:
ta=tag.find('em').string