Python 爬虫--[最简单的爬虫例子]

Python 爬虫–[最简单的爬虫例子]

1、拷贝代码

#!/usr/bin/python
# -*- coding: UTF-8 -*-

import requests
from bs4 import BeautifulSoup

movie_url = 'https://movie.douban.com/subject/1292052/'


def download_page(url):
    headers = {
        'User-Agent': 'Mozilla/5.0 (Macintosh; Intel Mac OS X 10_11_12)AppleWebKit/537.36 (KHTML, like Gecko) '
                      'Chrome/47.0.2526.80 Safari/537.36 '
    }

    data = requests.get(url, headers=headers).content
    return data


def paser_html(html):
    soup = BeautifulSoup(html, 'lxml')
    title = soup.find(property='v:itemreviewed').string

    return title


def main():
    print(paser_html(download_page(movie_url)))


if __name__ == '__main__':
    main()

2、编译程序

  • 可能会编译出错
    在这里插入图片描述
    *我们主要关注最后一排报错,一般报错是因为缺少包,我们在pycharm的终端下载一下就好了。
    例如:上图显示缺少 ‘pandas’
    我们只需要点击终端,然后输入 pip install <缺失的包>
    最后等待下载完成,重新编译就可以了~
    在这里插入图片描述
    *例如缺少的是‘lxml’
    同样的我们在终端输入: pip install lxml
    等待下载完成,重新编译,就可以了~
    在这里插入图片描述

3、实验结果

在这里插入图片描述

  • 通过爬取豆瓣网站上的某个具体链接,我们爬取得到:该链接是电影《肖申克的救赎》 “The Shawshank Redemption”

总结

这是个非常简单的爬虫例子,通过这个例子,我们可以非常直观的看到爬虫是怎么通过代码爬取我们需要的信息,有了这一理性的认知之后,我们再从代码入手,一点点往里学习爬虫的奥秘,同时也可以学习python,就很好玩,对不对~

------[分界线]-------

参考:ywz2008008 一个最基本最简单的爬虫代码【精简】

评论 3
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

JR_Sim

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值