创建项目
- 在命令行中进入项目要存放的位置
- 输入命令【scrapy startproject FirstScrapy】
编写第一个蜘蛛
在pycharm中进入已经创建好的项目中,在spiders 文件夹下面创建我们要写的py 文件,例如mingyan_spider.py
上面我们已经创建了一个mingyan_spider.py 的文件,那里面到底该写神马呢?当然我们需要遵守scrapy的规则,那一个蜘蛛到底需要神马规则呢?
A:首先我们需要创建一个类,并继承scrapy的一个子类:scrapy.Spider 或者是其他蜘蛛类型,后面会说到,除了Spider还有很多牛X的蜘蛛类型;
B:然后定义一个蜘蛛名,name=“” 后面我们运行的话需要用到;
C:定义我们需要爬取的网址,没有网址蜘蛛肿么爬,所以这是必须滴;
D:继承scrapy的一个方法:start_requests(self),这个方法的作用就是通过上面定义的链接去爬取页面,简单理解就是下载页面。