Scrapy连接到MySQL

最新推荐文章于 2023-06-29 14:21:41 发布

Pascal Jiang

最新推荐文章于 2023-06-29 14:21:41 发布

阅读量3.8k

点赞数 2

分类专栏： MySQL 文章标签：数据库

MySQL 专栏收录该内容

2 篇文章

订阅专栏

本文详细介绍如何在Scrapy项目中设置pipelines.py文件，通过使用pymysql模块将爬虫抓取的数据存储到MySQL数据库中。文章提供了完整的代码示例，包括数据库连接、数据插入及异常处理等关键步骤。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

Scrapy连接到MySQL

修改pipelines.py文件加入如下代码

# 爬取到的数据写入到MySQL数据库
import pymysql
class MySQLPipeline(object):

    # 打开数据库
    def open_spider(self, spider):
        db = spider.settings.get('MYSQL_DB_NAME','scrapy_db')
        host = spider.settings.get('MYSQL_HOST', 'localhost')
        port = spider.settings.get('MYSQL_PORT', 3306)
        user = spider.settings.get('MYSQL_USER', 'root')
        passwd = spider.settings.get('MYSQL_PASSWORD', '123456')

        self.db_conn =pymysql.connect(host=host, port=port, db=db, user=user, passwd=passwd, charset='utf8')
        self.db_cur = self.db_conn.cursor()

    # 关闭数据库
    def close_spider(self, spider):
        self.db_conn.commit()
        self.db_conn.close()

    # 对数据进行处理
    def process_item(self, item, spider):
        self.insert_db(item)
        return item

    #插入数据
    def insert_db(self, item):
        values = (
            item['upc'],
            item['name'],
            item['price'],
            item['review_rating'],
            item['review_num'],
            item['stock'],
        )
        try:
            sql = 'INSERT INTO books VALUES(%s,%s,%s,%s,%s,%s)'
            self.db_cur.execute(sql, values)
            self.db_conn.commit()
            print("Insert finished")
        except:
            print("Insert to DB failed")
            self.db_conn.commit()
            self.db_conn.close()