Python淘宝商品比价定向爬虫

最新推荐文章于 2021-09-05 21:45:47 发布

原创

最新推荐文章于 2021-09-05 21:45:47 发布 · 置顶 · 964 阅读

17 ·

CC 4.0 BY-SA版权

文章标签：

#python #正则表达式 #爬虫

1.项目基本信息

目标： 获取淘宝搜索页面的信息，提取其中的商品名称和价格
理解： 淘宝的搜索接口、翻页的处理
URL样式：
在这里插入图片描述

2.程序的结构设计

步骤1：提交商品搜索请求，循环获取页面
步骤2：对于每个页面，提取商品名称和价格信息
步骤3：将信息输出到屏幕上

3.Cookie内容的获取

由于淘宝的反爬机制，需要修改请求头，添加Cookie信息

在这里插入图片描述

运行结果：

在这里插入图片描述

4.代码

import requests
import re

def getHTMLText(url):
    try:
        # \连接多行
        cookie_content = "miid=892389301891538214;cna=hnaTFWsdyW0CAXOXQdBBG5tX;\
                  isg=BLq60XalsXGNxj9VtCMK9zU6CODcaz5FjG8jisSzZs0Yt1rxrPuOVYDFA8NrPLbd;\
                  l=eBMzSVePqmS6XnjtBOfahurza77OSIOYYuPzaNbMiOCP_yfB5sONWZP-fYL6C31Vh6XJR3PXGizJBeYBqQAonxv92j-la_kmn;\
                  thw=cn; tfstk=cQdhB7bxgpWBz-kNMX1Blg1Sq2lAwNUFAtBw_CbpYp-U951mnRyVFGqCbAbYF