一周爬虫集训任务三:学习selenium+IP相关知识

本文介绍了使用Selenium进行自动化测试,包括安装、浏览器驱动配置、元素定位以及模拟登录163邮箱的教程。同时,探讨了IP被封的原因和对策,如设置延迟、伪造User-Agent、使用代理IP,并分享了如何抓取西刺代理构建代理池。

摘要生成于 C知道 ,由 DeepSeek-R1 满血版支持, 前往体验 >

1 任务

Task3(2天)
3.1 安装selenium并学习
1. 安装selenium并学习。
2. 使用selenium模拟登陆163邮箱。
3. 163邮箱直通点:https://mail.163.com/ 。
4. 参考资料:https://blog.youkuaiyun.com/weixin_42937385/article/details/88150379 

3.2 学习IP相关知识
1. 学习什么是IP,为什么会出现IP被封,如何应对IP被封的问题。
2. 抓取西刺代理,并构建自己的代理池。 
3. 西刺直通点:https://www.xicidaili.com/ 。
4. 参考资料:https://blog.youkuaiyun.com/weixin_43720396/article/details/88218204

2 Selenium

2.1 介绍

Selenium是一个用于测试网站的自动化测试工具,支持各种浏览器包括Chrome、Firefox、Safari等主流界面浏览器,同时也支持phantomJS无界面浏览器。并且支持多种操作系统:如Windows、Linux、IOS、Android等。

详细教程可见:Selenium官网教程

2.2 selenium安装

对于python库的安装,一般有两种方式:

  1. 在Windows下以管理员方式打开命令提示符(输入CMD),输入pip install selenium,即可完成selenium安装。
  2. 因为我用的IDE是pycharm,可以直接通过pycharm来下载指定库,步骤如下:
    在这里插入图片描述
    在这里插入图片描述
    在这里插入图片描述
    这样selenium库就成功安装啦~

2.3 下载浏览器驱动

Selenium3.x调用浏览器必须有一个webdriver驱动文件。当Selenium升级到3.0之后,对不同的浏览器驱动进行了规范。如果想使用selenium驱动不同的浏览器,必须单独下载并设置不同的浏览器驱动。

因为我用的是Chrome浏览器,所以这里只提供Chrome驱动文件下载(根据自己的浏览器版本对应选择就好):点击下载chromedrive

我的Chrome浏览器版本(在浏览器的帮助选项中可查得)为:70.0.3538.110(正式版本) (32 位),其对应的chromedrive为:chromedrive 密码:5paf

2.4 设置浏览器驱动

设置浏览器的地址非常简单。我们将解压后的chromedriver.exe文件放到Chrome的安装文件中,Chrome的安装路径可以通过右击桌面的Chrome,点击属性就可以查到。放好后将该路径添加到环境变量中。

我的电脑–>属性–>高级系统设置–>环境变量–>系统变量–>Path,将上述路径目录添加到Path的值中。

验证浏览器驱动是否正常使用:

from selenium import webdriver

driver = webdriver.Chrome() # Chrome浏览器

如果正常使用的话,就会弹出chrome的窗口,并显示chrome正受到自动测试软件的控制。
在这里插入图片描述

2.5 Selenium元素定位

Selenium提供了8种定位方式。

定位方式 在Python selenium中所对应的方法 含义
id find_element_by_id() 通过id定位
name find_element_by_name() 通过name定位
class name find_element_by_class_name() 通过类名进行定位
tag name find_element_by_tag_name() 通过标签定位
link text find_element_by_link_text() 通过完整超链接定位
partial link text find_element_by_partial_link_text() 通过部分链接定位
xpath find_element_by_xpath() 通过xpath定位
css selector find_element_by_css_selector() 通过css选择器进行定位

2.6 Selenium WebDriver功能特性

  1. 多浏览器支持: Selenium WebDriver支持各种Web浏览器,如Firefox,Chrome,Internet Explorer,Opera等等。它还支持一些非传统或罕见的浏览器,如HTMLUnit。
  2. 多编程语言支持: WebDriver还支持大多数常用的编程语言,如Java,C#,JavaScript,PHP,Ruby,Pearl和Python。 因此,用户可以基于自己的能力选择任何一种受支持的编程语言并开始构建测试脚本。
  3. 速度: 与Selenium Suite的其他工具相比,WebDriver的执行速度更快。与RC不同,它不需要任何中间服务器与浏览器通信; 此工具直接与浏览器通信。
  4. 简单命令: Selenium WebDriver中使用的大多数命令都易于实现。
  5. WebDriver方法和类: WebDriver提供多种解决方案来应对自动化测试中的一些潜在挑战。WebDriver还允许测试人员通过动态查找器处理复杂类型的Web元素,如复选框,下拉列表和警报。

2.7 使用selenium模拟登陆163邮箱

要求:使用selenium模拟登陆163邮箱

  1. 登录网页
from selenium import webdriver
import time

#打开浏览器
driver = webdriver.Chrome()
#设置地址
url = "https://mail.163.com/"
#访问网址
driver.get(url)
  1. 定位登录框
    frame标签有frameset、frame、iframe三种,frameset跟其他普通标签没有区别,不会影响到正常的定位。而frame与iframe对selenium定位而言是一样的,内部的元素都会不能直接定位到

    Web应用中经常会遇到frame/iframe 表单嵌套页面的应用,WebDriver 只能在一个页面上对元素识别与定位,对于frame/iframe 表单内嵌页面上的元素无法直接定位。这时就需要通过switch_to.frame()方法将当前定位的主体切换为frame/iframe 表单的内嵌页面中。
    在这里插入图片描述

    而且加载这个iframe需要一定时间,所以需要设一个等待直至获取到标签

time.sleep(1) #设置等待直至获取标签
driver.switch_to.frame(0) 
#找到邮箱账号登录框对应的iframe,由于网页中iframe的id是动态的,所以不能用id寻找。用frame的index来定位,定位第一个frame(index下标从0开始)。
  1. 输入账号
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值