一周爬虫集训任务三:学习selenium+IP相关知识
1 任务
Task3(2天)
3.1 安装selenium并学习
1. 安装selenium并学习。
2. 使用selenium模拟登陆163邮箱。
3. 163邮箱直通点:https://mail.163.com/ 。
4. 参考资料:https://blog.youkuaiyun.com/weixin_42937385/article/details/88150379
3.2 学习IP相关知识
1. 学习什么是IP,为什么会出现IP被封,如何应对IP被封的问题。
2. 抓取西刺代理,并构建自己的代理池。
3. 西刺直通点:https://www.xicidaili.com/ 。
4. 参考资料:https://blog.youkuaiyun.com/weixin_43720396/article/details/88218204
2 Selenium
2.1 介绍
Selenium是一个用于测试网站的自动化测试工具,支持各种浏览器包括Chrome、Firefox、Safari等主流界面浏览器,同时也支持phantomJS无界面浏览器。并且支持多种操作系统:如Windows、Linux、IOS、Android等。
详细教程可见:Selenium官网教程
2.2 selenium安装
对于python库的安装,一般有两种方式:
- 在Windows下以管理员方式打开命令提示符(输入CMD),输入
pip install selenium
,即可完成selenium安装。 - 因为我用的IDE是pycharm,可以直接通过pycharm来下载指定库,步骤如下:
这样selenium库就成功安装啦~
2.3 下载浏览器驱动
Selenium3.x调用浏览器必须有一个webdriver驱动文件。当Selenium升级到3.0之后,对不同的浏览器驱动进行了规范。如果想使用selenium驱动不同的浏览器,必须单独下载并设置不同的浏览器驱动。
因为我用的是Chrome浏览器,所以这里只提供Chrome驱动文件下载(根据自己的浏览器版本对应选择就好):点击下载chromedrive
我的Chrome浏览器版本(在浏览器的帮助选项中可查得)为:70.0.3538.110(正式版本) (32 位),其对应的chromedrive为:chromedrive 密码:5paf
2.4 设置浏览器驱动
设置浏览器的地址非常简单。我们将解压后的chromedriver.exe
文件放到Chrome的安装文件中,Chrome的安装路径可以通过右击桌面的Chrome,点击属性就可以查到。放好后将该路径添加到环境变量中。
我的电脑–>属性–>高级系统设置–>环境变量–>系统变量–>Path,将上述路径目录添加到Path的值中。
验证浏览器驱动是否正常使用:
from selenium import webdriver
driver = webdriver.Chrome() # Chrome浏览器
如果正常使用的话,就会弹出chrome的窗口,并显示chrome正受到自动测试软件的控制。
2.5 Selenium元素定位
Selenium提供了8种定位方式。
定位方式 | 在Python selenium中所对应的方法 | 含义 |
---|---|---|
id | find_element_by_id() | 通过id定位 |
name | find_element_by_name() | 通过name定位 |
class name | find_element_by_class_name() | 通过类名进行定位 |
tag name | find_element_by_tag_name() | 通过标签定位 |
link text | find_element_by_link_text() | 通过完整超链接定位 |
partial link text | find_element_by_partial_link_text() | 通过部分链接定位 |
xpath | find_element_by_xpath() | 通过xpath定位 |
css selector | find_element_by_css_selector() | 通过css选择器进行定位 |
2.6 Selenium WebDriver功能特性
- 多浏览器支持: Selenium WebDriver支持各种Web浏览器,如Firefox,Chrome,Internet Explorer,Opera等等。它还支持一些非传统或罕见的浏览器,如HTMLUnit。
- 多编程语言支持: WebDriver还支持大多数常用的编程语言,如Java,C#,JavaScript,PHP,Ruby,Pearl和Python。 因此,用户可以基于自己的能力选择任何一种受支持的编程语言并开始构建测试脚本。
- 速度: 与Selenium Suite的其他工具相比,WebDriver的执行速度更快。与RC不同,它不需要任何中间服务器与浏览器通信; 此工具直接与浏览器通信。
- 简单命令: Selenium WebDriver中使用的大多数命令都易于实现。
- WebDriver方法和类: WebDriver提供多种解决方案来应对自动化测试中的一些潜在挑战。WebDriver还允许测试人员通过动态查找器处理复杂类型的Web元素,如复选框,下拉列表和警报。
2.7 使用selenium模拟登陆163邮箱
要求:使用selenium模拟登陆163邮箱
- 登录网页
from selenium import webdriver
import time
#打开浏览器
driver = webdriver.Chrome()
#设置地址
url = "https://mail.163.com/"
#访问网址
driver.get(url)
-
定位登录框
frame标签有frameset、frame、iframe三种,frameset跟其他普通标签没有区别,不会影响到正常的定位。而frame与iframe对selenium定位而言是一样的,内部的元素都会不能直接定位到。Web应用中经常会遇到frame/iframe 表单嵌套页面的应用,WebDriver 只能在一个页面上对元素识别与定位,对于frame/iframe 表单内嵌页面上的元素无法直接定位。这时就需要通过
switch_to.frame()
方法将当前定位的主体切换为frame/iframe 表单的内嵌页面中。
而且加载这个iframe需要一定时间,所以需要设一个等待直至获取到标签
time.sleep(1) #设置等待直至获取标签
driver.switch_to.frame(0)
#找到邮箱账号登录框对应的iframe,由于网页中iframe的id是动态的,所以不能用id寻找。用frame的index来定位,定位第一个frame(index下标从0开始)。
- 输入账号