selenium+Firefox 初试

weixin_34054931

于 2018-01-09 14:09:00 发布

阅读量76

点赞数

CC 4.0 BY-SA版权

文章标签： python 爬虫测试

原文链接：https://yq.aliyun.com/articles/464315

今天算是忙活这几天以来的第一次实际应用到生产。感觉不错：爬虫无人看守自动爬取了5939条数据。把过程和收获写下来。

xpath方法

　　selenium的核心就是网页元素的选取，这是前提。它所提供的方法功能强大，可是我不太会用，一个上午都在测试元素选取方法，可能也因不同网页而异。今天我就是被这个网页给坑了：

需要找到（跳转）并点击。然而我被兜圈子了，手动点击它都没反应。其实代码很简单：

nextpage = browser.find_element_by_xpath("//input[@value='下一页']") 
nextpage.click()

这是下一页的标签。xpath方法如果找到多个项返回的是list，是不能.click的。因此需要用//input[特征]来指定。
具体selenium信息 http://www.testclass.net/selenium_python/

找表格信息

如图所示。需要取到每行（/tr）的第[x]列，代码如下：

tdx = browser.find_elements_by_xpath('//tbody/tr/td[x]')

另一个心得

　　程序共运行了20分钟，一共爬了394页，期间一直没有保存文件。我期间一直担心万一其中一页打不开了，或者其他错误，那前面几百页就白爬了啊。因此需要在for循环（爬网页）里面加上　　

if pagenum%50 ==0:     wookbook.save('f:/exp.xls')

即每50保存一次。

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。