这是之前的一个小例子,现在记下。越来越觉得学习编程开发,不写笔记不写博客简直就是白学,所以现在把这些记下来。这个抓取的网站无需登录。主要是想记住几个bs函数的用法。
代码如下:
01 |
import urllib2 |
02 |
import re |
03 |
from BeautifulSoup import BeautifulSoup |
04 |
05 |
url = "http://www.realestate.com.au/neighbourhoods/brendale-4500-qld" |
06 |
response = urllib2.urlopen(url) #获取网站源码 |
07 |
data = response.read() |
08 |
soup = BeautifulSoup(''.join(data)) #bs的用法,解析网站结构 |
09 |
a = soup.findAll( 'div' ,{ 'class' : 'slide-section median-price-subsections trend' },text = None ) #find及findAll 在bs中特别有用。可以根据标签和属性找到相应目录 |
10 |
b = a[ 0 ].get( 'data-trend' ) #解析到的结果是一个数组,用get方法可以得到每一个条目的具体属性值 |
11 |
print b |