# -*- coding: utf-8 -*-
#---------------------------------------
#爬取百度贴吧关于sandy的资料
#操作:输入带分页的地址,去掉最后面的数字,设置一下起始页数和终点页数。
#功能:下载对应页码内的所有页面并存储为html文件
#---------------------------------------
import string, urllib2
#定义贴吧函数
def baidu_tieba(url,begin_page,end_page):
for i in range(begin_page, end_page+1):
sName = string.zfill(i,5) + '.html' #自动填充成5位的文件名,形如0000i.html,type=str。help(string.zfill)
path = '/Users/enniu/Desktop/' + sName
print '正在下载第' + str(i) + '个网页,并将其存储为' + sName + '......'
f = open(path,'w+') #如果使用sName,则下载到python当前的.py文件所在目录
m = urllib2.urlopen(url + str(i)).read()
f.write(m)
f.close()
if __name__=="__main__":
url='http://tieba.baidu.com/p/4705545874?pn='
begin_page=1
end_page=2
baidu_tieba(url,begin_page,end_page)
参考:
http://blog.youkuaiyun.com/pleasecallmewhy/article/details/8927832