本人的第一次爬虫,爬取后的文章保存在txt文件里。
参考:python3 网络爬虫开发实战
import requests
from requests import RequestException
from pyquery import PyQuery as pq
url = 'https://www.zhihu.com/explore'
headers = {
'User-Agent':
'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit'
'/537.36 (KHTML, like Gecko) Chrome/74.0.3729.169 Safari/537.36'
}
def get_one_page(url):
try:
response = requests.get(url, headers=headers)
if response.status_code == 200:
return response.text
return None
except RequestException:
return None
def write_result(content):
doc = pq(content)
items = doc('.explore-tab .feed-item').items()
with open('explore.txt','a',encoding='utf-8') as file:
for item in items:
question = item.find('h2').text()
author = item.find('.author-link-line').text()
answer = pq(item.find('.content').html()).text()

博主分享了初次尝试爬虫的经历,利用requests和pyquery库抓取了知乎首页的内容,并将结果保存到TXT文件。文中提及,如要导出到CSV文件,需要注意newline=''参数的设置以避免自动换行。
最低0.47元/天 解锁文章
500

被折叠的 条评论
为什么被折叠?



