python爬虫 - requests

最新推荐文章于 2025-12-25 14:57:52 发布

原创最新推荐文章于 2025-12-25 14:57:52 发布 · 446 阅读

0 ·

CC 4.0 BY-SA版权

文章标签：

#python #爬虫 #开发语言

本文介绍了Python的requests库用于网络请求的基本用法，包括get方法获取网页内容，设置解码方式处理乱码，以及通过response对象获取文本、二进制和json数据。同时，讲解了如何添加Header，如伪装浏览器、设置Cookie和代理，以及如何下载图片到本地文件。

DAY1-requests

一、request基本用法

1.请求网络数据：requests.get(请求地址)

response = requests.get('https://baijiahao.baidu.com/s?id=1761446546165450192')

2.设置解码方式（乱码的是需要设置 - 一定要在获取请求结果之前设置）

response.encoding = 'utf-8'

3.获取请求结果

1）获取请求结果对应的文本数据 - 爬网页

print(response.text)

2)获取二进制格式的请求结果 - 下载图片、视频、音频

print(response.content)

3）获取请求结果json转换的结果 - json接口

print(response.json())

二、添加Header

import requests

1. 发送请求

添加header: a. 浏览器伪装(user-agent)、b.免密登录(cookie)、 c. 设置代理(proxies)

headers = {
    'cookie': 'bid=58Gyjz_NAcA; ll="118318"; douban-fav-remind=1; viewed="36164018_36221918"; ap_v=0,6.0',
    'user-agent': 'Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/108.0.0.0 Safari/537.36'
}
response = requests.get('https://movie.douban.com/top250', headers=headers)

2. 获取结果

result = response.text
print(result)

三、下载图片

import requests

1.获取网络图片数据

response = requests.get('https://img0.baidu.com/it/u=793843167,4251357724&fm=253&fmt=auto&app=138&f=JPEG?w=691&h=500')
result = response.content
print(type(result))     # <class 'bytes'>

2.保存图片数据到本地文件

with open('files/a.jpg', 'wb') as f:
    f.write(result)