爬虫--01：爬虫的简介

最新推荐文章于 2024-07-22 12:28:17 发布

原创

最新推荐文章于 2024-07-22 12:28:17 发布 · 置顶 · 413 阅读

CC 4.0 BY-SA版权

文章标签：

本文介绍了爬虫的基本概念，包括HTTP协议的端口、通讯协议、网络模型，HTTPS和SSL的解释，以及HTTP请求与响应。接着讲解了Python爬虫的作用、需求和分类，并对比了与其他语言的优势。最后，阐述了GET和POST请求方法、URL组成部分，以及网络抓包工具的重要性。

一、爬虫的简介

我们想要进行数据通讯需要哪几部？
- 1、找到对方IP
- 2、数据发送到对方指定的应用程序上。为了标识这些应用程序,所以给这些网络应用程序都用数字进行了标识。为了方便称呼这个数字,叫做端口。这里的端口我们一般都叫做 ‘逻辑端口’。
- 3、定义通讯规则。这个通讯规则我们一般称之为‘协议‘。

在这里插入图片描述

HTTP通信由两部分组成：客户端请求消息与服务器响应消息
1、当用户在浏览器的地址栏中输入一个URL并按回车键之后，浏览器会向HTTP服务器发送HTTP请求。HTTP请求主要分为“Get”和“Post”两种方法。
2、当我们在浏览器输入URL http://www.baidu.com 的时候，浏览器发送一个Request请求去获取 http://www.baidu.com 的html文件，服务器把Response文件对象发送回给浏览器。
3、浏览器分析Response中的 HTML，发现其中引用了很多其他文件，比如Images文件，CSS文件，JS文件。浏览器会自动再次发送Request去获取图片，CSS文件，或者JS文件。
4、当所有的文件都下载成功后，网页会根据HTML语法结构，完整的显示出来了。

URL只是标识资源的位置，而HTTP是用来提交和获取资源。客户端发送一个HTTP请求到服务器的请求消息，包括以下格式：
请求行、请求头部、空行、请求数据
四个部分组成，下图给出了请求报文的一般格式。


Request Method: GET
Status Code: 200 OK
Remote Address: 39.156.66.14