Python爬取链家北京租房信息！北京租房都租不起啊！

Python爬虫实践：抓取北京租房信息

最新推荐文章于 2024-04-04 20:13:44 发布

原创

最新推荐文章于 2024-04-04 20:13:44 发布 · 453 阅读

2 ·

CC 4.0 BY-SA版权

文章标签：

#python #java #大数据 #列表 #html

本文介绍了一位开发者使用Python进行网络爬虫，抓取链家网站上的北京租房信息。通过for循环、字符串替换、len函数、HTML解析、正则表达式、模拟HEAD、协程和数据类型转换等技术，实现租房数据的获取和处理。同时，作者提到了在学习Python过程中遇到的问题，并鼓励读者交流讨论。

一、效果图

二、代码

import re
from fake_useragent import UserAgent
from lxml import etree
import asyncio
import aiohttp
import pandas as pd
 
# 定义一个类 定义使用的变量  定义get方法通过连接池进行网络请求
class LianjiaSpider(object):
 
    def __init__(self):
        self.ua = UserAgent()  # 获取userAgent类
        self.head = {"User-Agent": self.ua.random}
        self._data = list()  # 初始化list
 
    async def get_page_count(self):
        result = await self.get("https://bj.lianjia.com/zufang/pg1")
        page_html = etree.HTML(result)  # 解析网页
        pageCount = page_html.xpath(".//div[@class='content__pg']/@data-totalpage")
        pageCount = list(map(int, pageCount))
        return pageCount[0]
 
    async def get(self, url):  # 异步方法  当方法执行挂起线程执行完毕返回当前执行
        async with ai