Python 抓取微信公众号账号信息

搜狗微信搜索提供两种类型的关键词搜索,一种是搜索公众号文章内容,另一种是直接搜索微信公众号。通过微信公众号搜索可以获取公众号的基本信息及最近发布的10条文章,今天来抓取一下微信公众号的账号信息(

爬虫

首先通过首页进入,可以按照类别抓取,通过“查看更多”可以找出页面链接规则:

import requests as req
import re

reTypes = r'id="pc_\d*" uigs="(pc_\d*)">([\s\S]*?)</a>'
Entry = "http://weixin.sogou.com/"
entryPage = req.get(Entry)
allTypes = re.findall(reTypes, getUTF8(entryPage))

for (pcid, category) in allTypes:
    for page in range(1, 100):
        url = 'http://weixin.sogou.com/pcindex/pc/{}/{}.html'.format(pcid, page)
        print(url)

        categoryList = req.get(url)
        if categoryList.status_code != 200:
            break

上面代码通过加载更多页面获取加载列表,进而从其中抓取微信公众号详情页面:

reProfile = r'<li id[\s\S]*?<a href="([\s\S]*?)"'
### 如何导出微信公众号文章标题列表 为了实现从微信公众号中提取并导出文章标题列表,可以采用多种方式和技术栈来完成这个目标。以下是基于Python的一种解决方案。 #### 方法一:利用第三方库 `wechat-sogou` `wechat-sogou` 是一个用于抓取微信公众号内容的强大工具包。通过它可以直接访问特定账号下的所有历史消息,并从中解析出所需的元数据,比如标题等信息。 ```python from wechat_sogou import WeChatSogouAPI ws_api = WeChatSogouAPI() account_name = "example_account" articles = ws_api.search_article(account=account_name) for article in articles: print(article['title']) ``` 这段代码展示了如何初始化 API 客户端以及查询指定账户的文章记录。对于每篇文章对象而言,其中包含了多个属性字段,而这里只选择了打印标题部分[^2]。 #### 方法二:使用 Selenium 自动化浏览器操作 如果遇到某些情况下无法直接调用接口的情况,则可以选择模拟真实用户的交互行为来进行网页爬虫工作。借助于像 Selenium 这样的自动化测试框架可以帮助加载完整的HTML文档结构,从而更方便地定位到所需的数据节点。 ```python from selenium import webdriver import time driver = webdriver.Chrome() # 或者其他驱动程序 url = 'https://mp.weixin.qq.com/s?__biz=MzA4MjQwMTIyNg==&mid=2657890134#rd' driver.get(url) time.sleep(3) # 等待页面完全渲染完毕 titles = driver.find_elements_by_css_selector('.weui_media_title') for title_element in titles: print(title_element.text.strip()) driver.quit() ``` 上述脚本说明了启动 Chrome 浏览器实例打开链接地址后等待几秒钟让 JavaScript 执行结束再执行查找元素的动作。最后遍历找到的所有匹配项并将它们的内容逐行输出显示出来[^3]。 无论采取哪种方案,在实际应用过程中都需要注意遵守微信公众平台的服务条款及相关法律法规规定,确保合法合规地收集和处理公开发布的信息资源。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值