50行代码爬取微信公众号所有文章

最新推荐文章于 2025-06-19 11:15:31 发布

原创

最新推荐文章于 2025-06-19 11:15:31 发布 · 7k 阅读

18 ·

CC 4.0 BY-SA版权

文章标签：

#python #程序员

#今日目标

50行代码爬取微信公众号所有文章

今天要爬取的是微信公众号，爬取公众号的方式常见的有两种。一是通过搜狗搜索去获取，缺点是只能获取最新的十条推送文章，
今天介绍另一种通过抓包PC端微信的方式去获取公众号文章的方法，相对其他方法更加便捷。
分析：我们发现每次下拉刷新文章的时候都会请求 mp.weixin.qq.com/mp/xxx公众号不让添加主页链接，xxx表示profile_ext）这个接口。
经过多次测试分析，用到了以下几个参数：
__biz : 用户和公众号之间的唯一id，
uin ：用户的私密id
key ：请求的秘钥，一段时候只会就会失效。
offset ：偏移量
count ：每次请求的条数
代码实现


如果你对python感兴趣，我这有个学习Python基地，里面有很多学习资料，感兴趣的+Q群：688244617

import requests
import json
import time
from pymongo import MongoClient

url = 'http://mp.weixin.qq.com/mp/xxx'（公众号不让添加主页链接，xxx表示profile_ext)

# Mongo配置
conn = MongoClient('127.0.0.1', 27017)
db = conn.wx  #连接wx数据库，没有则自动创建
mongo_wx = db.article  #使用article集合，没有则自动创建

def get_wx_article(biz, uin, key, index=0, count=10):
    offset = (index