heritrix3 伪装成GOOGLE进行爬取

最新推荐文章于 2025-11-15 17:58:27 发布

转载最新推荐文章于 2025-11-15 17:58:27 发布 · 1.8k 阅读

文章标签：

#google #搜索引擎 #user #浏览器 #java #url

Heritrix3 专栏收录该内容

8 篇文章

订阅专栏

本文介绍如何通过修改User-Agent的方式将爬虫伪装成Googlebot，以绕过部分网站的访问限制。适用于需要抓取特定网站数据而该网站对爬虫进行封锁的情况。

伪装成搜索引擎蜘蛛google bot访问需网站, 这样能防止爬虫被封
在crawler-beans.cxml 中修改metadata成下面

Java代码

<bean id="metadata" class="org.archive.modules.CrawlMetadata" autowire="byName">
<property name="operatorContactUrl" value="[see override above]"/>
<property name="jobName" value="[see override above]"/>
<property name="descrip蜘蛛的爬取原理tion" value="[see override above]"/>
<property name="userAgentTemplate"
value="Mozilla/5.0 (compatible; Googlebot/2.1; +@OPERATOR_CONTACT_URL@) "/>
</bean>

伪装Googlebot。许多网站访问时需要注册，但用Google、Baidu等搜索引擎搜索时却可以搜索到全文。这是因为网站对访问者的 User Agent进行了判断，如果是bot，则允许其访问；如果是一般用户，则自动跳转到登陆页面。用User Agent Switcher就可以把自己伪装成Googlebot，进而不用注册也可以访问这些网站。

那么我们也可以伪装成搜索引擎来进入这些页面。我们需要的是修改浏览器的User-Agent
值。