heritrix3 伪装成GOOGLE进行爬取

本文介绍如何通过修改User-Agent的方式将爬虫伪装成Googlebot,以绕过部分网站的访问限制。适用于需要抓取特定网站数据而该网站对爬虫进行封锁的情况。

摘要生成于 C知道 ,由 DeepSeek-R1 满血版支持, 前往体验 >

伪装成搜索引擎蜘蛛google bot访问需网站, 这样能防止爬虫被封
在crawler-beans.cxml 中修改metadata成下面

Java代码   收藏代码
  1. <!-- CRAWL METADATA: including identification of crawler/operator -->  
  2.  <bean id="metadata" class="org.archive.modules.CrawlMetadata" autowire="byName">  
  3.        <property name="operatorContactUrl" value="[see override above]"/>  
  4.        <property name="jobName" value="[see override above]"/>  
  5.        <property name="descrip蜘蛛的爬取原理tion" value="[see override above]"/>  
  6.   <!-- <property name="operator" value=""/> -->  
  7.   <!-- <property name="operatorFrom" value=""/> -->  
  8.   <!-- <property name="organization" value=""/> -->  
  9.   <!-- <property name="audience" value=""/> -->  
  10.       <property name="userAgentTemplate"  
  11.          value="Mozilla/5.0 (compatible; Googlebot/2.1; +@OPERATOR_CONTACT_URL@) "/>  
  12.  </bean>  

伪装Googlebot。许多网站访问时需要注册,但用Google、Baidu等搜索引擎搜索时却可以搜索到全文。这是因为网站对访问者的 User Agent进行了判断,如果是bot,则允许其访问;如果是一般用户,则自动跳转到登陆页面。用User Agent Switcher就可以把自己伪装成Googlebot,进而不用注册也可以访问这些网站。

那么我们也可以伪装成搜索引擎来进入这些页面。我们需要的是修改浏览器的User-Agent
值。


评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值