python爬虫笔记 --------scrapy框架(3)

本文介绍如何使用Scrapy的选择器从网页中提取数据,包括构造选择器的方法及使用XPath和CSS表达式进行数据抓取的实际操作。通过示例页面演示了如何定位元素并提取所需信息。

摘要生成于 C知道 ,由 DeepSeek-R1 满血版支持, 前往体验 >

提取Item

                从网页中提取数据有很多方法。Scrapy使用了一种基于 XPath 和CSS 表达式机制:Scrapy Selectors

构造选择器

                Scrapy selector是以 文字(text)TextResponse 构造的Selector 实例。其根据输入的类型自动选择最优的分析方法(XML vs HTML): 

                 

from scrapy.selector import Selector
from scrapy.http import HtmlResponse

                1、以文字构造:     

                

               2、以response构造:

              

                 为了方便起见,response对象以 .selector 属性提供了一个selector:

          


使用选择器

            使用 Scrapy shell (提供交互测试)和位于Scrapy文档服务器的一个样例页面,来解释如何使用选择器:      

            http://doc.scrapy.org/en/latest/_static/selectors-sample1.html

         这里是它的HTML源码:       

<html>
 <head>
  <base href='http://example.com/' />
  <title>Example website</title>
 </head>
 <body>
  <div id='images'>
   <a href='image1.html'>Name: My image 1 <br /><img src='image1_thumb.jpg' /></a>
   <a href='image2.html'>Name: My image 2 <br /><img src='image2_thumb.jpg' /></a>
   <a href='image3.html'>Name: My image 3 <br /><img src='image3_thumb.jpg' /></a>
   <a href='image4.html'>Name: My image 4 <br /><img src='image4_thumb.jpg' /></a>
   <a href='image5.html'>Name: My image 5 <br /><img src='image5_thumb.jpg' /></a>
  </div>
 </body>
</html>
          1、首先, 打开shell:               

scrapy shell http://doc.scrapy.org/en/latest/_static/selectors-sample1.html
                接着,当shell载入后,将获得名为 response 的shell变量,其为响应的response,并且在其 response.selector 属性上绑定了一个selector。

          2、为了提取真实的原文数据,你需要调用 .extract() 方法如下:

          


更多的xpath语法可以参考http://www.w3school.com.cn/xpath/xpath_syntax.asp

      


内容概要:本文档详细介绍了Analog Devices公司生产的AD8436真均方根-直流(RMS-to-DC)转换器的技术细节及其应用场景。AD8436由三个独立模块构成:轨到轨FET输入放大器、高动态范围均方根计算内核和精密轨到轨输出放大器。该器件不仅体积小巧、功耗低,而且具有广泛的输入电压范围和快速响应特性。文档涵盖了AD8436的工作原理、配置选项、外部组件选择(如电容)、增益调节、单电源供电、电流互感器配置、接地故障检测、三相电源监测等方面的内容。此外,还特别强调了PCB设计注意事项和误差源分析,旨在帮助工程师更好地理解和应用这款高性能的RMS-DC转换器。 适合人群:从事模拟电路设计的专业工程师和技术人员,尤其是那些需要精确测量交流电信号均方根值的应用开发者。 使用场景及目标:①用于工业自动化、医疗设备、电力监控等领域,实现对交流电压或电流的精准测量;②适用于手持式数字万用表及其他便携式仪器仪表,提供高效的单电源解决方案;③在电流互感器配置中,用于检测微小的电流变化,保障电气安全;④应用于三相电力系统监控,优化建立时间和转换精度。 其他说明:为了确保最佳性能,文档推荐使用高质量的电容器件,并给出了详细的PCB布局指导。同时提醒用户关注电介质吸收和泄漏电流等因素对测量准确性的影响。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值