功能描述
• 目标:获取上证A股股票名称和交易信息
• 输出:保存到文件中
• 技术路线:采用scrapy框架进行爬取
此处选取股票信息静态存储在HTML页面中的页面进行爬取,之后会写一篇动态的爬取方式
程序结构设计
(1)首先得到股票代码,此处选取证券之星获得上证A股股票代码
(2)根据股票代码到网易财经获取个股详细信息
(3)将结果存储到文件
代码实现
此处在spiders文件下新创建了一个stocks.py文件
stocks.py
# -*- coding: utf-8 -*-
import re
import scrapy
class StocksSpider(scrapy.Spider):
name = 'stocks'
start_urls = ['http://quote.stockstar.com/stock/stock_index.htm']
def parse(self, response):
for href in response.css('a::attr(href)').extract():
try:
stock = re.search(r'/gs/sh_\d{6}.shtml', href).group(0).split('_')[1].split('.')[0]
url = "http://quotes.money.163.com/" + '0' + stock + '.html'
yield scrapy.Request(url=

最低0.47元/天 解锁文章
213

被折叠的 条评论
为什么被折叠?



