基于scrapy-redis两种形式的分布式爬虫
redis分布式部署
1.scrapy框架是否可以自己实现分布式?
- 不可以.原因有二.
* 其一: 因为太多台机器上部署的scrapy会各自拥有各自的调度器,这样就是的多台机器无法分配start_url列表中的url.(多台机器无法共享同一个调度器)
* 其二: 多台机器爬取到的数据无法通过同一个管道数据进行统一的数据持久存储.(多台机器无法共享同一个管道)
2. 基于scrapy-redis组件的分布式爬虫
- scrapy-redis组件中为我们封装好了可以被多台机器共享的调度器和管道,我们可以直接使用并实现分布式数据爬取.
- 实现方式:
1. 基于该组件的RedisSpider类
2. 基于该组件的RedisCrawlSpider类
3.分布式实现流程: 上述两种不同方式的分布式实现流程是统一的
- 3.1 下载scrapy-redis组件: pip install scrapy-redis
- 3.2 redis配置文件的配置:
- 注释该行:bind 127.0.0.1,表示可以让其他ip访问redis
- 将yes该为no:protected-mode no,表示可以让其他ip操作redis
- 3.3 修改爬虫文件的相关代码:
* 将爬虫类的父类修改成基于RedisSpider或者RedisCrawlSpider.注意:如果原始爬虫文件是基于spider的,则应该讲父类修改成RedisSpider,如果原始爬虫文件是基于CrawlSpider的,则应该将其父类修改成RedisSrawlSpider.
* 注释或删除start_url列表,且加入redis_key属性,属性值为scrapy-redis组件中调度器队列的名称
- 3.4 在配置文件中进行相关配置,开启使用scrapy-redis组件中封装好的管道
ITEM_PIPELINES = { 'scrapy_redis.pipelines.RedisPipeline': 400 }
- 3.5 在配置文件中进行相关配置,开启使用scrapy-redis组件中封装好的调度器
# 使用scrapy-redis组件的去重队列 DUPEFILTER_CLASS = "scrapy_redis.dupefilter.RFPDupeFilter" # 使用scrapy-redis组件自己的调度器 SCHEDULER = "scrapy_redis.scheduler.Scheduler" # 是否允许暂停 SCHEDULER_PERSIST = True
3.6 在配置文件中进行爬虫程序连接redis配置:
REDIS_HOST = 'redis服务的ip地址' REDIS_PORT = 6379 REDIS_ENCODING = ‘utf-8’ REDIS_PARAMS = {‘password’:’123456’}
3.7 开启redis服务器: redis-server配置文件
3.8 开启客户端: redis-cli
3.9 运行爬虫文件:scrapy runspider SpiderFile
3.10 向调度器队列中扔一个起始url(在redis客户端中操作): lpush redis_key属性值 起始url