摘要: 1、scrapy框架是否可以自己实现分布式? 答:不可以。原因有二: 其一:因为多台机器上部署的scrapy会各自拥有各自的调度器,这样就使得多台机器无法分配start_urls列表中的url。(多台机器无法共享同一个调度器) 其二:多台机器爬取到的数据无法通过同一个管道对数据进行统一的数据持久出存 阅读全文
posted @ 2019-03-05 20:45 中杯可乐不加冰 阅读(157) 评论(0) 推荐(0) 编辑
摘要: 思考: 当我们在浏览相关网页的时候会发现,某些网站定时会在原有网页数据的基础上更新一批数据,例如某电影网站会实时更新一批最近热门的电影。小说网站会根据作者创作的进度实时更新最新的章节数据等等。那么,类似的情景,当我们在爬虫的过程中遇到时,我们是不是需要定时更新程序以便能爬取到网站中最近更新的数据呢? 阅读全文
posted @ 2019-03-05 20:28 中杯可乐不加冰 阅读(130) 评论(0) 推荐(0) 编辑
摘要: 一、什么是CrawlSpider? 在学习CrawlSpider之前如果我们想爬取某网站前100页的内容的话,我们可以使用的方法是通过Request模块手动发起请求,递归调用parse方法,写起来非常麻烦,效率不高,CrawlSpider其实是Spider的一个子类,除了继承到Spider的特性和功 阅读全文
posted @ 2019-03-05 20:17 中杯可乐不加冰 阅读(275) 评论(0) 推荐(0) 编辑