scrapy vs requests+beautifulsoup
两种爬虫模式比较:
1、requests和beautifulsoup都是库,scrapy是框架。
2、scrapy框架中可以加入requests和beautifulsoup。
3、scrapy基于twisted,性能是最大的优势。
4、scrapy方便扩展,提供了很多内置的功能。
5、scrapy内置的css和xpath selector非常方便,beautifulsoup最大的缺点就是慢。
爬虫能做什么?
1、搜索引擎---百度、谷歌、垂直搜索引擎。
2、推荐引擎---今日头条
3、机器学习数据样本
5、数据分析(如金融数据分析)、舆情分析等。
网页分类:
常见类型的服务:
1、静态网页
2、动态网页
3、webservice(restapi)