2014 年 3月 6 日随笔档案 - 轻度YYy

2014年3月6日

摘要：在爬虫系统中，在内存中维护着两个关于URL的队列，ToDo队列和Visited队列，ToDo队列存放的是爬虫从已经爬取的网页中解析出来的即将爬取的URL，但是网页是互联的，很可能解析出来的URL是已经爬取到的，因此需要VIsited队列来存放已经爬取过的URL。当爬虫从ToDo队列中取出一个URL的时候，先和Visited队列中的URL进行对比，确认此URL没有被爬取后就可以下载分析来。否则舍弃此URL，从Todo队列取出下一个URL继续工作。然后，我们知道爬虫在爬取网页时，网页的量是比较大的，直接将所有的URL直接放入Visited队列是很浪费空间的。因此引入bloom filter... 阅读全文

posted @ 2014-03-06 00:21 轻度YYy 阅读(3235) 评论(5) 推荐(0) 编辑

公告