2012 年 6月 16 日随笔档案 - 有来有去

2012年6月16日

摘要：网络爬虫在信息检索与处理中有很大的作用，是收集网络信息的重要工具。接下来就介绍一下爬虫的简单实现。爬虫的工作流程如下爬虫自指定的URL地址开始下载网络资源，直到该地址和所有子地址的指定资源都下载完毕为止。下面开始逐步分析爬虫的实现。1. 待下载集合与已下载集合为了保存需要下载的URL，同时防止重复下载，我们需要分别用了两个集合来存放将要下载的URL和已经下载的URL。因为在保存URL的同时需要保存与URL相关的一些其他信息，如深度，所以这里我采用了Dictionary来存放这些URL。具体类型是Dictionary<string, int> 其中string是Url字符串，int是阅读全文

posted @ 2012-06-16 22:48 有来有去阅读(85757) 评论(46) 推荐(35) 编辑

公告

昵称：有来有去
园龄： 12年9个月
粉丝： 185
关注： 3

+加关注

2025年3月

日

一

二

三

四

五

六

公告

搜索

常用链接

我的标签

随笔分类

随笔档案

阅读排行榜

最新评论