2010 年 12月 14 日随笔档案 - 落冰

2010年12月14日

摘要： 1 聚焦爬虫工作原理及关键技术概述 网络爬虫是一个自动提取网页的程序，它为搜索引擎从Internet网上下载网页，是搜索引擎的重要组成。传统爬虫从一个或若干初始网页的URL开始，获得初始网页上的URL，在抓取网页的过程中，不断从当前页面上抽取新的URL放入队列,直到满足系统的一定停止条件。聚焦爬虫的工作流程较为复杂，需要根据一定的网页分析算法过滤与主题无关的链接，保留有用的链接并将其放入等待抓取的URL队列。然后，它将根据一定的搜索策略从队列中选择下一步要抓取的网页URL，并重复上述过程，直到达到系统的某一条件时停止，另外，所有被爬虫抓取的网页将会被系统存贮，进行一定的分析、过滤，并建立索阅读全文

posted @ 2010-12-14 17:00 落冰阅读(795) 评论(1) 推荐(0) 编辑

落冰

不要在乎你做过啥，要去留意你还能去做啥，而且还能做好啥. 结合你知道的啥，做成做好你能做的啥，你就可以成为你理想要的那啥！理想、梦想都在弹指一挥间，不要混日子，当心自己被日子混了！做人有信心做事有激情...