摘要: http://www.cnblogs.com/dubing/archive/2012/01/16/2323985.html 阅读全文
posted @ 2012-02-06 09:37 云中雀 阅读(144) 评论(0) 推荐(0) 编辑
摘要: 1. larbin简介(百度百科) larbin是一种开源的网络爬虫/网络蜘蛛,由法国的年轻人Sébastien Ailleret独立开发,用c++语言实现。larbin目的是能够跟踪页面的url进行扩展的抓取,最后为搜索引擎提供广泛的数据来源。 Larbin只是一个爬虫,也就是说larbin只抓取网页,至于如何parse的事情则由用户自己完成。另外,如何存储到数据库以及建立索引的事情 larbin也不提供。 latbin最初的设计也是依据设计简单但是高度可配置性的原则,因此我们可以看到,一个简单的larbin的爬虫可以每天获取500万的网页,实在是非常高效。 利用larbin,我们 阅读全文
posted @ 2012-02-06 09:12 云中雀 阅读(229) 评论(0) 推荐(0) 编辑