垂直搜索引擎蜘蛛

       本以为蜘蛛很简单,根据一个url,抓取到html内容,然后根据正则匹配数据入库.却发现,越看资料越复杂,蜘蛛应该根据抓取相似页面自动生成抓取模板,而且蜘蛛还要支持cookies和会自登录等多种协议.
        页面解析方面,也不是简单的获得标题和内容那么简单,还要做dom解析,js解析,模拟浏览器的可视化抓取等等.
        先从页面数据的抽取这方面入手研究吧.

posted on 2008-05-29 10:31  隨風.NET  阅读(510)  评论(0编辑  收藏  举报

导航