python 小爬虫

#coding=utf-8

import urllib
import re

def geturl(url):
    page = urllib.urlopen(url)
    html = page.read()
    return html


def rehtml(html):
    r = r'<a href="(\w+_\w+\.rst)">(\d+)'

    x = re.findall(r,html)

    z = 'http://www.czug.org/python/diveintopython/'
    c = []

    for y in x:
        s = list(y)
        s[1]=int(s[1])
        c.append(s)
        
    c = sorted(c,key = lambda x:x[1])

    for x in c:
        urllib.urlretrieve(z+x[0],'%d.html'%x[1])

    print "ok"
    

infou = geturl('http://www.czug.org/python/diveintopython/')

rehtml(infou)

 其实困难点在于,1.用正则提取要抓的内容。2.用urllib方法去把拿到的东西下载到本地。

posted on 2013-08-16 18:35  生命线的挣扎  阅读(169)  评论(0)    收藏  举报

导航