python 小爬虫
#coding=utf-8
import urllib
import re
def geturl(url):
page = urllib.urlopen(url)
html = page.read()
return html
def rehtml(html):
r = r'<a href="(\w+_\w+\.rst)">(\d+)'
x = re.findall(r,html)
z = 'http://www.czug.org/python/diveintopython/'
c = []
for y in x:
s = list(y)
s[1]=int(s[1])
c.append(s)
c = sorted(c,key = lambda x:x[1])
for x in c:
urllib.urlretrieve(z+x[0],'%d.html'%x[1])
print "ok"
infou = geturl('http://www.czug.org/python/diveintopython/')
rehtml(infou)
其实困难点在于,1.用正则提取要抓的内容。2.用urllib方法去把拿到的东西下载到本地。
浙公网安备 33010602011771号