python系列(亲测有效):Python爬虫常用之HtmlParser(解析html文字编码为正常显示的内容)
Python爬虫常用之HtmlParser(解析html文字编码为正常显示的内容)
Python爬虫常用之HtmlParser
HtmlParser
,顾名思义,是解析Html
的一个工具。python
自带的。
一、常用属性和方法介绍
HtmlParser
是一个类,在使用时一般继承它然后重载它的方法,来达到解析出需要的数据的目的。
1.常用属性:
lasttag
,保存上一个解析的标签名,是字符串。
2.常用方法:
-
handle_starttag(tag, attrs) ,处理开始标签,比如
<div>
;这里的attrs获取到的是属性列表,属性以元组的方式展示 -
handle_endtag(tag) ,处理结束标签,比如
</div>
-
handle_startendtag(tag, attrs) ,处理自己结束的标签,如
<<img />