python系列(亲测有效):Python爬虫常用之HtmlParser(解析html文字编码为正常显示的内容)




Python爬虫常用之HtmlParser

HtmlParser,顾名思义,是解析Html的一个工具。python自带的。

一、常用属性和方法介绍

HtmlParser是一个类,在使用时一般继承它然后重载它的方法,来达到解析出需要的数据的目的。

1.常用属性:

lasttag,保存上一个解析的标签名,是字符串。

2.常用方法:

  • handle_starttag(tag, attrs) ,处理开始标签,比如<div>;这里的attrs获取到的是属性列表,属性以元组的方式展示

  • handle_endtag(tag) ,处理结束标签,比如</div>

  • handle_startendtag(tag, attrs) ,处理自己结束的标签,如<img />

    <
posted @ 2024-09-04 10:53  坦笑&&life  阅读(20)  评论(0编辑  收藏  举报  来源