python系列(亲测有效):Python爬虫常用之HtmlParser(解析html文字编码为正常显示的内容)
Python爬虫常用之HtmlParser(解析html文字编码为正常显示的内容)
Python爬虫常用之HtmlParser
HtmlParser
,顾名思义,是解析Html
的一个工具。python
自带的。
一、常用属性和方法介绍
HtmlParser
是一个类,在使用时一般继承它然后重载它的方法,来达到解析出需要的数据的目的。
1.常用属性:
lasttag
,保存上一个解析的标签名,是字符串。
2.常用方法:
-
handle_starttag(tag, attrs) ,处理开始标签,比如
<div>
;这里的attrs获取到的是属性列表,属性以元组的方式展示 -
handle_endtag(tag) ,处理结束标签,比如
</div>
-
handle_startendtag(tag, attrs) ,处理自己结束的标签,如
<<img />
【推荐】国内首个AI IDE,深度理解中文开发场景,立即下载体验Trae
【推荐】编程新体验,更懂你的AI,立即体验豆包MarsCode编程助手
【推荐】抖音旗下AI助手豆包,你的智能百科全书,全免费不限次数
【推荐】轻量又高性能的 SSH 工具 IShell:AI 加持,快人一步
· 分享4款.NET开源、免费、实用的商城系统
· 全程不用写代码,我用AI程序员写了一个飞机大战
· MongoDB 8.0这个新功能碉堡了,比商业数据库还牛
· 白话解读 Dapr 1.15:你的「微服务管家」又秀新绝活了
· 上周热点回顾(2.24-3.2)