python学习爬虫出现乱码问题解决记

爬取的网页信息出现乱码问题,一般都是网页本身编码的问题。例如百度是GBK编码,在爬取百度数据是一定要注意网页本身编码问题。

如果使用requests.get(url).text方式爬取的网页信息是乱码,类似这种   ™¾åº¦ä¸€ä¸‹ï¼Œä½ 就知道百度 ">新闻地图,获取的数据显示有阴影,需要把先把网页信息转成bytes类型,将.text改成 .content

然后在decode()转码试试。 

posted @   寻楼艺主  阅读(992)  评论(0编辑  收藏  举报
编辑推荐:
· 基于Microsoft.Extensions.AI核心库实现RAG应用
· Linux系列:如何用heaptrack跟踪.NET程序的非托管内存泄露
· 开发者必知的日志记录最佳实践
· SQL Server 2025 AI相关能力初探
· Linux系列:如何用 C#调用 C方法造成内存泄露
阅读排行:
· Manus爆火,是硬核还是营销?
· 终于写完轮子一部分:tcp代理 了,记录一下
· 别再用vector<bool>了!Google高级工程师:这可能是STL最大的设计失误
· 单元测试从入门到精通
· 震惊!C++程序真的从main开始吗?99%的程序员都答错了
点击右上角即可分享
微信分享提示