解决python错误 UnicodeDecodeError: 'gb2312' codec can't decode byte 0x8b in position 1: illegal multibyte sequence

本文共486字，阅读本文大概需要1~2分钟

报错的代码：

url= 'http://kaijiang.500.com/shtml/ssq/19001.shtml'
page =urllib.request.urlopen(url)
content = page.read().decode('gb2312')

报这个错的原因是获取到的网页内容是经过压缩了的，打开url可以看到请求head

Accept-Encoding:gzip, deflate

一种方式是请求时把Accept-Encoding设为空，这样的话网页数据未压缩，会相对比较大，增加网络传输时间

另一种方式就是对请求后的数据解压，显然这个方式处理会更快，如下

1	`content` `=` `gzip.decompress(page.read()).decode('gb2312')`

可是修改之后发现运行还是报错，这时候发现应该是因为网页中含有编码集之外的字符（网页内容指定charset是gb2312），就算加到更大范围还是报错（PS：汉字字符集范围 gb2312 < gbk < gb18030）

这时候选择忽略这些无法解码的字符

content = gzip.decompress(page.read()).decode('gb2312','ignore')

再运行代码，发现这个问题已经解决了（如果你看了我前面一篇双色球分析的程序，现在应该知道为什么有时会报错了~~）

如果您觉得阅读本文对您有帮助，请点一下“推荐”按钮，您的“推荐”将是我最大的写作动力！欢迎各位转载，但是未经作者本人同意，转载文章之后必须在文章页面明显位置给出作者和原文连接，否则保留追究法律责任的权利。

posted on 2019-05-10 23:33 一個未来阅读(6425) 评论(0) 编辑收藏举报

刷新页面返回顶部

登录后才能查看或发表评论，立即登录或者逛逛博客园首页

阅读排行：
· 在鹅厂做java开发是什么体验
· 百万级群聊的设计实践
· WPF到Web的无缝过渡：英雄联盟客户端的OpenSilver迁移实战
· 永远不要相信用户的输入：从 SQL 注入攻防看输入验证的重要性
· 全网最简单！3分钟用满血DeepSeek R1开发一款AI智能客服，零代码轻松接入微信、公众号、小程