2013 年 11月 19 日随笔档案 - 推石

2013年11月19日

摘要：开学前接了一个任务，内容是从网上爬取特定属性的数据。正好之前学了python，练练手。编码问题因为涉及到中文，所以必然地涉及到了编码的问题，这一次借这个机会算是彻底搞清楚了。问题要从文字的编码讲起。原本的英文编码只有0~255，刚好是8位1个字节。为了表示各种不同的语言，自然要进行扩充。中文的话有GB系列。可能还听说过Unicode和UTF-8，那么，它们之间是什么关系呢？Unicode是一种编码方案，又称万国码，可见其包含之广。但是具体存储到计算机上，并不用这种编码，可以说它起着一个中间人的作用。你可以再把Unicode编码(encode)为UTF-8，或者GB，再存储到计算机上。UTF-8 阅读全文

posted @ 2013-11-19 22:18 推石阅读(15827) 评论(11) 推荐(15) 编辑

推石

了解这个世界是最好的娱乐

公告