【补充】字符串的编码

【一】ASCII码

计算机内部，所有信息最终都是一个二进制值。每一个二进制位(bit)有0和1两种状态，因此八个二进制位就可以组合出256种状态，这被称为一个字节(byte)。
- 也就是说，一个字节一共可以用来表示256种不同的状态，每一个状态对应一个符号，就是256个符号，从00000000到11111111。
上个世纪60年代，美国制定了一套字符编码，对英语字符与二进制位之间的关系，做了统一规定。
- 这被称为ASCll码，一直沿用至今。
ASCII码一共规定了128个字符的编码，比如空格SPACE是32(二进制00100000) ，大写的字母A是65(二进制01000001)。
- 这128个符号(包括32个不能打印出来的控制符号)，只占用了一个字节的后面7位，最前面的一位统一规定为0。

如果只表示英语，用128个符号编码就够了，但是用来表示其他语言，128个符号是不够的。
- 比如，在法语中，字母上方有注音符号，它就无法用ASCIl码表示。
于是，一些欧洲国家就决定，利用字节中闲置的最高位编入新的符号。
- 比如，法语中的é的编码为130(二进制10000010)。
这样一来，这些欧洲国家使用的编码体系，可以表示最多256个符号。
- 但是，这里又出现了新的问题。
不同的国家有不同的字母，因此，哪怕它们都使用256个符号的编码方式，代表的字母却不一样。
- 比如，130在法语编码中代表了é，在希伯来语编码中却代表了字母Gimel (x)，在俄语编码中又会代表另一个符号。
但是不管怎样，所有这些编码方式中，0-127表示的符号是一样的，不一样的只是128-255的这一段。
至于亚洲国家的文字，使用的符号就更多了，汉字就多达10万左右。
一个字节只能表示256种符号，肯定是不够的，就必须使用多个字节表达一个符号。
- 比如，简体中文常见的编码方式是GB23124,使用两个字节表示一个汉字，所以理论上最多可以表示256 x 256= 65536个符号

Unicode 只是一个符号集，它只规定了符号的二进制代码，却没有规定这个二进制代码应该如何存储。
- 比如，汉字严的Unicode是十六进制数4E25，转换成二进制数足足有15位(100111000100101) ,也就是说，这个符号的表示至少需要2个字节。
- 表示其他更大的符号，可能需要3个字节或者4个字节，甚至更多。
这里就有两个严重的问题:
- 问题一:如何才能区别Unicode和ASCll?计算机怎么知道三个字节表示一个符号，而不是分别表示三个符号呢?
- 问题二︰英文字母只用一个字节表示就够了，如果Unicode统一规定，每个符号用三个或四个字节表示，那么每个英文字母前都必然有二到三个字节是o，这对于存储来说是极大的浪费，文本文件的大小会因此大出二三倍

注意:UTF-8是 Unicode的实现方式之一。

跟据上表，解读UTF-8编码非常简单。
- 如果一个字节的第一位是0，则这个字节单独就是一个字符;如果第一位是1，则连续有多少个1，就表示当前字符占用多少个字节。
下面，还是以汉字严为例，演示如何实现UTF-8编码。
严的Unicode 是4E25 (100111000100101)，根据上表，可以发现4E25处在第三行的范围内（00000800 - 0000 FFFF)
- 因此严的UTF-8编码需要三个字节，即格式是1110xxxx 10xxxxxx 10xxxxxx。
- 然后，从严的最后一个二进制位开始，依次从后向前填入格式中的x，多出的位补0。
- 这样就得到了，严的UTF-8编码是11100100 10111000 10100101，转换成十六进制就是E4B8A5

posted @ 2023-11-12 11:58 Chimengmeng 阅读(34) 评论(0) 编辑收藏举报

刷新页面返回顶部