编码基础

1、ASCII码
在计算机内部，所有的信息最终都表示为一个二进制的字符串。每一个二进制位(bit)有0和1两种状态，因此八个二进制位就可以组合出 256种状态，这被称为一个字节(byte)。也就是说，一个字节一共可以用来表示256种不同的状态，每一个状态对应一个符号，就是256个符号，从 0000000到11111111。
ASCII码一共规定了128个字符的编码，这128个符号(包括32个不能打印出来的控制符号)，只占用了一个字节的后面7位，最前面的1位统一规定为0。

2、非ASCII编码
不同国家语言不同，一个字节八位不够应付多出的字符，使用多个字节表示一个符号，出现了非ASCII编码，比如，简体中文常见的编码方式是GB2312，使用两个字节表示一个汉字，所以理论上最多可以表示256x256=65536个符号。（虽然都是用多个字节表示一个符号，但是GB类的汉字编码与后文的Unicode和UTF-8是毫无关系的）

3.Unicode
Unicode将世界上所有的符号都纳入其中。每一个符号都给予一个独一无二的编码，规定了符号的二进制代码（只是一个符号集，它只规定了符号的二进制代码，却没有规定这个二进制代码应该如何存储）

4.UTF-8
UTF-8就是在互联网上使用最广的一种unicode的实现方式。其他实现方式还包括UTF-16和UTF-32，不过在互联网上基本不用。这里的关系是，UTF-8是Unicode的实现方式之一。它是一种变长的编码方式。它可以使用1~4个字节表示一个符号，根据不同的符号而变化字节长度。
UTF-8的编码规则很简单，只有二条：
1)对于单字节的符号，字节的第一位设为0，后面7位为这个符号的unicode码。因此对于英语字母，UTF-8编码和ASCII码是相同的。
2)对于n字节的符号(n>1)，第一个字节的前n位都设为1，第n+1位设为0，后面字节的前两位一律设为10。剩下的没有提及的二进制位，全部为这个符号的unicode码。

Unicode的UCS-2格式
Unicode码可以采用UCS-2格式直接存储。Unicode规范中定义，每一个文件的最前面分别加入一个表示编码顺序的字符，这个字符的名字叫做”零宽度非换行空格“(ZERO WIDTH NO-BREAK SPACE)，用FEFF表示。这正好是两个字节，而且FF比FE大1。如果一个文本文件的头两个字节是FE FF，就表示该文件采用大头方式;如果头两个字节是FF FE，就表示该文件采用小头方式。以汉字”严“为例，Unicode码是4E25，需要用两个字节存储，一个字节是4E，另一个字节是25。存储的时候，4E在前，25在后，就是Big endian方式;25在前，4E在后，就是Little endian方式。最终保存为“FF FE 25 4E”或“FE FF 4E 25”。

记事本四个选项：ANSI，Unicode，Unicode big endian 和 UTF-8
ANSI是默认的编码方式。对于英文文件是ASCII编码，对于简体中文文件是GB2312编码(只针对Windows简体中文版，如果是繁体中文版会采用Big5码)。
Unicode编码指的是UCS-2编码方式，即直接用两个字节存入字符的Unicode码。这个选项用的little endian格式。
Unicode big endian编码与上一个选项相对应。这个选项用的Big endian格式。
UTF-8编码

posted @ 2011-03-24 23:20 潜水鱼阅读(264) 评论(0) 收藏举报

刷新页面返回顶部

holy shit

潜水鱼

编码基础

holy shit on foot