4字节emoji表情对应的Unicode编码获取和编码转换

GitHub Flavored Markdown

今天研究了一天Markdown移动端和pc端统一实现方式，由于以前有搞过移动端富文本编辑器，搞Markdown简单多了；
其中GFM的表情语法不错，比如笑脸😄，准备采用一下。

又想到了手机输入法输入表情浏览器页面接收到的是一个字符，如果能转换成😄就更能统一表现了，就像微信Android怎么输入输入法里面奇丑的emoji到了微信里面都是微信自带的好看的emoji图标，其实这个转换好几年前就有开始了解，不过没有什么进展。

编码问题

前几天刚好有需求要把emoji对应的Unicode编码转换成文字，比如1f601对应的这个笑脸😁，但没有找到C#的把1f601转换成文字的方法，用Encoding.Unicode怎么转换都不对，最后直接复制emoji字符，Visual Studio里面竟然直接显示出来了，那就直接用字符吧，都不用转换了，然后不了了之了。

今天搞Markdown编辑器，由于前面GFM的原因，又对编码进行测试，没查到什么靠谱资料，到时找到很多emoji和Unicode对照表，https://apps.timwhitlock.info/emoji/tables/unicode拿一个笑脸https://apps.timwhitlock.info/unicode/inspect/hex/1F601开刀~

正确姿势

【C#】 Encoding.UTF32.GetBytes("😁") -> ["1", "f6", "1", "0"]
【js】 "😁".codePointAt(0).toString(16) -> 1f601
UTF-32结果一致

【C#】 Encoding.UTF8.GetBytes("😁") -> ["f0", "9f", "98", "81"]
【js】 encodeURIComponent("😁") -> %F0%9F%98%81
UTF-8结果一致

错误姿势

【C#】 Encoding.Unicode.GetBytes("😁") -> ["3d", "d8", "1", "de"]
【js】 "😁".codePointAt(0).toString(16) -> 1f601
这个Unicode反而不一致了

其实前段时间一直转换不对，就是错怪Encoding.Unicode了，C#里面Encoding.Unicode=Little-Endian UTF-16

没错是UTF-16，四字节编码老实用UTF-32就和浏览器结果一致了。

好开森，记录嘚瑟一下

Java是不是这样就搞不清楚了，电脑内存小了点就不开Eclipse敲代码了。

有了正确的转换关系，不管前端对用户输入进行替换还是后端替换都能实现了。下一步制作GFM emoji名字和Unicode编码对照表，挑几十个emoji放到编辑器菜单，剩余的只提供图片。

关键是素材GitHub提供了https://github.com/WebpageFX/emoji-cheat-sheet.com/tree/master/public/graphics/emojis，清晰度还不错，手机上三倍缩放应该挺清晰，直接拿来用

posted @ 2018-03-19 00:47 xiangyuecn 阅读(2320) 评论(0) 编辑收藏举报

刷新页面返回顶部

登录后才能查看或发表评论，立即登录或者逛逛博客园首页

阅读排行：
· 周边上新：园子的第一款马克杯温暖上架
· Open-Sora 2.0 重磅开源！
· 分享 3 个 .NET 开源的文件压缩处理库，助力快速实现文件压缩解压功能！
· Ollama——大语言模型本地部署的极速利器
· [AI/GPT/综述] AI Agent的设计模式综述

公告

昵称： xiangyuecn
园龄： 12年4个月
粉丝： 62
关注： 0

+加关注

2025年3月

日

一

二

三

四

五

六

高坚果兄弟

叫我坚果兄弟

4字节emoji表情对应的Unicode编码获取和编码转换

GitHub Flavored Markdown

编码问题

正确姿势

错误姿势

好开森，记录嘚瑟一下

公告

常用链接

随笔分类

随笔档案