opencc介绍
1.什么是opencc?
Open Chinese Convert(OpenCC)是一个开源的中文简繁转换项目,致力于制作高质量的基于统计预料的简繁转换词库。还提供函数库(libopencc)、命令行简繁转换工具、人工校对工具、词典生成程序、在线转换服务及图形用户界面。
2.我用在了哪里?
之前做文本分类,感觉预训练词向量是个好东西,但是现在发现,仅仅把词向量做预训练还远远是不够的,还要使用大预料在通用语料中做网络的预训练,那么爬取维基百科中的中文语料进行预训练是可行的,此时我们需要繁体转简体,就遇到这个模块了。
3.下载
但实际上,你发现在ubuntu上安装opencc的包名叫做:open-python,用pip install opencc-python 你会崩溃的,最终失败而告终。
解决办法:使用pip install opencc-python-reimplemented,此包完全兼容opencc,实测可用。地址:https://pypi.org/project/opencc-python-reimplemented/
希望这些能够帮到你,减少弯路
时刻记着自己要成为什么样的人!