# threekingdoms.py
import jieba
txt = open("threekingdoms.txt", "r", encoding="utf-8").read()
excludes = {"意谓", "将军", "却说", "二人", "不可", "不能", "荆州", "天下", "如此", "这里", "商议", "如何"} # 要提出的分词,因为不是人名
words = jieba.lcut(txt)
counts = {}
for word in words:
if len(word) == 1:
continue
elif word == "诸葛亮" or word == "孔明曰":
rword = "孔明"
elif word == "关公" or word == "云长":
rword = "关羽"
elif word == "玄德" or word == "玄德曰":
rword = "刘备"
elif word == "丞相":
rword = "曹操"
else:
rword = word # 要不同的称谓转换为固定人名,便于统计数量
counts[rword] = counts.get(rword, 0) + 1
for word in excludes:
del counts[word]
items = list(counts.items()) # 将字典装入列表,目的同样是方便数据处理
items.sort(key=lambda x: x[1], reverse=True) # 根据值的大小,也即单词的出现次数,进行由大到小的排序
for i in range(10): # 选取出现次数最高的十个
word, count = items[i] # 键和值赋给变量
print("{0:<10}{1:>5}".format(word, count)) # 格式化打印,0和1表示位置,:表示引导符,<10表示左对齐,占10个位置,>5表示右对齐,占5个位置