统计三国演义的高频人名

# threekingdoms.py
import jieba


txt = open("threekingdoms.txt", "r", encoding="utf-8").read()
excludes = {"意谓", "将军", "却说", "二人", "不可", "不能", "荆州", "天下", "如此", "这里", "商议", "如何"}  # 要提出的分词,因为不是人名
words = jieba.lcut(txt)
counts = {}
for word in words:
    if len(word) == 1:
        continue
    elif word == "诸葛亮" or word == "孔明曰":
        rword = "孔明"
    elif word == "关公" or word == "云长":
        rword = "关羽"
    elif word == "玄德" or word == "玄德曰":
        rword = "刘备"
    elif word == "丞相":
        rword = "曹操"
    else:
        rword = word  # 要不同的称谓转换为固定人名,便于统计数量
    counts[rword] = counts.get(rword, 0) + 1

for word in excludes:
    del counts[word]

items = list(counts.items())  # 将字典装入列表,目的同样是方便数据处理
items.sort(key=lambda x: x[1], reverse=True)  # 根据值的大小,也即单词的出现次数,进行由大到小的排序
for i in range(10):  # 选取出现次数最高的十个
    word, count = items[i]  # 键和值赋给变量
    print("{0:<10}{1:>5}".format(word, count))  # 格式化打印,0和1表示位置,:表示引导符,<10表示左对齐,占10个位置,>5表示右对齐,占5个位置

posted @ 2023-06-23 22:12  钢牙123  阅读(46)  评论(0)    收藏  举报