Elasticsearch N-gram分词器介绍 (7)
摘要:
一.概述 Ngram是一种基于统计语言模型的算法。Ngram基本思想是将文本里面的内容按照字节大小进行滑动窗口操作,形成长度是N的字节片段序列。此时每一个字节片段称为gram。对所有gram的出现频度进行统计,并且按照事先设定好的阈值进行过滤,形成关键gram列表,也就是这个文本的向量特征空间。列表 阅读全文
posted @ 2024-04-24 14:42 花阴偷移 阅读(1377) 评论(0) 推荐(0) 编辑