陋室铭
永远也不要停下学习的脚步(大道至简至易)

posts - 2169,comments - 570,views - 413万

索引库就类似于我们查字典时候的检索表,或者是图书馆的书目检索。Google的蜘蛛在抓取网页之后,就把这些页面放到对应的索引库里面。在用户搜索的时候,只需要到相应的检索库里面搜索相应的信息,而不是从所有的页面当中。

索引库的分类方式

索引库里用词语来分类。因为尽管互联网上的网页是不断激增的,但是每一种语言里,词语的数量都是相对固定的。比如英语就是一百多万个单词,100亿 ÷ 1百万 = 1 万;汉语是8万多个词语,100亿÷8万=12万5千。都是计算机很容易处理得过来的。
用词语来分类还有一个好处,就是可以匹配用户查询的那个词语。本来用户就是要查这个词语的,那我就按这个词语去分类就是。所以,搜索引擎的索引库,最后就是这个样子的:
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
posted on   宏宇  阅读(186)  评论(0编辑  收藏  举报
编辑推荐:
· AI与.NET技术实操系列:基于图像分类模型对图像进行分类
· go语言实现终端里的倒计时
· 如何编写易于单元测试的代码
· 10年+ .NET Coder 心语,封装的思维:从隐藏、稳定开始理解其本质意义
· .NET Core 中如何实现缓存的预热?
阅读排行:
· 分享一个免费、快速、无限量使用的满血 DeepSeek R1 模型,支持深度思考和联网搜索!
· 25岁的心里话
· 基于 Docker 搭建 FRP 内网穿透开源项目(很简单哒)
· ollama系列01:轻松3步本地部署deepseek,普通电脑可用
· 按钮权限的设计及实现
历史上的今天:
2010-05-28 记录一下(session共享的文章,wcf记录一下学习地址,Firebug)
2009-05-28 象素图和向量图
2009-05-28 字符串转化为二进制byte[]
< 2025年3月 >
23 24 25 26 27 28 1
2 3 4 5 6 7 8
9 10 11 12 13 14 15
16 17 18 19 20 21 22
23 24 25 26 27 28 29
30 31 1 2 3 4 5

点击右上角即可分享
微信分享提示