使用Solr构建企业级的全文检索(一)---------开篇
换了个工作单位,也就换了从事的项目的业务类型。新的项目中要需要使用全文检索功能,由于项目是基于SQL server的应用,所以旧的设计也就使用了SQL server的Full-text Search Engine来实现全文检索功能。在使用SQL server 的全文检索功能的过程中,发现有很多的问题不能很好的解决,比如Cache,一般来说,对于SQL server的缓存也就是执行计划的缓存和查询结果的页面缓存,远远不够,而且也很难根据自己的业务需要去调整缓存的参数。另外对于多语言的分词算法问题,SQL server虽然内置了50多种语言的支持,但是都不够完美,如果自己想要进行替换,应该是很困难的。还不支持Highlighting,还有现在应用很广泛的Faceting以及Field Collapsing。客户推荐我们使用一下Solr来改进全文检索功能,所以我就花了些时间来研究了下Solr,并打算写一些文章总结一下Solr的使用,也希望对各位同学有帮助吧。
唧唧歪歪说了一堆,现在就进入正题吧 。
首先介绍一下Solr是什么。要说Solr,先说说Lucene。Lucene是Apache基金会一个全文检索库类库的项目,这个项目的开源的,这个类库是使用Java开发的,功能非常强大,如果大家感兴趣可以去看看http://lucene.apache.org/.当然这个类库也有几个其它语言的实现,比如Python,也有.net的叫做lucene.net,不过因为社区活跃度不高,Apache基金会已经不再赞助这个子项目了。 如果哪位同学希望把全文检索的功能集成在自己的系统里面,或者扩展luence的全文检索功能,那应该好好学学Lucene。如果你只想使用全文检索,对底层的算法和逻辑既不想研究也不想干预,那么Solr可能是一个更好的选择。简单的说,Solr就是使用Lucene库实现的一个http服务,当然他也做了很多的扩展。你可以将Solr部署在任何一个Java Serverlet容器里,比如Tomcat,Jetty。你可以通过RESTful的url就可以和Solr进行通信,进行文档的indexing和检索。这样一来,易用性就得到大大的提升,因为不管你的项目是基于什么操作系统平台的,使用什么语言开发的,只要你能和http服务器进行通信,就能非常简单快捷的在你的项目中实现全文检索功能。如果要更加详细的谅解Solr的相关信息,请访问:http://lucene.apache.org/solr/
接下来我们需要下载和部署Solr。从 http://mirror.bjtu.edu.cn/apache//lucene/solr/这个页面里选择下载最新的版本,目前是3.5.0,刚刚出炉的。在安装前有几个准备工作要做。Solr是用Java实现的,所以毫无疑问Java的虚拟机是要的,不管你是在Window上安装,还是在Linux上安装,点击这里下载JDK,安装完JDK别忘了检查JAVA_HOME环境变量是否设置了。另外,如果你打算使用Tomcat的话,那就得先安装Tomcat,点击这里了下载。其实在实践和练习的时候是用Jetty是比较方便的。如果你在windows上使用Solr,那么把刚才下载的Solr文件包加开,使用dos 命令行控制台进入example目录,输入java -jar start.jar,然后回车,如果没有什么异常信息,Solr就启动起来了。现在你打开浏览器,输入http://localhost:8983/solr/admin/,就可以进入Solr的管理控制台了,如下图
简单的安装已经完成,可以进行文档索引和查询了。
今天的开篇就到这里吧,算是准备了一个环境。后续我会写一系列文章来介绍Solr的使用。
在提供一些对大家准备环境有帮助的信息:
Solr client for .Net --google code上的项目,项目的负责人很积极,如果你提交了Issue或者Defect,他会持续的关注和反馈。