2011年8月16日

全文检索、数据挖掘、推荐引擎系列3---全文内容推荐引擎之中文分词

摘要: 基于内容的推荐引擎有两种实现途径,一种是根据条目的元数据(可以将元数据理解为属性),另一种是根据条目的文本描述信息。本系列中将先描述基于条目描述信息的全文检索实现方式,然后描述基于元数据的内容推荐引擎实现方式。对于基于条目文本描述信息的内容推荐引擎,目前有很多资料可以参考,基本步聚是先对文本内容进行分词,包括提取出单词、去掉常用词如的地得、加入同意词、对英语还有去掉复数形式和过去分词形式等;第二步是计算各个词在每篇文章中的出现频率,以及在所有文章中的出现频率,即TF/IDF;第三步计算文章向量;最后是利用自动聚类算法,对条目进行聚类,这样就可以实现向用户推荐同类产品的需求了。但是在这里有一个非 阅读全文

posted @ 2011-08-16 11:30 最老程序员闫涛 阅读(2922) 评论(2) 推荐(4) 编辑

最老程序员创业札记:全文检索、数据挖掘、推荐引擎应用8

摘要: 辞职创业吴言在经过了几天的反复思考,终于下定决心辞职创业了。做出这个决定真的需要很大的勇气,因为自己的年纪做为程序员来说,已经属于很高龄了,如果创业失败几乎没有退路,再找工作将很难,合适的工作几乎是不可能的。但是如果一辈子就这么重复着当下的生活,他又不甘心,非常的不甘心,放弃一切也要尝试一把的诱惑使他难以抗拒。整整一个上午,吴言都在早已写好的辞职邮件界面上,他需要鼓足勇气才能按下发送按钮,但是每一次他都在最后一刻放弃了,终于在近乎于误操作的情形下,他按下了发送按钮。终于,吴言如释重负,完成了一件大事。但是心里也有了一丝的不安,创业失败和失业这些词时常在脑海里闪现,每到想起这些,吴言都会觉得脊背 阅读全文

posted @ 2011-08-16 08:30 最老程序员闫涛 阅读(5920) 评论(24) 推荐(5) 编辑

导航