1.数据

目前的数据总体上分为结构化和非结构化的数据。结构化的数据是指实体和关系的规范和可预测的组织。大部分的需要处理的数据都属于非结构化的数据。

2.信息提取

简言之就是从文本中获取信息意义的方法。信息提取目前已经应用于很多领域,比如商业智能,简历收获,媒体分析,情感检测,专利检索及电子邮件扫描。当前研究的一个特别重要的领域是提取出电子科学文献的结构化数据,特别是在生物和医学领域。

3.信息提取的结构

上图显示的是一个简单的信息提取系统的结构。首先,使用句子分割器将该文档的原始分本分割成句,使用分词器将每个句子进一步细分为词。接下来,对每个句子进行词性标注,最后使用关系识别搜索文本中不同实体间的可能关系。

posted on 2017-02-23 20:23  寒若雪  阅读(4871)  评论(0编辑  收藏  举报