搜索NLP行业模型和轻量化客户定制
简介:开放搜索NLP行业模型和轻量化客户定制方案,解决减少客户标注成本、完全无标注或少量简单标注的等问题,让搜索领域扩展更易用。
特邀嘉宾:
徐光伟(昆卡)--阿里巴巴算法专家
搜索NLP算法
搜索链路
这是一个完整的从查询词到搜索结果的链路, 其中NLP算法发挥作用的地方主要在第二阶段的查询分析,该阶段包含多个NLP 算法模块,如文本侧的分词、纠错、实体识别、词权重、同义词以及语义向量等。系统是结合文本和语义向量多路召回排序的架构,从而满足不同业务场景的搜索效果需求。当然除了查询分析,在第一阶段的搜索引导以及第四阶段的排序服务中也有很多NLP 算法的应用。
查询分析
NLP 算法主要在这里的几个子模块发挥作用:
- 分词,精准的分词可以提高检索效率,也会让召回结果更加精准,
- 拼写纠错,对用户输入的query中出现拼拼写错误可以自动去纠错,提高搜索的体验。
- 实体识别,可以对query 中的每个词打上对应的实体标签,从而为后续的query改写和排序提供关键的特征。
- 词权重模型,会对每个词打上高、中、低的档位,在查询结果时去做丢词的重查。
- 同义词,扩展出相同意思的词来扩大召回范围。
- 最后是经过完整的查询分析模块之后的一个整体的query改写,将用户输入的query转换成我们搜索引擎能识别到的查询串。
现在开放搜索不仅支持了阿里自研的搜索引擎,也对开源的ES引擎做了兼容,可以让用户更方便的使用到我们的算法能力。
行业模型
客户痛点
1.通用模型领域适配难
- 通用模型主要解决新闻资讯行业问题;
- 在具体行业上效果会大打折扣;
例如:通用领域和电商领域的模型的区别
- 云服务产商基本只提供通用模型
- 公开行业数据集也主要覆盖通用领域
解决难度
构建一个行业搜索NLP 模型的流程:
- 首先是标注数据集这一步对于行业知识的要求非常高,同时对于数据量的要求也需要达到万级别,标注这样的数据同时也需要数个月的时间。
- 接着是模型训练,这一步是需要有专业的算法人员,如果不是对算法不熟悉的话,模型的迭代效率会很低
- 最后是模型上线这一步需要工程人员去部署运维,如果涉及到深度模型的一些上线,还会有很多效率优化的工作需要去做。在数据集标注阶段其实就已经存在了很多的挑战。
分词标注难点
1.领域知识要求高
例如:
- 药物的名称:利多卡因氯己定气雾剂 | 利多卡因 氯己定 气雾剂
- 地址:南召县四棵树乡王营村 | 南召 县 四棵树 乡 王营 村
2.交叉歧义判断难
例如:
- 洗衣服粉 | 洗衣 服 粉
实体识别标注难点
1.领域知识要求高
例如:
- 澳洲爱他美(母婴品牌)金装一段、科比(球鞋系列)4
- pytorch实现GAN(算法模型)
解决方法
开放搜索基于阿里巴巴内部搜索的数据积累,结合自动化数据挖掘和自研的算法模型,对行业模型的构建链路做了一个改造。
同样是以分词和NER为例,下面模型图是分词的流程。我们首先通过自动的新词发现算法去挖掘目标领域的领域新词,得到这些新词之后,我们会在目标领域上去构建一个远程监督的训练数据。
可以看到开放搜索的电商行业增强版都明显比通用版效果会好很多。
这套方案不仅仅适用于电商行业,只要是有数据积累的行业,都可以快速构建出一套行业模型。
开放搜索轻量化客户定制
客户痛点
刚刚提到的行业模型,适用能力可以达到80分的效果。
但具体到每个客户又存在细分领域的定制问题。 一般客户的目标可能是要达到90分。
比如下面的两个例子:
- 左边的这个“万斯汽水系列”,这其实是一个球鞋的一个具体的品牌和系列名称, 虽然开放搜索电商模型已经可以把品牌和普通词识别正确,但是对于汽水这个具体的细分的系列并没有正确的识别好。
- 下面右边的这个例子是“汉本萃葆蔚饮品”。这里开放搜索的电商模型完全没有识别出其中特有的品牌和它的子系列,客户在我们提供的行业模型基础上如果去做自主的定制优化一样会遇到上面介绍行业模型解决方案时的那些问题,从而最终很难去突破85分,
解决思路
整体的流程和行业模型构建链路类似,要把这些能力产品工具化让客户可以自主参与调优。
1.新建训练模型
下图是我们做的一个工具demo,上面是创模型,创建部分客户可以选择基础的行业模型,然后上传自己的领域无标注的数据就可以自动的开始模型的训练。
下面是模型训练之后客户可以在我们的系统上面去做一个直观的效果评估,可以看到这里会列出基础的模型和以及自动训练之后的模型的效果的变化,客户也可以去做少量的人工标注来验证模型的效果。
轻量化定制效果展示
我们的工具可以自动发现出场景中的这些新词,并对这些新词做实体标签的预测,可以看到括号中的这些新词是在不同的上下文中预测出的,标签的一个分布从而指导我们去判断这个新词它是否是一个合法的新词,以及它属于的实体标签到底是什么,为我们的模型去提供最关键的信息。
地址场景
电商场景
原文链接
本文为阿里云原创内容,未经允许不得转载。
【推荐】国内首个AI IDE,深度理解中文开发场景,立即下载体验Trae
【推荐】编程新体验,更懂你的AI,立即体验豆包MarsCode编程助手
【推荐】抖音旗下AI助手豆包,你的智能百科全书,全免费不限次数
【推荐】轻量又高性能的 SSH 工具 IShell:AI 加持,快人一步
· AI与.NET技术实操系列(二):开始使用ML.NET
· 记一次.NET内存居高不下排查解决与启示
· 探究高空视频全景AR技术的实现原理
· 理解Rust引用及其生命周期标识(上)
· 浏览器原生「磁吸」效果!Anchor Positioning 锚点定位神器解析
· DeepSeek 开源周回顾「GitHub 热点速览」
· 物流快递公司核心技术能力-地址解析分单基础技术分享
· .NET 10首个预览版发布:重大改进与新特性概览!
· AI与.NET技术实操系列(二):开始使用ML.NET
· 单线程的Redis速度为什么快?
2019-12-27 微服务治理实践:如何对单点异常进行自动摘除
2019-12-27 阿里云移动研发平台 EMAS 助力银行业打造测试中台,提升发版效能
2018-12-27 MaxCompute/DataWorks权限问题排查建议