中英文对话语料收集
一、用于对话系统的中英文语料 Datasets for Training Chatbot System
参考:GitHub - candlewill/Dialog_Corpus: 用于训练中英文对话系统的语料库 Datasets for Training Chatbot System
本项目收集了一些从网络中找到的用于训练中文(英文)聊天机器人的对话语料
公开语料
搜集到的一些数据集如下,点击链接可以进入原始地址
-
dgk_shooter_min.conv.zip
中文电影对白语料,噪音比较大,许多对白问答关系没有对应好 -
The NUS SMS Corpus
包含中文和英文短信息语料,据说是世界最大公开的短消息语料 -
ChatterBot中文基本聊天语料
ChatterBot聊天引擎提供的一点基本中文聊天语料,量很少,但质量比较高 -
Datasets for Natural Language Processing
这是他人收集的自然语言处理相关数据集,主要包含Question Answering,Dialogue Systems, Goal-Oriented Dialogue Systems三部分,都是英文文本。可以使用机器翻译为中文,供中文对话使用 -
小黄鸡
据传这就是小黄鸡的语料:xiaohuangji50w_fenciA.conv.zip (已分词) 和 xiaohuangji50w_nofenci.conv.zip (未分词) -
白鹭时代中文问答语料
由白鹭时代官方论坛问答板块10,000+ 问题中,选择被标注了“最佳答案”的纪录汇总而成。人工review raw data,给每一个问题,一个可以接受的答案。目前,语料库只包含2907个问答。(备份) -
Chat corpus repository
chat corpus collection from various open sources
包括:开放字幕、英文电影字幕、中文歌词、英文推文 -
保险行业QA语料库
通过翻译 insuranceQA产生的数据集。train_data含有问题12,889条,数据 141779条,正例:负例 = 1:10; test_data含有问题2,000条,数据 22000条,正例:负例 = 1:10;valid_data含有问题2,000条,数据 22000条,正例:负例 = 1:10
未公开语料
这部分语料,网络上有所流传,但由于我们能力所限,或者原作者并未公开,暂时未获取。只是列举出来,供以后继续搜寻。
- 微软小冰
二、其它中文聊天语料
1.candlewill/Dialog_Corpus:这个是一个集合,包括之前答主的答案!
2.中文单轮短文本对话:Short-Text Conversation 找了下,李航老师对应论文:Neural Responding Machine for Short-Text Conversation
3.中文多轮对话:MarkWuNLP/MultiTurnResponseSelection,来自豆瓣的多轮对话
4.面向垂直领域智能问答的语料:Samurais/insuranceqa-corpus-zh 是目前已知的最好的中文保险语料。
5.开放域聊天,高质量闲聊(聊天、对话)语料____dada_____新浪博客 质量不错。