美国知识问答网站 Quora 上的问题答案数据集,可用以进行重复问题检测。
2021-07-05 13:06:12 20.36MB 自然语言理解 NLP 问题答案匹配
1
来自某在线求医产品的中文医患对话数据。原始描述:The MedDialog dataset contains conversations (in Chinese) between doctors and patients.
1
队 为斯坦福问答数据集建立质量保证体系( ) 请阅读此博客以获取详细信息: : 第一个文件create_emb.ipynb负责为训练数据集的Wikipedia文章中的所有句子和问题创建一个嵌入句子的字典。 第二个文件unsupervised.ipynb使用句子嵌入来计算句子和问题之间的距离,基于欧几里得和余弦相似度。 最后,它从距问题最短距离的每个段落中提取设置。 目前,它们的准确度分别为45%和63%。 最后一个文件将此问题视为监督学习问题,其中我拟合多项逻辑回归,随机森林和xgboost并创建20个特征-(2个特征代表一个句子的余弦距离和欧几里得。我将每个段落限制为10个句子)。 目标变量是具有正确答案的句子ID。 所以我有10个标签。 目前,这分别提供了63%,65%和69%的准确性。 未来工作:使用RNN获得确切答案
2021-05-06 16:59:37 9.23MB 系统开源
1
# Chinese medical dialogue data 中文医疗对话数据集 ### Data_数据中有6个文件夹分别是: >**** 94596个问答对 > **** 220606个问答对 **** 183751个问答对 **** 75553个问答对 **** 101602个问答对 **** 115991个问答对 总计 792099个问答对
2021-04-15 22:17:22 144.11MB NLP 数据集
1
中文医学问答数据集 数据集描述:中文医药方面的问答数据集,超过10万条。 数据说明:questions.csv:所有的问题及其内容。answers.csv :所有问题的答案。 train_candidates.txt, dev_candidates.txt, test_candidates.txt :将上述两个文件进行了拆分。
1
中文医药方面的问答数据集,超过10万条。数据说明:questions.csv:所有的问题及其内容。answers.csv :所有问题的答案。 train_candidates.txt, dev_candidates.txt, test_candidates.txt :将上述两个文件进行了拆分。
1
通过BeautifulSoup库的ask120爬虫代码,分为科室链接爬取,问答链接爬取,问答详情爬取、医生信息爬取三个部分。
2019-12-21 21:11:57 13KB 医疗问答数据
1
小黄鸡50W条问答对话,都是中文,可供训练闲聊机器人试用。
2019-12-21 21:11:13 23.33MB 问答数据集
1