语言模型训练工具,可以进行统计翻译项目,亲测可用。
2021-11-25 11:59:50 191.25MB 语言模型
1
宗成庆书里面准确率最高的分词算法,代码有点错误,[c t]分母上的统计量应该是统计前几个字出现的字数而不是自身的个数,修改就可以进行分词,细节看里面的标注,参照给出的语料可以使用
2021-11-12 18:51:54 7KB 分词
1
NLP项目 自然语言处理项目,其中包括有关以下方面的概念和脚本: gensim , fastText和tensorflow实现。 参见, doc2vec , word2vec averaging和Smooth Inverse Frequency实现 对话系统的类别和组成 tensorflow LSTM (请参阅 ,和 , ) fastText实现 ELMo,ULMFit,GPT,BERT,XLNet的原理 HMM Viterbi实现。 参见,中文解读 Named_Entity_Recognition 通过双向LSTM + CRF,张量tensorflow实现对NER品牌。 参见中文注释,中文解读 7_Information_retrieval 8_Information_extraction 9_Knowledge_graph 10_Text_generation 11
1
FinBERT-QA:使用 BERT 回答金融问题 FinBERT-QA 是一个问答系统,用于从数据集的任务 2 中检索有金融段落。 请参阅获取更多信息。 该系统使用来自信息检索和自然语言处理的技术,首先使用 Lucene 工具包检索每个查询的前 50 个候选答案,然后使用预训练的模型的变新排列候选答案。 FinBERT-QA 从 Huggingface 的库构建并应用 Transfer and Adapt [ ] 方法,首先将预训练的 BERT 模型转移并微调到一般 QA 任务,然后使用 FiQA 数据集将该模型适应金融领域。 转移步骤在的数据集上使用微调的 BERT 模型 ,它从 TensorFlow 转换为 PyTorch 模型。 在三个排名评估指标(nDCG、MRR、Precision)上结果平均提高了约 20%。 Overview of the QA pipeline:
1
为解决旅游文本在特征表示时的一词多义问题, 针对旅游游记文本景点实体识别中景点别名的问题, 研究了一种融合语言模型的中文景点实体识别模型. 首先使用BERT语言模型进行文本特征提取获取字粒度向量矩阵, BiLSTM用于上下文信息的提取, 同时结合CRF模型提取全局最优序列, 最终得到景点命名实体. 实验表明, 提出的模型性能提升显著, 在实际旅游领域内景点识别的测试中, 与以往研究者方法比较下准确率, 召回率分别提升了8.33%, 1.71%.
1
该系统实现了基于深度框架的语音识别中的声学模型和语言模型建模,其中声学模型包括CNN-CTC、GRU-CTC、CNN-RNN-CTC,语言模型包含transformer、CBHG,数据集包含stc、primewords、Aishell、thchs30四个数据集。
2021-10-27 18:59:13 108.36MB Python开发-自然语言处理
1
NLP学习指南 本教程致力于帮助同学们快速入门NLP,并掌握各个任务的SOTA模型。 各任务模型列表汇总:,,,(todo), 各任务概述和技巧:,文本匹配,序列标注,文本生成,语言模型 之后就可以开始逐个击破,但也不用死磕,控制好目标难度,先用三个月时间进行第一轮学习: 读懂机器学习,深度学习原理,不要求手推公式 了解经典任务的基准,动手实践,看懂代码 深入一个应用场景,尝试自己修改模型,提升效果 迈过了上面这道坎后,就可以重新回归理论,提高对自己的要求,某种手推公式,盲写模型,拿到比赛Top等。 第一步:基础原理 机器学习最初入门时对数学的要求不是很高,掌握基础的线性代数,概率论就可以了,正常读下来的理工科大学生以上应该都没问题,可以直接开始学,碰到不清楚的概念再去复习。 统计机器学习部分,建议初学者先看懂线性分类,SVM,树模型和图模型,这里推荐李航的“统计学习方法”,薄的摸起来没有
2021-10-20 20:00:38 17KB
1
编译好的kenlm
2021-10-15 11:09:04 10.21MB kenlm 语言模型 语音识别
1
分词学习(3),基于ngram语言模型的n元分词-附件资源
2021-10-14 17:56:05 106B
1
单词张量流 使用TensorFlow在Python中使用词层语言模型的多层递归神经网络(LSTM,RNN)。 大多数重用的代码来自 ,其灵感来自Andrej Karpathy的 。 要求 基本用法 要在tinyshakespeare语料库上使用默认参数进行训练,请运行: python train.py 从经过训练的模型中采样 python sample.py 要使用波束搜索进行拾取,请使用--pick参数。 可以使用--width参数进一步自定义光束搜索,该参数设置要搜索的光束数量。 例如: python sample.py --pick 2 --width 4 样品输出 Word
2021-10-05 13:08:08 441KB python tensorflow lstm rnn
1