其中包含的val(已整理的搜狗实验室新闻文本数据)、stopwords数据来源于网课资源,能够帮助新手尽快完成一次新闻文本分类的实战项目
1
分析化学第七版配套课件 8.电位法和永滴定法
2021-07-09 14:02:58 1.39MB 分析化学第七版配套课件8.电位
一个文本文件,包含中文用词集合,对文本处理过程中,方便剔除用词
2021-07-09 09:11:21 4KB 文本,停用词
1
爬取股票信息(4月9日,股票涨股池信息)所生成的csv文件,用于学习数据分析使用,删去了 ‘涨统计’ 和‘加自选’ 列,‘炸板次数’ 为0次的将数据变为了nan,用于数据分析中的nan值处理使用
2021-07-08 21:54:39 11KB csv
1
该资源是本人博客《文本聚类(一)—— LDA 主题模型》中所使用的用词表,是在百度用词表的基础上加入了一些分词后产生的单个字以及数字信息等内容,不建议作为通用性质的用词表使用
2021-07-08 19:06:10 26KB 停用词
1
论文中用到的部分基础文本分析技术(包括分词、去除用词、word2vec、TF-IDF、词云图、名称提取、词性标注、LDA主题模型)
2021-07-08 15:02:47 6MB 分词 去除停用词 word2vec TF-IDF
英、法、德、意、葡、土耳其等14种语言中的用词
2021-07-07 15:12:32 8KB 停用词
1
开关 GB/T 140485 认证证书
2021-07-07 14:08:11 886KB 急停开关GB/T14048 GB/T140485
最近做了些关于关键词(敏感词)过滤、lucene搜索方面的编码工作,整理了一些词库,共享给大家,希望用得着。所有词库都是纯文本格式的。
2021-07-06 17:37:04 255KB 搜狗 词库 敏感词 停用
1
文本处理中使用的敏感词汇库及用词库,用词是指在信息检索中,为节省存储空间和提高搜索效率,在处理自然语言数据(或文本)之前或之后会自动过滤掉某些字或词,这些字或词即被称为Stop Words(用词)。
2021-07-06 17:31:19 110KB 文本处理
1