上传者: 38605538
|
上传时间: 2021-11-06 17:33:23
|
文件大小: 57KB
|
文件类型: -
新人小菜鸟又来写博客啦!!!没人表示不开心~~(>_<)~~
今天我来弄一个简单的关键词提取的代码
文章内容关键词的提取分为三大步:
(1) 分词
(2) 去停用词
(3) 关键词提取
分词方法有很多,我这里就选择常用的结巴jieba分词;去停用词,我用了一个停用词表。
具体代码如下:
import jieba
import jieba.analyse
#第一步:分词,这里使用结巴分词全模式
text = '''新闻,也叫消息,是指报纸、电台、电视台、互联网经常使用的记录社会、传播信息、反映时代的一种文体,具有真实性、时效性、简洁性、可读性、准确性的特点。新闻概念有广义与狭义之分。就其