上传者: 38590790
|
上传时间: 2022-05-02 17:39:13
|
文件大小: 57KB
|
文件类型: PDF
文本预处理
1、概述
文本数据:有用内容和无用内容
文章:单词、符号、空格、乱码等
思想:我们需要对无用信息进行过滤,而计算机无法直接处理单词等有用信息,我们需要把他们转换成数字。将单词映射到不同的数字,可以考虑用列表,如data=[‘ni’, ‘hao’],我们就可以用data[0],data[1]来表示
单词内容,这就是索引到单词,然后 ‘ni hao’我们可以表示成’01’,这就是单词到索引,通过建立单词与数字的关系来进行互相的映射,这是文本预处理的核心思想
预处理的步骤:
1、读文本(计算机读取)
2、分词(过滤无用信息)
3、建立字典(建立索引到词的映射)
4、词序列转换成索引序列(