半监督序列学习
此回购记录了重现论文给出的结果的实验。 简而言之,我们在未标记的文本数据上对序列自动编码器或语言模型进行预训练,然后使用标记的文本数据对使用预训练权重初始化的基于RNN的序列分类器进行微调,与随机初始化的权重相比,分类精度更高。
资料准备
IMDB数据集
我们为此实验使用。 下载并解压缩,导航至目录aclImdb/train ,该目录aclImdb/train中包含带aclImdb/train/pos的正( aclImdb/train/pos )和带标签的负性( aclImdb/train/neg )以及未标签的评论( aclImdb/train/unsup )。 然后cd进入每个子目录并运行
for f in *.txt; do (cat "${f}"; echo) >> pos.txt; done
for f in *.txt; do (cat "${f}"; ec