计算机技术与发展2022,Vol.32Issue(6) :28-33.DOI:10.3969/j.issn.1673-629X.2022.06.005

基于ERNIE-RCNN模型的中文短文本分类

Chinese Short Text Classification Based on ERNIE-RCNN Model

王浩畅 孙铭泽
计算机技术与发展2022,Vol.32Issue(6) :28-33.DOI:10.3969/j.issn.1673-629X.2022.06.005

基于ERNIE-RCNN模型的中文短文本分类

Chinese Short Text Classification Based on ERNIE-RCNN Model

王浩畅 1孙铭泽1
扫码查看

作者信息

  • 1. 东北石油大学 计算机与信息技术学院,黑龙江 大庆 163318
  • 折叠

摘要

由于中文短文本存在特征词少、规范性差、数据规模量大等难点,ERNIE预训练模型占用内存大,进行短文本分类时会造成向量空间稀疏、文本预训练不准确、时间复杂度高等问题.针对以上短文本分类存在的问题,提出基于ERNIE-RCNN模型的中文短文本分类.模型运用ERNIE模型作为词向量,对实体和词语义单元掩码,后连接Transformer的编码层,对ERNIE层输出的词嵌入向量进行编码,优化模型过拟合问题,增强泛化能力,RCNN模型对ERNIE输入的词向量进行特征提取,卷积层利用大小不同的卷积核提取大小不同的特征值,池化层进行映射处理,最后通过softmax进行分类.将该模型与七种深度学习文本分类模型在中文新闻数据集上进行训练实验,得到了模型在准确率、精准率、召回率、F1值、迭代次数、运行时间上的对比结果,表明ERNIE-RCNN模型能够很好地提取文本中的特征信息,减少了训练时间,有效解决了中文短文本分类的难点,具有很好的分类效果.

关键词

中文短文本分类/ERNIE模型/ERNIE-RCNN模型/词向量/特征提取/深度学习

引用本文复制引用

基金项目

国家自然科学基金(61402099)

国家自然科学基金(61702093)

出版年

2022
计算机技术与发展
陕西省计算机学会

计算机技术与发展

CSTPCD
影响因子:0.621
ISSN:1673-629X
参考文献量9
段落导航相关论文