中文科技政策文本分类：增强的TextCNN视角_李牧南.pdfVIP免费

下载本文档

阅读 6
下载 0
格式 pdf
大小 1.45 MB
约7页
2023-03-29
收藏
评论
点赞(0)
海报
举报

科技管理研究ScienceandTechnologyManagementResearch2023No.22023年第2期doi:10.3969/j.issn.1000-7695.2023.2.020中文科技政策文本分类：增强的TextCNN视角李牧南1，2，王良1，赖华鹏1（1.华南理工大学工商管理学院，广东广州510641；2.广东省创新方法与决策管理系统重点实验室，广东广州510641）摘要：近年尽管针对中文本文分类的研究成果不少，但基于深度学习对中文政策等长文本进行自动分类的研究还不多见。为此，借鉴和拓展传统的数据增强方法，提出集成新时代人民日报分词语料库（NEPD）、简单数据增强（EDA）算法、word2vec和文本卷积神经网络（TextCNN）的NEWT新型计算框架；实证部分，基于中国地方政府发布的科技政策文本进行算法校验。实验结果显示，在取词长度分别为500、750和1000词的情况下，应用NEWT算法对中文科技政策文本进行分类的效果优于RCNN、Bi-LSTM和CapsNet等传统深度学习模型，F1值的平均提升比例超过13%；同时，NEWT在较短取词长度下能够实现全文输入的近似效果，可以部分改善传统深度学习模型在中文长文本自动分类任务中的计算效率。关键词：NEWT；深度学习；数据增强；卷积神经网络；政策文本分类；中文长文本中图分类号：TP391.1；D035-01；G301文献标志码：A文章编号：1000-7695（2023）2-0160-07TextClassificationofChineseS&TPolicies:EnhancedTextCNNPerspectiveLiMunan1,2,WangLiang1,LaiHuapeng1(1.SchoolofBusinessAdministration,SouthChinaUniversityofTechnology,Guangzhou510641,China;2.GuangdongKeyLaboratoryonInnovationMethods&DecisionManagementSystems,Guangzhou510641,China)Abstract:Inrecentyears,althoughtherearemanyresearchoutputsontheclassificationofChinesetext,therearestillveryfewpublicationsinvolvingautomaticclassificationofChinesepolicytextsbasedondeeplearning.Basedonthecurrentstudies,anewcomputingframework-NEWTisproposed,whichintegratesNEPD(NewEraPeople'sDailySegmentedCorpus),EDA(EasyDataAugmentation),Word2VecandTextCNN.Intheempiricalanalysis,thetextofscienceandtechnologypolicyofChineselocalgovernmentisextracted,andtheclassificationexperimentisconducted.TheexperimentalresultsshowthattheNEWTalgorithmisbetterthanthetraditionaldeeplearningmodelssuchasRCNN,Bi-LSTMandCapsNetwhenthelengthofwordsis500,750and1000,respectively,theave...

1、当您付费下载文档后，您只拥有了使用权限，并不意味着购买了版权，文档只能用于自身使用，不得用于其他商业用途（如 [转卖]进行直接盈利或[编辑后售卖]进行间接盈利）。
2、本站所有内容均由合作方或网友上传，本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺！文档内容仅供研究参考，付费前请自行鉴别。
3、如文档内容存在违规，或者侵犯商业秘密、侵犯著作权等，请点击“违规举报”。

碎片内容