国内刊号:11-5602/TP
国际刊号:1673-9418
发布日期:
作者:姜钰棋, 侯智文, 王一帆, 翟晗名, 卜凡亮
单位:中国人民公安大学 信息网络安全学院,北京 100240
关键词:社交平台文本分类,不平衡数据处理,SimBERT,EDA,Focal Loss
随着社会信息化程度加深,运用自然语言处理技术从海量网络数据中筛选提取有效信息,具有重要的实用价值。然而,从社交平台收集的文本数据存在有效信息类别数据量少、类别不平衡等问题。因此,提出SimDyFeFL方法解决中文应急关联文本识别任务的数据不均衡问题,EdaDyFeFL方法解决英文网络暴力检测任务的数据不均衡问题。采用SimBERT与EDA方法将类间差异较大的原始数据增强至类间数量相近后,融合加入动态反馈过程的Focal Loss函数对各类别加权,并设计BERT、RoBERTa与BERT_DPCNN作为文本分类模型进行三个阶段的对比实验,证明提出方法的有效性。在中、英文两个真实数据集上的大量实验表明,使用SimDyFeFL与EdaDyFeFL改进后的文本分类模型综合性能提升显著,中文模型准确率最高提升7.70个百分点,英文模型准确率最高提升5.15个百分点。与Kaggle平台已有研究取得的最好成绩相比,英文模型准确率高出了2.92个百分点,Macro F1值与Weighted F1值分别高出2.83个百分点与2.95个百分点。
来源:2024年第9期
《计算机科学与探索》期刊编辑部