国内刊号:11-5602/TP
国际刊号:1673-9418
发布日期:
作者:史东艳, 马乐荣, 丁苍峰, 宁秦伟, 曹江江
单位:延安大学 数学与计算机科学学院,陕西 延安 716000
关键词:特征表示,文本聚类,深度学习,大语言模型
基金:延安大学“十四五”中长期重大科研项目(2021ZCQ012);延安大学产学研合作培育项目(CXY202107);陕西省特支计划人才项目(YAU202305399)。
文本聚类是无监督学习的核心技术之一,其目标是将海量文本数据自动划分为若干语义高度相似的簇。近年来,基于深度学习的文本聚类取得蓬勃发展,研究焦点逐步转向利用先进的深度学习架构来高效提取文本特征,以进一步提高聚类结果的准确性。特别是依托RoBERTa和GPT等大型预训练语言模型的聚类策略,凭借其强大的预训练特征表示能力,已展现出卓越的性能优势。通过实例和数据的方式,全面回顾了文本聚类的发展历程、当前进展及其任务特性,旨在直观呈现其最新发展趋势及在数据挖掘领域的重要影响力。创新性地提出了一种面向深度学习架构特征的文本聚类模型分类方式。该分类方式依据模型在聚类任务中的核心机制与特征提取路径进行划分,内容涵盖从传统聚类算法到前沿技术的全面介绍,包括K-means、谱聚类、自编码器、生成模型、图卷积神经网络以及大型语言模型等多种方法,并对其具体实现细节进行深入分析。最后分析了现有方法的优势与局限,并在此基础上探讨未来可能的研究方向。
来源:2025年第11期
《计算机科学与探索》期刊编辑部