计算机科学与探索

北大核心,INSPEC,JST,CSCD,WJCI

国内刊号:11-5602/TP

国际刊号:1673-9418

计算机科学与探索杂志2025年第10期:基于密度峰值快速聚类算法的合成过采样方法

发布日期:

作者:冷强奎, 李梓涵

单位:辽宁工程技术大学 电子与信息工程学院,辽宁 葫芦岛 125105

关键词:不平衡数据,CFSFDP聚类算法,合成过采样,边界样本

基金:辽宁省教育厅科研项目(JYTMS20230819);辽宁工程技术大学博士科研启动基金(21-1043)。

类不平衡问题,作为分类任务中的一大挑战,源于训练数据集中多数类与少数类样本数量的显著失衡。这种不平衡性不仅影响分类器的泛化能力,还可能导致对少数类样本的识别精度大幅下降。过采样技术,尤其是合成过采样技术(SMOTE)及其变种方法,作为缓解此类问题的有效手段,通过生成额外的少数类样本来平衡数据集。然而,这些方法存在生成样本可能引入噪声、样本多样性不足以及未能充分关注边界区域等局限性。鉴于边界样本在分类决策中的关键作用及其易受分类器误判的特性,提出了一种创新的过采样策略,旨在精准识别边界样本,并在其周围生成高质量的新样本。该方法采用密度峰值快速聚类算法CFSFDP,凭借其识别局部密度峰值的能力,计算出每个少数类样本的局部密度,进而筛选出位于分类边界样本。通过计算这些边界样本与其最近多数类样本之间的欧式距离,为每个边界样本定义一个合适的球形区域,该区域既涵盖了边界样本的潜在分布范围,又避免了与多数类样本的过度重叠。在确定了边界样本及其对应的球形区域后,该方法在该区域内随机生成新的合成样本。这一步骤不仅增加了少数类样本的多样性,还使得生成的样本更加贴近真实的边界分布,从而有助于分类器更好地学习少数类的复杂特征。为验证该方法的有效性,将其与现有的9种过采样方法在32个真实世界的不平衡数据集上进行了全面比较。实验结果表明,提出的方法在多个评价指标上均表现出色。

来源:2025年第10期

《计算机科学与探索》期刊编辑部

查看计算机科学与探索杂志2025年第10期

联系我们

  • 地址:北京市海淀区北四环中路211号
  • 电话:(010)89056056
  • E-mail:fcst@vip.163.com

咨询工作人员