计算机科学与探索杂志

计算机科学与探索杂志2022年第9期

  • 深度学习应用于目标检测中失衡问题研究综述
    任宁, 付岩, 吴艳霞, 梁鹏举, 韩希
    目前手工提取特征进行目标检测的方案被深度学习所取代,深度学习技术极大地推动了目标检测技术的发展。目标检测也成为了深度学习最重要的应用领域之一。目标检测是同时预测给定图像中对象实例的类别和位置,这项技术已经广泛应用于医学影像、遥感技术、监控安防、自动驾驶等领域。但是随着深度学习技术的应用领域的多元化,目标检测中出现的失衡问题成为了目前优化目标检测训练模型的一个新的切入点。主要分析在运用机器学习技术解决目标检测问题过程中,模型在每个训练阶段会出现的四类失衡问题:数据失衡、尺度失衡、相对空间失衡以及分类与回归失衡。剖析问题产生的主要原因,研究具有代表性的经典解决方案,阐述目标检测在各个领域中存在的问题。通过对目标检测失衡问题的分析和总结,讨论未来目标检测失衡问题的研究方向。
  • 命名实体识别方法研究综述
    李冬梅, 罗斯斯, 张小平, 许福
    在自然语言处理领域,命名实体识别是信息抽取的第一个关键环节。命名实体识别任务旨在从大量非结构化的文本中识别出命名实体并将其分类为预定义的类型,为关系抽取、文本摘要和机器翻译等自然语言处理任务提供基础支持。首先概述了命名实体识别的定义、研究难点和中文命名实体识别任务的特殊性,总结了命名实体识别任务中常用的中英文公共数据集和评估标准。然后根据命名实体识别的发展历程调研了现有的命名实体识别方法,主要为早期基于规则和词典的命名实体识别方法、基于统计机器学习的命名实体识别方法和基于深度学习的命名实体识别方法。归纳总结了每一种命名实体识别方法的关键思路、优缺点和具有代表性的模型,同时对各阶段的中文命名实体识别方法进行了总结。特别对最新的基于Transformer和基于提示学习的命名实体识别方法进行了综述,这两种细分类的方法是基于深度学习的命名实体识别方法中最先进的方法。最后总结了命名实体识别研究面临的挑战,并展望了未来的研究方向。
  • 机器学习解构区域金融风险防控研究进展
    张立华, 张顺顺
    区域金融风险防控(RFRP)无论在管理区域传统金融风险(TFR)还是坚守不发生区域金融系统风险(FSR)中都是不可或缺的。随着大数据规模的持续增长,金融风险形态变化的不确定性,传统计量方法模拟金融风险防控的效率、精度、应用等方面都面临着无法克服的困境。当下,越来越多的机器学习(ML)模拟RFRP防控的新方法和新技术受到研究者的重视。首先提出了RFRP防控新的科学分类和ML观念基础;其次总结了区域TFR防控的ML理论方法和应用技术,对各类代表性研究所论述区域TFR防控的关键逻辑、模型算法、学习效果进行了比对解析,对ML不同方法的优点、局限和传统场景进行了归类分析;然后梳理了区域FSR防控的ML理论方法和应用研究,对各类典型文献所解析区域FSR防控的关键脉络、ML算法、学习效果进行了对比研究,对ML不同模型的优势、缺陷和金融风险场景进行了阐述研究;最后提出了六个ML模拟RFRP防控的前景技术和新兴方向。
  • 深度学习的图像超分辨率重建技术综述
    杨才东, 李承阳, 李忠博, 谢永强, 孙方伟, 齐锦
    图像超分辨率重建技术的本质是突破现有硬件条件的限制,通过算法将低分辨率图像重建为高分辨率图像,获得包含更多信息的图像的技术。随着深度学习理论和技术的迅速发展,深度学习被引入到超分辨率重建领域并取得了进展。对基于深度学习的图像超分辨率重建算法进行了全面总结,并对已有算法进行了分类、分析和比较。首先,详细介绍了单图像超分辨率重建模型的组成结构,包括超分框架、上采样方法、非线性映射学习模块以及损失函数等。其次,从图像对齐和Patch匹配两方面出发,对现有的基于参考的图像超分辨率重建算法进行了分析。然后,介绍了图像超分辨重建领域的benchmark数据集以及图像质量评估参数,对目前主流算法的性能进行了评估。最后,对基于深度学习的图像超分辨率重建算法的未来研究趋势进行了展望。
  • 基于深度学习的代码表征及其应用综述
    张祥平, 刘建勋
    对程序进行分析、推理能够对软件开发、维护、迁移起到重要作用。如何高效地从程序代码中获取高质量信息成为了当前研究的热点。近几年有许多学者将基于深度学习的表征技术引入到程序代码分析任务中。深度学习模型能够自动地提取代码中所包含的隐含特征,降低对人工制定特征的依赖。首先介绍了代码表征的背景知识和基本概念,从代码静态信息分析角度出发,总结了基于深度学习的代码表征研究工作。之后进一步介绍了代码表征在代码克隆检测、代码搜索和代码补全三个任务上的具体应用。最后分析现有基于深度学习的代码表征工作中仍然存在的问题,并展望了未来可能的研究方向。
  • SQL-Detector:基于编码特征的SQL习题抄袭检测技术
    许嘉, 莫晓琨, 于戈, 吕品, 韦婷婷
    结构化查询语言(SQL)是学好数据库技术的关键。然而,大量教学实践表明学生在做SQL习题时存在抄袭现象。现有针对SQL习题的抄袭检测方案或是简单将学生提交的SQL代码进行相似性匹配来发现抄袭问题,或是利用学生在SQL编码习惯上的简单差异特征来发现抄袭的作业,均没能很好地利用学生书写SQL代码时所展现出的丰富编码特征来实现高精确度的抄袭检测。鉴于此,提出了基于编码特征的SQL习题抄袭检测技术,命名为SQL-Detector。首先,从SQL特性出发提出了面向特定SQL习题的学生习题编码特征和面向编码习惯的学生泛化编码特征,从而实现对学生的画像。其次,通过对学生的习题编码特征进行聚类分析识别出抄袭群体。最后,通过比较学生的习题泛化编码特征与其历史泛化编码特征之间的一致性来判定抄袭者与被抄袭者。利用真实课堂实践收集到的SQL习题答题数据进行实验评估,结果表明SQL-Detector技术对于SQL习题的抄袭检测精确度比相关最好的技术平均提高了14.0%。
  • 障碍空间中Voronoi图优化的反向近邻数聚类算法
    何云斌, 刘婉旭, 万静
    针对现有的障碍空间聚类算法需要人工选取聚类中心及设定阈值等问题,提出了一种障碍空间中Voronoi图优化的反向近邻数聚类算法(OBRK-means)。该算法从聚类中心的选取、离群点的筛选和广义覆盖圆三方面进行讨论和分析。首先,该算法引入Voronoi图来计算反向近邻数,进而确定聚类中心的候选集合;其次,利用Voronoi图和样本点密度进行数据集中离群点的筛选和剪枝;最后,引入广义覆盖圆来进行初始聚类,针对初始聚类结果不精确的问题提出内边界点和外边界点,并在内边界点和外边界点中根据公式分别计算出剔除点和拓展点来提高聚类准确性。理论研究和实验表明,该算法在处理障碍空间中的数据时具有更高的效率,能够得到更好的聚类结果。
  • 融合注意力的多维特征图卷积运动想象分类
    李珍琦, 王晶, 贾子钰, 林友芳
    运动想象(MI)作为脑机接口(BCI)的重要应用,是运动康复训练的重要支撑。由于脑电的电极分布并非天然的欧式空间,对运动想象进行准确分类具有很大的挑战。而且现有方法仅仅考虑了脑电信号(EEG)中某一维度或者某两维度的信息,无法全面捕获脑电信号在时、频、空三个维度存在的内在特征。同时,脑电信号各维度上的动态关联强度影响了分类的鲁棒性。针对上述问题,提出了一种新颖的融合注意力的多维特征图卷积网络(AMFGCN)。首先,根据电极节点分布的非欧空间特性设计出图结构,充分表示电极间的空间相关性。其次,提出时-空、频-空的双分支框架,同时表示脑电信号在时域、频域和空间域上的信息。最后,通过融合注意力机制、图卷积和时间/频谱卷积从图表示中学习脑电信号的空间表示、时间依赖性和频率依赖性,并自适应捕获各维度上的动态关联强度。在四个公开脑机接口数据集上进行了实验,结果表明AMFGCN模型提高了分类性能,优于其他现有的运动想象分类方法。
  • 时空特征金字塔模块下的视频行为识别
    龚苏明, 陈莹
    目前用于视频行为识别的主流2D卷积神经网络方法无法提取输入帧之间的相关信息,导致网络无法获得输入帧间的时空特征信息进而难以提升识别精度。针对目前主流方法存在的问题,提出了通用的时空特征金字塔模块(STFPM)。STFPM由特征金字塔和空洞卷积金字塔两部分组成,并能直接嵌入到现有的2D卷积神经网络中构成新的行为识别网络——时空特征金字塔网络(STFP-Net)。针对多帧图像输入,STFP-Net首先提取每帧输入的单独空域特征信息,并将这些特征信息记为原始特征;然后,所设计的STFPM利用矩阵转换操作对原始特征构建特征金字塔;其次,利用空洞卷积金字塔对构建的原始特征金字塔提取具有时空关联性的时序特征;接着,将原始特征与时序特征进行加权融合并传递给后续深层网络;最后,利用全连接对网络输出特征进行分类识别。与Baseline相比,STFP-Net引入了可忽略不计的额外参数和计算量。实验结果表明,与近些年主流方法相比,STFP-Net在主流数据库UCF101和HMDB51上的分类准确度具有明显提升。
  • 结合注意力与循环神经网络的专家推荐算法
    吕晓琦, 纪科, 陈贞翔, 孙润元, 马坤, 邬俊, 李浥东
    在线问答社区(CQA)已经成为互联网最重要的知识分享交流平台,将用户提出的海量问题有效推荐给可能解答的用户,挖掘用户感兴趣的问题是此类平台最核心功能。一些针对问答社区的专家推荐算法已经被提出用来提高平台解答效率,但是现有工作大多关注于用户兴趣与问题信息匹配,忽视了用户兴趣动态变化问题,可能会严重影响推荐质量。提出了结合注意力与循环神经网络的专家推荐算法,不仅实现了问题信息的深度特征编码,而且还能捕获动态变化的用户兴趣。首先,问题编码器在预训练词嵌入基础上结合卷积神经网络(CNN)和Attention注意力机制实现了问题标题与绑定标签的深度特征联合表示。然后,用户编码器在用户历史回答问题的时间序列上利用长短期记忆神经网络Bi-GRU模型捕捉动态兴趣,并结合用户固定标签信息表征长期兴趣。最后,根据两个编码器输出向量的相似性计算产生用户动态兴趣与长期兴趣相结合的推荐结果。在来自知乎问答社区的真实数据上进行了不同参数配置及不同算法的对比实验,结果表明该算法性能明显优于目前比较流行的深度学习专家推荐算法。
  • 密度峰值隶属度优化的半监督Self-Training算法
    刘学文, 王继奎, 杨正国, 李冰, 聂飞平
    现实中由于获取标签的成本很高,大部分的数据只含有少量标签。相比监督学习和无监督学习,半监督学习能充分利用数据集中的大量无标签数据和少量有标签数据,以较少的标签成本获得较高的学习性能。自训练算法是一种经典的半监督学习算法,在其迭代优化分类器的过程中,不断从无标签样本中选取高置信度样本并由基分类器赋予标签,再将这些样本和伪标签添加进训练集。选取高置信度样本是Self-Training算法的关键,受密度峰值聚类算法(DPC)启发,将密度峰值用于高置信度样本的选取,提出了密度峰值隶属度优化的半监督Self-Training算法(STDPM)。首先,STDPM利用密度峰值发现样本的潜在空间结构信息并构造原型树。其次,搜索有标签样本在原型树上的无标签近亲结点,将无标签近亲结点的隶属于不同类簇的峰值定义为簇峰值,归一化后作为密度峰值隶属度。最后,将隶属度大于设定阈值的样本作为高置信度样本,由基分类器赋予标签后添加进训练集。STDPM充分利用密度峰值所隐含的密度和距离信息,提升了高置信度样本的选取质量,进而提升了分类性能。在8个基准数据集上进行对比实验,结果验证了STDPM算法的有效性。
  • 改进的增量式动静结合协同过滤方法
    武美, 丁怡彤, 赵建立
    矩阵分解算法在推荐系统中因其具有较高的预测精度和良好的扩展性已被广泛运用,然而当前的矩阵分解算法大多处理的是静态数据,随着训练数据的逐渐增加,传统的矩阵分解方法需要对已有全部数据进行重新训练以更新模型,这样随之带来的时间花销和计算成本也大大增加。因此,如何在短时间内进行物品的评分预测以进行合理准确的推荐是研究的主要问题。针对此问题,提出了一种改进的增量式矩阵分解算法,主要思想是在预测过程中,根据评分来源分区域处理数据。分区域处理的方法可以有效地缩短计算的时间,并且将精度保持在一定范围内。在静态训练模块,初始的用户和物品的特征训练将不占用在线训练时间,并且在初始数据量较大时可以获得较好的精度;在动态训练模块中,对新进入的用户集和物品集上的相应评分提取并训练得到相应的小动态矩阵,在此之后动态维护和更新小矩阵,在此小矩阵上进行后续的特征训练。同时,为了在保证训练精度的同时降低动态矩阵的训练时间,采用了一种基于随机梯度下降方法的快速更新策略,该方法有效缩短了时间并且提高了一部分精度。在两个公开的数据集上的实验结果证明了此算法的优越性。
  • 考虑服务和认知差异的网络零售商竞争策略
    周小祥, 黄承锋, 李豪
    为分析顾客多元化环境下网络零售商复杂市场竞争行为,利用Hotelling模型,引入服务敏感度、认知差异化建立了零售商网上销售双寡头竞争模型,求解静态博弈和动态博弈下的均衡价格、需求及收益,并通过数值仿真研究变化趋势。研究表明,网络零售商的利润受到认知差异和服务差异的共同影响,不仅与价格直接相关,还与单位服务成本、品牌认知度、竞争对手的价格策略高度相关。具有网络品牌认知的高服务提供商具有显著的价格优势,高服务总是伴随着高价格。网络零售商存在认知离散价格效应,低认知服务提供商盲目提升认知服务水平有可能得不偿失。网络零售商同时具有博弈的动态决策优势,先决策的一方在利润、价格上明显优于后决策的一方,也显著优于静态决策下的均衡,零售商有充分的动力抢占市场先机。网络零售的服务水平存在一个理论阈值,商家不会提供超过阈值的服务,该研究结论可为大数据背景下零售商网络竞争均衡定价决策和服务模式选择提供理论参考。
  • 融合Grad-CAM和卷积神经网络的COVID-19检测算法
    朱炳宇, 刘朕, 张景祥
    新型冠状病毒肺炎(COVID-19)检测中胸部X射线(CXR图像)和电子计算机断层扫描(CT)图像是两种主要技术手段,为医生诊断提供了重要依据。针对当前卷积神经网络(CNN)在医学放射性图像中检测COVID-19的准确率不高、算法复杂、无法标记特征区域的问题,提出了一种融合梯度加权类激活映射(Grad-CAM)颜色可视化和卷积神经网络的算法(GCCV-CNN),对COVID-19阳性患者、COVID-19阴性患者、普通肺炎患者以及正常人的肺部CXR图像和CT扫描图像进行快速分类。通过定位到CXR图像和CT扫描图像中CNN进行分类的关键区域,再综合深度学习算法得到更准确的检测结果。为验证GCCV-CNN算法的有效性,分别在3个COVID-19阳性患者数据集上进行实验,并与已有算法进行比较。结果表明该算法对COVID-19阳性患者的CXR图像和CT扫描图像分类性能优于“新冠网络”(COVID-Net)算法及迁移学习新冠网络(DeTraC-Net)算法,准确率最高达98.06%,速度更快的同时还具有较好的鲁棒性。
  • 弱监督学习下的三维点云模型簇协同分割
    杨军, 雷喜文
    随着三维采集技术的快速发展,点云数据逐渐成为表示三维模型的基本数据格式之一,它可以保留模型的更多三维空间几何信息。但在三维点云模型分割研究中,大多深度学习网络架构依赖于高质量标注的数据,导致训练成本高昂。因此,针对利用带少量标注点的训练样本实现三维模型簇协同分割的问题,提出一种基于弱监督学习的三维点云模型簇协同一致分割方法。首先,通过K近邻算法建立点之间的局部邻域图;然后,利用局部卷积方法提取点云模型的部件特征并构建相似部件矩阵;最后,通过能量函数反向传播优化网络权值,获得模型簇的一致性分割结果。实验结果表明,该算法在公开数据集ShapeNet Parts上的分割准确率达到85.0%。与现有的有监督算法相比,该算法在训练样本标签数减少至10%的情况下依然能够取得与有监督学习方法接近甚至更好的分割结果,并且与目前主流的弱监督算法相比,分割准确率得到进一步提升。
  • 融合转置卷积与深度残差图像语义分割方法
    刘腊梅, 王晓娜, 刘万军, 曲海成
    针对深度学习图像语义分割方法中存在分割精度低、损失率高的问题,提出了融合转置卷积与深度残差图像语义分割方法。首先,为了解决神经网络深度增加引起分割精度下降、收敛速度慢的问题,设计一种深度残差学习模块来提升网络的训练效率和收敛速度;然后,为了使上采样过程与特征提取过程中特征图融合精度更高,将深度残差U-net模型中UpSampling2D和转置卷积两种上采样方式进行拼接,形成新的上采样模块;最后,针对网络训练过程中训练集与验证集之间存在的权值过度拟合问题,在网络的跳跃连接层引入Dropout,增强了网络的学习能力。在CamVid数据集上对算法的性能进行了证明,算法语义分割精度达到89.93%,损失率降到0.23,与U-net模型相比,验证集精度提升了13.13个百分点,损失率降低了1.20,优于当前的图像语义分割方法。所提出的图像语义分割新模型,综合了U-net模型的优点,使得图像语义分割精度更高,语义分割的效果更好,有效提升了算法的鲁棒性。
  • 加权网络下的小目标检测算法
    陈灏然, 彭力, 李文涛, 戴菲菲
    对于一幅图的观察,本能上会更多关注这幅图中相对更醒目的对象。通常这类对象会在这幅图中占据较大比重,从而导致小目标被忽视。由于小目标所在区域往往为弱测区域,检测器提取特征的过程中能够提取的特征较少,且在提取完特征后在特征信息传递的过程中容易丢失,使得针对小目标检测的效果并不是很好。因此,在单阶检测器的基础上,加入了跨信道交互的机制确保层间信息的完整,同时采取对训练样本进行目标增强并且设计了一个通用的损失函数,在此基础上改进样本加权网络预测样本的任务权重。提出的框架UWN在VOC公开数据集上的mAP为81.2%,在自制的小目标航拍数据集的mAP为82.3%。相对于FSSD算法,牺牲了部分速度,得到了精度方面的较大提升。
  • 融合经验共享Q学习的粒子群优化算法
    罗逸轩, 刘建华, 胡任远, 张冬阳, 卜冠南
    传统粒子群优化算法(PSO)有着易陷入局部最优、多样性不足和精度低等缺点。近年来,采用强化学习的Q学习思想改进粒子群算法成为一种新的方法,然而目前这种方法存在参数选择偏主观和使用策略单一使其无法解决复杂情况的问题。提出一种融合经验共享策略Q学习的粒子群优化算法(QLPSOES)。该算法将粒子群算法与Q学习方法结合,对每个粒子构建一张Q表,供粒子参数动态选择;同时设计了一种经验共享策略,即粒子通过Q表共享最优粒子的“行为经验”,加速Q表的收敛,增强粒子之间的学习能力,平衡算法的全局和局部搜索能力。另外,采用正交分析法实验,寻找融合Q学习粒子群算法的状态、动作参数和奖励函数等参数的最优组合;最后通过CEC2013中的基准测试函数的实验测试,结果表明,融合经验共享Q学习的粒子群算法的收敛速度和收敛精度相对给出的对比算法均有明显提升,验证了算法具有较优的性能。
  • 加权K近邻和多簇合并的密度峰值聚类算法
    陈磊, 吴润秀, 李沛武, 赵嘉
    密度峰值聚类(DPC)算法是一种基于密度的聚类算法。该算法原理简单、运行高效,可以找到任意非球形类簇。但是该算法存在一些缺陷:首先,该算法局部密度定义的度量准则不统一且两者的聚类结果存在较大差异;其次,该算法的分配策略易产生分配连带错误,即一旦某一个样本分配错误,会导致后续一连串的样本分配错误。为解决这些问题,提出了一种加权$K$近邻和多簇合并的密度峰值聚类算法(WKMM-DPC)。该算法结合加权$K$近邻的思想,引入样本的权重系数,重新定义样本的局部密度,使局部密度更加依赖于K近邻内样本的位置,且统一了密度定义的度量准则;定义了类簇间的相似度,并据此度量准则进行多簇合并,以避免分配剩余样本时的分配连带错误。在人工和UCI数据集上的实验表明,该算法的聚类效果优于FKNN-DPC、DPCSA、FNDPC、DPC和DBSCAN算法。
计算机科学与探索封面

中文名称:计算机科学与探索

杂志社官网:http://fcst.ceaj.org/

英文名称:Journal of Frontiers of Computer Science and Technology

语言:中文

类别:自动化技术、计算机技术

主 编:周志华

创刊时间:2007

出版周期:月刊

国内刊号:11-5602/TP

国际刊号:1673-9418

出版地:北京市

咨询工作人员

联系我们

  • 地址:北京市海淀区北四环中路211号
  • 电话:(010)89056056
  • E-mail:fcst@vip.163.com