计算机科学与探索杂志

计算机科学与探索杂志2021年第10期

  • 人脸去遮挡新技术研究综述
    刘颖, 张艺轩, 佘建初, 王富平, 林庆帆
    刑侦工作中,若犯罪嫌疑人的人脸图像存在遮挡,人脸特征点遭到破坏,精确去除遮挡区域成为提高人脸识别技术的重要一步。因此,人脸去遮挡有着重要的研究意义。对人脸去遮挡技术最新进展进行阐述,并基于2016年首次提出的基于深度学习图像修复算法,介绍从2017年至今学者们提出的各类人脸去遮挡融合算法。首先根据遮挡方式的不同将现有算法分类为随机遮挡和规则遮挡的人脸修复,接着根据算法中预测生成网络的不同,进一步分为基于卷积神经网络(CNN)和基于生成式对抗网络(GAN),并对各类融合算法从模型网络特点、优缺点以及适用场景进行分析,给出一些融合算法的选择建议,从网络结构和适用范围方面对比总结规则遮挡算法和随机遮挡算法。然后介绍并汇总常用的图像修复效果评价指标和数据集,通过列举各类修复算法的实验结果,提炼并分析其定量指标和视觉效果,说明了近年来的人脸去遮挡技术取得了较大的进展。最后结合现有算法和实际需求,从数据集、算法、评价指标等五方面指出人脸去遮挡技术的未来发展趋势。
  • 生成式对抗网络及其在图像生成中的研究进展
    马永杰, 徐小冬, 张茹, 谢艺蓉, 陈宏
    生成式对抗网络(GAN)现已成为深度学习领域热门的研究方向,其独特的对抗性思想来源于博弈论中的二人零和博弈,如何解决GAN训练不稳定、生成样本质量差、评价体系不够健全、可解释性差等问题是目前GAN研究的重点和难点。调研了生成式对抗网络的研究背景和发展趋势。首先阐述了生成式对抗网络的基本思想和算法实现,分析了GAN的优势与不足,然后对已有改进方法进行了较为系统的分类,从基于结构改变和基于损失函数变体的两种类型分别梳理了一些典型的GAN的优化方法和衍生模型;比较了GAN与其他生成模型的异同,介绍了各自的优势与不足;对比了GAN及其衍生模型的性能,总结了它们的运作机制、优点、局限性以及适用场景,介绍了生成式对抗网络在图像生成领域中的应用;最后列举了生成式对抗网络的主流评价指标,分析了GAN研究中仍面临的主要问题并给出对应的解决思路,并将列举出的主流解决手段在解决效果及可应用性方面进行了对比分析,展望了未来的研究方向。
  • 卷积神经网络压缩中的知识蒸馏技术综述
    孟宪法, 刘方, 李广, 黄萌萌
    近年来,卷积神经网络(CNN)凭借强大的特征提取和表达能力,在图像分析领域的诸多应用中取得了令人瞩目的成就。但是,CNN性能的不断提升几乎完全得益于网络模型的越来越深和越来越大,在这个情况下,部署完整的CNN往往需要巨大的内存开销和高性能的计算单元(如GPU)支撑,而在计算资源受限的嵌入式设备以及高实时要求的移动终端上,CNN的广泛应用存在局限性。因此,CNN迫切需要网络轻量化。目前解决以上难题的网络压缩和加速途径主要有知识蒸馏、网络剪枝、参数量化、低秩分解、轻量化网络设计等。首先介绍了卷积神经网络的基本结构和发展历程,简述和对比了五种典型的网络压缩基本方法;然后重点针对知识蒸馏方法进行了详细的梳理与总结,并在CIFAR数据集上对不同方法进行了实验对比;其后介绍了知识蒸馏方法目前的评价体系,给出多类型方法的对比分析和评价;最后对该技术未来的拓展研究给出了初步的思考。
  • 细粒度图像分类的深度学习方法
    李祥霞, 吉晓慧, 李彬
    细粒度图像分类旨在从某一类别的图像中区分出其子类别,通常细粒度数据集具有类间相似和类内差异大的特点,这使得细粒度图像分类任务更加具有挑战性。随着深度学习的不断发展,基于深度学习的细粒度图像分类方法表现出更强大的特征表征能力和泛化能力,能够获得更准确、稳定的分类结果,因此受到了越来越多研究人员的关注和研究。首先,从细粒度图像分类的研究背景出发,介绍了细粒度图像分类的难点和研究意义。其次,从基于强监督和弱监督两个角度,综述了基于深度学习的细粒度图像分类算法的研究进展,并介绍了多种典型的分类性能优秀的算法。此外,进一步论述了目前关于YOLO、多尺度CNN和生成对抗网络(GAN)等前沿深度学习模型在细粒度图像识别方面的应用,并且对比了最新的相关细粒度图像的数据增强方法的分类效果以及在复杂场景下不同类型的细粒度识别方法的性能特点分析。最后,通过对算法的分类性能进行对比和总结,探讨了未来发展方向和面临的挑战。
  • 开放领域知识图谱问答研究综述
    陈子睿, 王鑫, 王林, 徐大为, 贾勇哲
    知识图谱问答是通过处理用户提出的自然语言问题,基于知识图谱的某种形式,从中获取相关答案的过程。由于知识规模、计算能力及自然语言处理能力的制约,早期知识库问答系统被应用于限定领域。近年来,随着知识图谱的发展,以及开放领域问答数据集的陆续提出,知识图谱已用于开放领域问答研究与实践。以技术发展为主线,对开放领域知识图谱问答进行综述。首先,介绍五种基于规则模板的开放领域知识图谱问答方法:传统语义解析、传统信息检索、三元组匹配、话语模板和查询模板,这类方法主要依赖人工定义的规则模板完成问答工作。其次,描述五种基于深度学习的方法,这类方法采用神经网络模型完成问答过程的各类子任务,包括知识图谱嵌入、记忆网络、基于神经网络的语义解析、基于神经网络的查询图、基于神经网络的信息检索。接着,介绍开放领域知识图谱问答常用的4个通用领域知识图谱和11个开放领域问答数据集。随后,按照问题的难易程度选择3个经典问答数据集比较各问答系统的性能指标,对比不同方法间的性能差异并进行分析。最后,展望开放领域知识图谱问答的未来研究方向。
  • 融合子图结构的神经推理式知识库问答方法
    陈子阳, 廖劲智, 赵翔, 陈盈果
    知识库(或知识图谱)作为一种对现实世界的有效表征模式,引起了学术界和工业界广泛关注。近年来,随着大规模知识库的出现,知识库问答技术作为知识库的基础应用技术同样备受关注。基于语义解析的代表方法通过对查询句的解析将问题转化为图上的答案检索,但知识库中往往存在缺失的链接,导致上述过程无法顺利开展;基于神经推理的代表模型通过对问题进行编码来进行实体相似度排序,但其无法解决动态场景下的实体冷启动问题。针对上述问题,提出了一种融合子图结构的神经推理式知识库问答方法,实现了在问答推理过程中兼顾实体的语义与结构信息,从而进行更充分的推理。首先,通过预训练模型RoBERTa将问句转换为包含语义的向量;其次,根据问句中的实体构建相应的问答子图,并利用图神经网络提取子图的结构信息;再次,基于背景知识库进行实体表示预训练,并与对应的结构表示进行融合;最后,根据融合后的向量对候选答案进行评分,将评分最高的实体作为答案。在WebQuestionsSP数据集上进行了对比测试,实验结果表明,提出的模型优于其他基准模型。
  • 基于问句感知图卷积的教育知识库问答方法
    蔺奇卡, 张玲玲, 刘均, 赵天哲
    近年来,随着教育信息化的不断深入,海量教育资源和教学数据不断累积,一些教育知识库被提出,这为数据驱动的智慧教育提供了良好的发展条件。基于教育知识库的问答方法能够为学习者提供即时的答疑辅导,进而有效提升学习者的学习兴趣和效率。然而,目前特定于教育领域的知识库问答研究较少,且开放领域的知识库问答方法大多独立地建模问句和候选答案实体,因而建模效果有限。基于此,提出一种基于问句感知图卷积网络的教育知识库问答方法。首先,针对特定问句,提取其中的问句描述信息和查询实体集,并分别通过Transformer和预训练的知识库嵌入进行处理得到两者的表示;其次,根据查询实体集从知识库中抽取候选答案集的子图,并通过双注意力的图卷积神经网络更新节点信息,其中注意力的得分分别利用问句描述信息和查询实体集的表示,进而实现问句感知;最后,融合问句描述信息、查询实体集和候选实体表示来计算得分,并预测答案。在真实数据集MOOC Q&A上进行实验,采用预测准确率和平均倒数排名的指标进行评估,实验结果表明提出的方法优于基准模型。
  • 自然反向最近邻优化的密度峰值聚类算法
    刘娟, 万静
    密度峰值聚类算法是一种基于密度的聚类算法。针对密度峰值聚类算法存在的参数敏感和对复杂流形数据得到的聚类结果较差的缺陷,提出一种新的密度峰值聚类算法,该算法基于自然反向最近邻结构。首先,该算法引入反向最近邻计算数据对象的局部密度;其次,通过代表点和密度相结合的方式选取初始聚类中心;然后,应用密度自适应距离计算初始聚类中心之间的距离,利用基于反向最近邻计算出的局部密度和密度自适应距离在初始聚类中心上构建决策图,并通过决策图选择最终的聚类中心;最后,将剩余的数据对象分配到距离其最近的初始聚类中心所在的簇中。实验结果表明,该算法在合成数据集和UCI真实数据集上与实验对比算法相比较,具有较好的聚类效果和准确性,并且在处理复杂流形数据上的优越性较强。
  • 带有可信度标记的增量式数据修复方法研究
    黄慧, 李海林
    大数据时代,数据蕴含着巨大价值,成为当今信息社会的重要战略资源。然而,在对数据进行加工、处理的过程中,产生了大量不一致数据,对企业决策造成了不可预知的恶劣影响。现有的工作主要基于函数依赖研究数据修复技术,已有的修复方法分为三类:前两类需要企业提供Master数据库或给定元组的可信度值,然而在实际应用中,这样的条件未必能满足;而第三类基于最少删除原则的修复方法又会造成信息的丢失。同时,当函数依赖[X→Y]存在冲突时,现有的方法仅支持修改Y属性值。针对以上不足,在没有给定元组可信度的情形下,提出了带有可信度标记的增量式数据修复方法,方法分为两部分:第一部分为通过分析操作日志和知识规则,自动生成单元格的可信度标记;第二部分包含增量式修复策略,依据可信度标记值,确定修复[X]或[Y]属性值,同时结合条件概率来选取目标值进行修复。实验结果表明,所提的修复方法具有较高的可靠性和扩展性。
  • 标准模型下前向安全的格基有序聚合签名
    谢佳, 胡予濮, 高军涛, 王保仓, 江明明
    在前向安全有序聚合(FssAgg)签名系统中,签名人以分层的“洋葱式”的方式,将不同时段不同密钥下的签名逐步有序地聚合成一个签名。其中,最内层的签名是第一个签名。另外,与普通的有序聚合签名相比,前向安全有序聚合签名是对同一个签名人不同签名的聚合,而非对不同签名人签名的聚合,因而签名验证者使用一个公钥即可完成对所有聚合过程的验证。前向安全的有序聚合签名兼具前向安全签名和聚合签名的优点,自2007年提出以来,已被广泛应用于日志系统、区块链等众多应用场景中。目前现存的几个前向安全的有序聚合签名都是基于传统数论问题的,而这一问题在后量子时代将会变得不再困难。因而,寻找量子计算环境下前向安全的有序聚合签名已迫在眉睫。基于格上的小整数解问题,构造了标准模型下前向安全的格基有序聚合签名方案。为达到高效率目的,方案借助于固定维数格基委派技术实现密钥更新,达到前向安全性;随后通过消息添加技术和原像采样算法分别将待签消息和格上困难问题嵌入到签名中,使得签名在标准模型下是不可伪造的。
  • 区块链应用下的新型区块链布隆过滤器
    樊星, 牛保宁
    布隆过滤器(BF)可以高效查询元素是否在指定集合中,广泛应用于区块链成员查询中。针对现有的通用布隆过滤器无法充分利用区块链数据特性及通用设备计算资源的问题,提出一种新型区块链布隆过滤器(BBF)。首先,改进布隆过滤器数据结构,对BBF以组为单位进行细分,从而将元素的映射范围限制在一个组内,减少访存失败次数,提高访存效率。其次,利用区块链数据的特性,提出一种简化的三阶段哈希映射函数,减少计算开销。在此基础上,使用单指令多数据流(SIMD)技术实现元素插入和查询操作的并行处理,提高BBF构建及查询速度,最终实现区块链上数据的高效查询和分析。实验结果显示,BBF与BF、OMBF两个主流布隆过滤器相比,其正向查询时的成员查询速度分别提高4倍、3倍,性能提升显著。
  • 关键节点选择的快速图聚类算法
    尤坊州, 白亮
    在众多聚类算法中,谱聚类作为一种代表性的图聚类算法,由于其对复杂数据分布的适应性强、聚类效果好等优点而受到人们的广泛关注。然而,由于其高计算时间复杂度难以应用于处理大规模数据。为提高谱聚类算法在大规模数据集上的可用性,提出关键节点选择的快速图聚类算法。该算法包含三个重要步骤:第一,提出一种充分考虑抱团性和分离性的快速节点重要性评价方法;第二,选择关键节点代替原数据集构建二分图,通过奇异值分解获得数据的近似特征向量;第三,集成多次的近似特征向量,提高近似谱聚类结果的鲁棒性。该算法将时间复杂度由谱聚类原有的[O(n3)]降低到[O(t(n+2n2))],增强了其在大规模数据集上的可用性。通过该算法与其他七个具有代表性的谱聚类算法在五个Benchmark数据集上进行的实验分析,比较结果展示了该算法相比其他算法能够更加高效地识别数据中的复杂类结构。
  • 基于判别稀疏性表示的不完整多视图分类
    辛利柯, 杨琬琪, 杨明
    传统多视图学习通常假设样本在每个视图都是完整的,但是由于数据难以获取、设备故障、遮挡等因素,这一假设并不总能成立,而传统的多视图学习方法很难有效处理不完整多视图数据。目前,研究者们已经提出了一些不完整多视图学习的方法,但是这些方法没有充分利用样本类别信息,从而影响恢复后样本的判别性。因此,提出基于判别稀疏性表示的不完整多视图分类方法(IMVC-DSR)。具体地,该方法假设缺失样本可用少量观测样本稀疏线性表示。同时,为了充分利用类别先验信息,增加恢复后样本的判别性,该方法鼓励相同类别样本之间相互表示,降低不同类别样本之间的相互表达。此外,该方法考虑到视图之间的相关关系,引入选择算子选出不同视图的相同样本,并约束相同样本在不同视图的线性表达具有一致性。最后,在公开的五组数据集上验证了所提方法IMVC-DSR的有效性。
  • 基于集成学习的改进深度嵌入聚类算法
    黄宇翔, 黄栋, 王昌栋, 赖剑煌
    近年来深度学习的迅速发展为聚类研究提供了一个有力的工具,并衍生出了许多基于深度神经网络的聚类方法。在这些方法中,深度嵌入聚类(DEC)因其可对深度表示学习和聚类分配同时进行优化的优势而日益受到关注。但是,深度嵌入聚类的一个局限性在于其超参数λ的敏感性,而往往需要诉诸人工调节来解决。对此,提出一种基于集成学习的改进深度嵌入聚类(IDECEL)方法。相较于寻求单个最优超参数的常规做法,提出以多样化超参数λ构建一组具有差异性的基聚类,并结合熵理论对基聚类集合的簇不确定性进行评估与加权,进而在簇与样本之间构建一个局部加权二部图模型,再将之高效划分以得到一个更优聚类结果。在多个数据集上的实验结果表明,提出的IDECEL方法不仅可缓解常规DEC算法超参数敏感性的问题,同时也表现出比其他多个深度聚类和集成聚类方法更为鲁棒的聚类性能。
  • 外部信息引导和残差置乱的场景图生成方法
    田鑫, 季怡, 高海燕, 林欣, 刘纯平
    场景图因其具有的表示视觉场景内容的语义和组织结构的特点,有助于视觉理解和可解释推理,成为计算机视觉研究热点之一。但由于现存的视觉场景中目标和目标之间关系标注的不平衡,导致现有的场景图生成方法受到数据集偏置影响。对场景图数据失衡问题进行研究,提出一种基于外部信息引导和残差置乱相结合的场景图生成方法(EGRES),缓解数据集偏置对场景图生成的负面影响。该方法利用外部知识库中无偏置的常识性知识规范场景图的语义空间,缓解数据集中关系数据分布不平衡的问题,以提高场景图生成的泛化能力;利用残差置乱方式对视觉特征和提取的常识性知识进行融合,规范场景图生成网络。在VG数据集上的对比实验和消融实验证明,提出的方法可以有效改善场景图生成。对于数据集中不同标签的对比实验证明,提出的方法可以改善绝大多数关系类别的生成性能,尤其是中低频关系类别下的场景图生成性能,极大地改善了数据标注失衡的问题,比现有的场景图生成方法具有更好的生成效果。
  • 融合改进A*蚁群和滚动窗口法的平滑路径规划
    殷绍伟, 彭力, 戴菲菲
    针对蚁群算法应用于移动机器人路径规划时,出现的死锁、收敛慢、易陷入局部最优以及路径不平滑的问题,提出了一种融合改进A*蚁群算法与滚动窗口法的平滑路径规划方法。首先,用改进的A*算法初始化蚁群信息素,解决前期蚁群效率低的问题。然后,改进状态转移概率函数,在函数中考虑可行路径“活跃度”以及终点位置,避免死锁现象。同时,基于不平等原则机制更新蚁群的信息素,避免陷入局部最优路径,加快算法的收敛速度。其次,融合滚动窗口法,在全局路径规划的基础上,结合动态避障策略进行局部实时路径规划。最后,使用贝塞尔曲线对所规划出的路径进行平滑度处理,使平滑后的路径更加接近实际运动路径。为确保算法表现出最好的性能,利用带精英策略的遗传算法对该算法中的参数进行自主优化选择。三组实验结果表明,无论是简单还是复杂的静态或动态障碍物存在的环境中,该算法均有不错的效果。
  • 采用隐马尔科夫模型的蛋白质复合物识别研究
    李鹏, 罗爱静, 闵慧, 谭荪怡, 郭惠敏
    动态蛋白质网络的构建和复合物识别问题是生物信息学领域目前研究的热点。针对现有的算法在解决前述问题上的不足,提出了一种基于隐马尔科夫模型的蛋白质复合物识别算法(HMM-PC)。首先基于蛋白质的基因共表达特性构建初始蛋白质网络,然后利用蛋白质的共享功能注释、共享结构域和连接强度等信息来对网络进行加权,得到动态蛋白质网络。在此基础上,考虑前一时刻蛋白质网络拓扑结构信息对当前时刻蛋白质网络拓扑结构信息的影响,采用隐马尔科夫模型描述蛋白质复合物与网络个体间的相互关系,进而将动态蛋白质网络中的复合物识别问题建模为隐马尔科夫模型中的最优状态序列发现问题,并采用维特比算法识别得到蛋白质复合物。最后通过理论分析证明了所提算法的复杂度较低。采用DIP数据集和MIPS数据集中的酵母蛋白质网络作为测试对象,大量的仿真实验结果也表明,HMM-PC算法的鲁棒性较强,在查全率、查准率、F-measure和效率等方面的性能都要优于现有的复合物识别算法。
  • 基于McDiarmid界的概念漂移数据流分类算法
    梁斌, 李光辉
    数据流中的概念漂移会导致已有的分类模型性能显著下降。目前处理概念漂移的数据流分类算法大都只针对单一类型的概念漂移(如突变型、渐变型或重复型等),难以同时适应不同场景。为此,提出了一种新的适于多类型概念漂移的数据流分类算法。该算法通过双层窗口保存当前最新的分类结果,根据模糊集隶属度函数对窗口中数据分配权重并计算加权错误率,然后利用McDiarmid界分析当前窗口和过去窗口内错误率的差异[δ],根据[δ]是否具有显著性检测概念漂移。检测到漂移后,使用半参数对数似然算法检验当前概念是否为过去概念的重现,进而决定是否复用旧分类器。实验结果表明,与以往同类算法相比,所提算法在漂移检测延迟、误报率、分类准确率和运行时间等指标上均有一定优势。
  • 具脉冲出生和季节性捕杀的种群系统优化算法
    黄光球, 陆秋琴
    为了求解一些非线性优化问题,采用具有脉冲出生和季节性捕杀的种群动力学模型提出了一种新的群智能优化算法(PSO-IBSK)。在该算法中,假设某种群由具有幼年和成年两种阶段状态的若干个体组成,幼体是由成体脉冲产生的,经过一段时间后会变成为成体。为了提升种群的整体质量,需要季节性地对一些生长状况不良的成体进行捕杀。该算法中的出生算子和成长算子可分别实现成体向幼体瞬时和延迟传递信息,有助于搜索跳出局部最优解陷阱;捕杀算子可周期性地将不良成体清除,死亡算子可将虚弱个体随机清除,该两个算子有利于提升算法的求精能力;强势算子可实现强壮个体向虚弱个体扩散强壮信息,竞争算子可实现幼年和成体之间的有效信息交换,该两个算子有利于提升算法的探索能力;进化算子可确保算法具有全局收敛性。该算法的大部分参数采用该种群动力学模型确定,具有很好的科学性;该算法每次只处理个体特征数的6‰~8%,从而使时间复杂度大幅降低。测试结果表明,该算法具有较优越的性能,适于求解维数较高的优化问题。
  • 面向申威众核处理器的并行SaNSDE算法
    康上, 钱雪忠, 甘霖
    演化算法作为解决大规模优化问题的重要方法,被广泛应用于机器学习、过程控制、工程优化、管理科学和社会科学等领域。然而在求解高维度、高计算密度问题时,程序性能很难得到保证。在高性能计算机上实现并行化是问题的一个热门解决方案。针对申威众核处理器的硬件特征,提出了采用二级并行策略的自适应邻域搜索的差分进化算法(SaNSDE)。第一级为进程并行,实现了合作协同进化模型和池模型,将大规模问题划分为多个低维子问题并分布在不同进程上;第二级为线程并行,使用从核加速了适应度的计算过程。实验结果表明,采用合作协同进化模型和池模型的算法与传统的并行算法相比,经过多核扩展之后收敛效果提升更加明显。相较于串行版本算法,二级并行的SaNSDE算法在四个测试函数上分别获得了134.29、186.05、239.01和189.80的最大加速比。
计算机科学与探索封面

中文名称:计算机科学与探索

杂志社官网:http://fcst.ceaj.org/

英文名称:Journal of Frontiers of Computer Science and Technology

语言:中文

类别:自动化技术、计算机技术

主 编:周志华

创刊时间:2007

出版周期:月刊

国内刊号:11-5602/TP

国际刊号:1673-9418

出版地:北京市

咨询工作人员

联系我们

  • 地址:北京市海淀区北四环中路211号
  • 电话:(010)89056056
  • E-mail:fcst@vip.163.com