计算机科学与探索杂志

计算机科学与探索杂志2021年第8期

  • 自然语言处理预训练技术综述
    陈德光, 马金林, 马自萍, 周洁
    在目前已发表的自然语言处理预训练技术综述中,大多数文章仅介绍神经网络预训练技术或者极简单介绍传统预训练技术,存在人为割裂自然语言预训练发展历程。为此,以自然语言预训练发展历程为主线,从以下四方面展开工作:首先,依据预训练技术更新路线,介绍了传统自然语言预训练技术与神经网络预训练技术,并对相关技术特点进行分析、比较,从中归纳出自然语言处理技术的发展脉络与趋势;其次,主要从两方面介绍了基于BERT改进的自然语言处理模型,并对这些模型从预训练机制、优缺点、性能等方面进行总结;再者,对自然语言处理的主要应用领域发展进行了介绍,并阐述了自然语言处理目前面临的挑战与相应解决办法;最后,总结工作,预测了自然语言处理的未来发展方向。旨在帮助科研工作者更全面地了解自然语言预训练技术发展历程,继而为新模型、新预训练方法的提出提供一定思路。
  • 跨模态检索研究文献综述
    陈宁, 段友祥, 孙歧峰
    随着互联网技术的蓬勃发展和智能设备的普及,多媒体数据在数量爆炸式增长的同时,其形态也越来越多样化。人们获取信息的需求已经不满足于单一模态的数据检索,通过不同模态的知识协同实现跨模态的检索成为近几年研究的热点。在深入了解分析跨模态检索研究背景和研究进展的基础上,以跨模态检索的关键技术——公共子空间建模为主线,对跨模态检索技术的三大类方法传统统计分析方法、深度学习方法与哈希学习方法,从不同角度对研究内容、关键技术、局限性、适用性和特点等方面进行了全方位、多角度的对比分析,并进行了实验以更深入地对比。最后,对跨模态检索有待解决的难点、未来的探索方向、近些年主流设计思路以及发展趋势进行了充分展望,为进一步研究提供理论基础。
  • BERT跨语言词向量学习研究
    王玉荣, 林民, 李艳玲
    随着互联网多语言信息的发展,如何有效地表示不同语言所含的信息已成为自然语言信息处理的一个重要子任务,因而跨语言词向量成为当下研究的热点。跨语言词向量借助迁移学习将单语词向量映射到一个共享的低维空间,在不同语言间进行语法、语义和结构特征的迁移,能够对跨语言语义信息进行建模。BERT模型通过大量语料的训练,得到一种通用的词向量,同时根据具体的下游任务进一步动态优化,生成上下文语境敏感的动态词向量,解决了以往模型的聚义问题。通过对现有基于BERT的跨语言词向量研究的文献回顾,综合阐述了基于BERT的跨语言词向量学习方法、模型、技术的发展,以及所需的训练数据。根据训练方法的不同,分为有监督学习和无监督学习两类,并对两类方法的代表性研究进行详细的对比和总结。最后概述了跨语言词向量的评估方法,并以构建基于BERT的蒙汉文跨语言词向量进行展望。
  • 图像去噪方法概述
    刘利平, 乔乐乐, 蒋柳成
    在现实场景中,由于设备和系统不完善或存在弱光环境导致采集的图像存在噪声,图像在压缩和传输过程中也会受到额外噪声的影响,给后续的图像分割、特征提取等处理造成干扰。传统去噪方法利用图像的非局部自相似性(NLSS)特性和变换域中的稀疏表示,基于块匹配和三维滤波(BM3D)的方法展现出了强大的图像去噪性能。随着人工智能的发展,基于深度学习的图像去噪方法取得了较为突出的表现。但是到目前为止几乎没有相关研究对图像去噪的方法进行全面的比较。针对传统的图像去噪方法及近年来兴起的基于深度神经网络的图像去噪方法,首先介绍了经典的传统去噪和深度神经网络去噪方法的基本框架,并对去噪方法进行了分类总结。然后在公共去噪数据集上对现有的去噪方法进行了定量和定性方面的分析比较。最后在图像去噪领域指出了一些潜在的挑战和未来研究的方向。
  • 融合知识图谱和深度学习方法的问诊推荐系统
    武家伟, 孙艳春
    近年来,随着互联网的普及和大数据分析等技术的发展,人们对移动医疗服务的需求越来越迫切,具体表现为根据症状确定自己患有的疾病以及根据疾病选择服务质量较好的医院及医生。为了解决上述问题,基于知识图谱和深度学习技术设计并实现了一种问诊推荐系统。基于互联网开放的医疗数据,构建了“疾病-症状”知识图谱,帮助用户根据症状自查,并以知识图谱嵌入模型训练知识图谱中实体的嵌入向量表示,根据向量的欧式距离相似度选取最相近的疾病实体丰富推荐选项,两者结合实现疾病诊断服务。同时,基于社交媒体的评论数据,结合现有的医疗服务质量评价指标,使用了深度学习的分析方法,自动给出医生的服务质量多维度的评分,为用户提供医生医院推荐服务。最后,通过构建测试集以及设计调查问卷等方式,验证了疾病诊断服务和医生医院推荐服务的准确率分别达到了74.00%和90.91%。
  • 网络形式背景下的社区划分方法研究
    刘文星, 范敏, 李金海
    网络社区划分是从社会网络中进行概念认知、模式学习的基础,也是网络背景下机器学习研究的热点问题。为了充分发挥形式概念和网络特征值的双重优势,基于网络形式背景研究网络社区划分问题。首先,将网络结构与节点属性信息相结合给出了网络节点中心度和中心势,使得网络形式背景的网络社区划分综合考虑了网络结构和节点内涵两方面的特征;其次,提出了网络形式背景的网络社区概念,该概念不仅给出了传统形式背景的形式概念,还包含了概念的网络特征值,可以描述该概念在网络中的平均重要度和平均重要度势差;然后,考虑到社会网络划分中多角色与网络有向性的特点,又将有向网络分为单角色网络和双角色网络,运用网络结构与节点属性信息相结合的方法提出了两种网络社区划分算法,并分析了算法的时间复杂度;最后,通过实例说明了上述网络社区划分算法的有效性。所得结论为网络数据挖掘和网络概念认知的进一步研究提供了参考。
  • 基于DT及PCA的DNN入侵检测模型
    武晓栋, 刘敬浩, 金杰, 毛思平
    当今入侵检测领域作为一个重要领域,虚警率高、检测率低、处理速度慢、特征维度高等问题正困扰着从事这一领域的专家学者。为了解决这些问题,提出基于决策树(DT)与深度神经网络(DNN)以及主成分分析(PCA)的入侵检测模型DT-PCA-DNN,在相对高的检测率和相对低的虚警率的基础上提高入侵检测系统(IDS)的处理速度。为缩小整体数据量达到加快处理速度的目的,首先利用DT对数据初步判别。将DT判别为入侵的数据,存入临时训练样本集以再训练优化DT以及DNN,而DT判别为正常的数据,删除所添加正常标签后用PCA降低数据维度并送入DNN进行二次判别以得出最终结果。DT使用浅层结构以防止过多正常数据被判定为入侵数据,导致后续DNN二次处理时不能有效提高整体准确率。DNN采用简化神经网络计算过程的ReLU激活函数以及收敛速度更快的adam优化算法以加快数据处理速度。经过在NSL-KDD数据集上的二分类及五分类实验验证,相比于其他的应用深度学习的入侵检测方法,所提出模型能够在实现相对高的检测率的同时具有更加迅速的检测速度,有效解决了入侵检测的实时性问题。
  • 面向网络文本的BERT心理特质预测研究
    张晗, 贾甜远, 骆方, 张生, 邬霞
    随着互联网的普及应用,通过网络平台进行表达和交流的用户越来越多,在此过程中不可避免地会留下与个人相关的大量网络文本数据和信息,这些非结构化的文本数据往往体现着不同场景下的真实表达,反映了人们内在的心理特质及人格倾向。利用文本挖掘相关技术基于网络文本数据分析心理特质可以弥补传统心理测量方法易受应试动机等因素影响的缺陷。近年来,BERT语言表示模型在文本分类、情感分析等任务上取得了很好的效果。针对网络文本数据构建心理特质预测模型,基于BERT获取完整的上下文语义特征和长距离的上下文依赖关系;同时考虑到分类器内部结构的差异可能会导致不同的分类效果,在下游分类任务中分别采用BERTBASE模型的全连接层和经典的随机森林算法作为两种不同的分类器进行模型效果对比。结果显示,基于BERT的文本分类模型能够有效实现心理特质的预测, 平均准确率、平均精准率等各项指标都在97%以上。
  • 深度语义分割人群密度检测技术
    马煜, 杜慧敏, 毛智礼, 张霞
    随着社会的发展,人们大量外出导致拥挤场景越来越多,对人群密度的检测就显得尤为重要。针对人群中由于摄像机视角引起的人与人尺度不一的多尺度问题,提出了一种基于深度语义分割的人群密度检测方法。网络前端采用改进的VGG网络对人群特征进行提取,使输出的特征图为原图1/8以提高预测密度图的准确性,后端设计了两阵列扩张率不同的空洞卷积模块来捕捉人群的多尺度特征,使得网络能够捕捉更多的尺度细节及边缘信息。网络最后使用1×1的卷积对输出进行级联,得到高质量预测密度图。同时,为解决空洞卷积带来栅格效应,设计了锯齿状网络结构,使补零后的卷积操作中每一个像素都进行计算来保证信息的连续性,以此来提高网络的准确性。分别在ShanghaiTech和UCF_CC_50数据集上对网络性能进行了测试,测试结果优于目前主流的人群密度检测方法,测试所得的MAE值相较于MCNN网络提高了42.4%和38.1%,相较于SANet网络提高了5.3%和9.6%。
  • 利用收益预测与策略梯度两阶段众包评论集成
    荣欢, 马廷淮
    近年来随着互联网的飞速发展,人们频繁地在网络上发布关于某一特定对象的评论内容,快速掌握众包评论文本的关键信息对决策制定、服务调整有着重要作用,对众包评论文本集成进行深入研究亦显得十分必要。众包评论文本集成旨在将不同评论者对同一对象的评论内容以既定压缩率整合成较短的集成文本,从而根据大众认知形成关于特定对象较为匹配的内容描述。针对该问题提出了一种利用收益预测与策略梯度的两阶段众包评论集成方法。该方法不依赖于任何人工真值,仅提供源众包评论文档,由代理根据收益经验自行抽取关键语句形成众包评论集成文档。具体而言,第一阶段以语句相关性与冗余性衡量集成文档内容质量,以此作为收益,利用Q-值学习预测出从当前语句选择起直至评论集成结束时所产生的长期收益,由此指导代理学习最优语句选择策略;在此基础上,第二阶段以集成文档情感强度为收益,利用策略梯度(上升)进一步调整第一阶段代理习得的语句选择策略,使得代理所产生集成文本在具备一定内容质量同时,从客观角度突显文本情感强度,更明确反映出评论者所持有的情感态度。实验结果表明,与现有相关方法相比,所提出方法在评论文本集成内容质量与情感强度方面总体取得最优,且产生集成文档所耗费时长仍控制在可接受范围之内。
  • 基于二阶[k]近邻的密度峰值聚类算法研究
    王大刚, 丁世飞, 钟锦
    密度峰值聚类(DPC)是近年来提出的一种新的密度聚类算法,算法的核心是基于局部密度和相对距离,通过画出决策图,人为选定聚类中心,进而完成聚类。DPC算法利用截断距离计算局部密度,本质上只考虑了周围近邻节点的数量,且算法采用单步分配策略,一定程度上限制了算法对任意数据集的计算精度和有效性。针对上述问题,提出基于二阶[k]近邻的密度峰值聚类算法(SODPC)。算法通过引入节点的二阶[k]近邻,计算直接密度和间接密度,重新定义局部密度的计算方式。在此基础上,定义非中心节点的多步骤分配策略完成聚类。通过人工和真实数据的测试,证明了该算法对不规则、密度不均匀的数据集具有较好的聚类效果。
  • 粗-细两阶段卷积神经网络算法
    张梦倩, 张莉
    在医学上,人上皮2型(HEp-2)细胞的间接免疫荧光检测在自身免疫性疾病的诊断中起着决定性的作用,而自身免疫性疾病的诊断,往往受到人力物力的限制。鉴于神经网络在图像分类任务中的优异性能,提出了一种基于聚类算法的粗-细两阶段卷积神经网络算法(CTFTCNN),并应用到HEp-2细胞分类中。在所提出的方法中,有两种类型的分类任务:粗粒度分类和细粒度分类。粗粒度分类是指,采用聚类算法从原始数据集中生成一个粗粒度数据集,用多尺度卷积神经网络(MSCNN)去处理该粗粒度数据集。然后在一定条件下进行细粒度分类。在细粒度分类时,仅对在粗粒度分类中至少包含了两个细类的粗类进行处理,且采用VGG16网络对每个这样的粗类进行细分。最后集成粗粒度网络和细粒度网络的结果。具体地,对于至少包含了两个细类的粗类,将粗粒度和细粒度网络中提取的特征融合起来决定最终的预测结果。在真实数据集上进行实验以评估所提出的模型。实验结果表明:与目前最先进的方法相比,该模型具有良好的应用前景。
  • 基于动态重组和协同交流策略的蚁群优化算法
    刘一凡, 游晓明, 刘升
    针对传统蚁群算法在解决旅行商问题(TSP)时所存在的收敛速度慢、易陷入局部最优等问题,提出了基于动态重组和协同交流策略的蚁群优化算法(RCACO)。首先,将蚁群划分为贪婪蚁群和探索蚁群,两类蚁群执行不同的路径构建规则和信息素更新策略,以平衡算法的收敛速度和多样性。其次,采用一种基于线索二叉树的新型动态重组算子,并根据不同的重组策略对解集进行有导向性的动态重组,以提升算法的多样性。进一步,提出一种基于相似度和潜力值的协同交流策略,从全局的角度出发,找到最有潜力成为最优解的路径,并对这些路径给予信息素奖励,以提升算法的收敛速度。最后,算法还加入了停滞规避策略,以帮助蚁群跳出局部最优,提升算法的求解精度。通过Matlab对TSPLIB中的多组案例进行仿真实验,与传统蚁群算法和其他优化算法进行对比分析,仿真结果表明,改进的蚁群算法显著提高了收敛速度和求解精度。
  • 融减自动编码器
    孙宇, 魏本征, 刘川, 张魁星, 丛金玉
    自动编码器(AE)是深度学习领域中一种结构简单且应用广泛的无监督特征提取算法。在图像特征提取方面,现有自动编码器普遍存在特征提取不充分、模型参数量较多等问题。针对上述问题,提出了一种用于图像特征提取的融减自动编码器(MRAE)。首先,在该算法中提出“融减网络结构”,该结构在编码器中通过特征交叉传递实现了特征融合,在解码器中通过优化解码结构降低了特征损失并减少了模型参数量;其次,设计一种联合重构损失函数,该函数通过计算特征层之间的重构损失,在加强特征层之间联系的同时可有效避免模型早熟。实验结果表明:在肺部CT图像数据集上,基于融减自动编码器所提取的特征使用支持向量机(SVM)、K-means和分类回归决策树(CART)等分类器,肺炎筛查准确率均在97%以上;在CvD数据集上,基于融减自动编码器所提取的特征使用全连接分类的准确率均在90%以上。
  • 模糊云资源调度问题的RIOPSO算法
    李成严, 宋月, 马金涛
    针对时间-成本约束下的云资源调度问题,使用三角模糊数表示不确定的任务执行时间,建立了模糊云资源调度模型,调度的目标是降低任务总的执行时间和总的成本消耗,决策变量是任务和虚拟机的映射关系。使用混合粒子群优化算法(RIOPSO)对模糊云资源调度进行求解。该算法使用了正交初始化粒子群的方法,提升粒子初始探索最优调度方案的质量,在粒子搜索过程中使用重新随机化控制粒子的搜索范围,使用实时更新惯性权重的方式控制粒子在搜索中的速度,从而得到最优的调度方案。在Cloudsim仿真平台上使用随机生成的仿真数据,对提出的问题模型和优化算法进行验证,证明了模型的可靠性,实验结果表明使用提出的优化算法,可以达到使云资源调度中总执行时间和总执行成本降低的目的,并且在收敛速度、求解能力方面具有良好的性能。
  • 视觉惯导SLAM初始化算法研究
    刘刚, 葛洪伟
    单目视觉系统融合惯性测量单元的同时定位与地图构建(SLAM)系统,能实现在使用场景上的互补,以及较低的硬件成本,在实际工程应用中越来越受到青睐。最近的研究表明,基于优化的SLAM算法性能优于基于滤波的SLAM算法。基于优化的视觉惯导融合SLAM算法具有高度非线性化的特点,其性能高度依赖于系统初始状态估计的准确性;惯性测量单元需要加速度激励,这意味着不能从静止状态启动,而必须从未知的运动状态启动,因此如何确定这一未知的初始状态显得尤为重要。综上可知,对初始状态准确的估计是SLAM算法具有高精确鲁棒性的关键,也是视觉惯性融合算法的第一步。通过对惯性测量单元预积分算法的分析,推导出一种凸优化的初始化估计系统。在综合考虑了重力加速度的约束条件下,对各初始状态进行联合求解。更重要的是,提出了一种新颖的方法,即通过费歇尔信息衡量估计效果的好坏来确定初始化算法的终止条件,提高算法精确度的同时也缩短了初始化的时间。在Euroc数据集上的实验表明,该算法具有更高精确鲁棒的初始状态。
  • 面向连续参数的多粒度属性约简方法研究
    吴将, 宋晶晶, 程富豪, 王平心, 杨习贝
    作为度量粒化程度的方式,在粒计算研究领域中,粒度受到了众多学者的广泛关注,其中一种重要且广为接受的模式是参数化粒度。利用这种参数化的粒度表现形式,在面向属性约简的求解问题时,往往需要计算每一个参数所对应的粒度下约简,直至找出所有参数下的约简结果。显然,这种方式会带来巨大的时间消耗。为解决这一问题,提出了一种连续参数意义下的多粒度属性约简策略:首先利用连续参数的区间及粗糙集中不确定性度量的单调性,构造了连续参数下属性约简的约束条件;其次设计了连续参数意义下约简求解的前向贪心搜索算法;最后选取了8组UCI数据集进行实验对比分析,结果表明,相较于多个离散参数下的单粒度属性约简,连续参数意义下的属性约简可以在使得约简中属性的分类性能不发生显著变化的情况下,极大地提升约简求解的时间性能。这一研究为从连续视角进行多粒度建模及相关属性选择工作提供了新的解决方案。
计算机科学与探索封面

中文名称:计算机科学与探索

杂志社官网:http://fcst.ceaj.org/

英文名称:Journal of Frontiers of Computer Science and Technology

语言:中文

类别:自动化技术、计算机技术

主 编:周志华

创刊时间:2007

出版周期:月刊

国内刊号:11-5602/TP

国际刊号:1673-9418

出版地:北京市

咨询工作人员

联系我们

  • 地址:北京市海淀区北四环中路211号
  • 电话:(010)89056056
  • E-mail:fcst@vip.163.com