计算机科学与探索杂志

计算机科学与探索杂志2021年第2期

  • 时间序列特征表示与相似性度量研究综述
    孙冬璞, 曲丽
    时间序列是将同一指标的数值按照时间的先后顺序排列组成的一组随机数列。随着科学技术的蓬勃发展,时间序列在数据挖掘领域中的应用变得越来越广泛。综合分析了近年来时间序列在数据挖掘领域的文献成果,对时间序列特征表示和相似性度量方法进行了阐述。针对时间序列特征表示方法,从非数据适应性方法、数据自适应性方法、基于模型的方法三方面进行说明,对各种主要方法的研究现状、优缺点、适用领域、方法特性以及局限性等进行了比较分析。针对时间序列的相似性度量方法,从基于形状的相似性度量方法、基于模型的相似性度量方法和基于数据压缩的相似性度量方法三方面进行系统描述,对各种主要方法的优缺点、适用领域等进行介绍,并从是否支持非等长时间序列之间的比较、是否支持平移、是否支持三角不等式等方面进行了比较分析。最后,对时间序列的未来研究方向进行了展望。
  • 命名实体识别的迁移学习研究综述
    李猛, 李艳玲, 林民
    命名实体识别(NER)是自然语言处理的核心应用任务之一。传统和深度命名实体识别方法严重依赖于大量具有相同分布的标注训练数据,模型可移植性差。然而在实际应用中数据往往都是小数据、个性化数据, 收集足够的训练数据是非常困难的。在命名实体识别中引入迁移学习,利用源域数据和模型完成目标域任务模型构建,提高目标领域的标注数据量和降低目标域模型对标注数据数量的需求,在处理资源匮乏命名实体识别任务上,具有非常好的效果。首先对命名实体识别方法和难点以及迁移学习方法进行概述;然后对近些年应用于命名实体识别的迁移学习方法,包括基于数据迁移学习、基于模型迁移学习和对抗迁移学习,进行全面综述,重点阐述了对抗迁移学习方法;最后进一步思考当前存在的问题并对未来的研究方向进行了展望。
  • 基于深度学习的显著性目标检测综述
    史彩娟, 张卫明, 陈厚儒, 葛录录
    随着深度学习的不断发展,基于深度学习的显著性目标检测已经成为计算机视觉领域的一个研究热点。首先对现有的基于深度学习的显著性目标检测算法分别从边界/语义增强、全局/局部结合和辅助网络三个角度进行了分类介绍并给出了显著性图,同时对三种类型方法进行了定性分析比较;然后简单介绍了基于深度学习的显著性目标检测常用的数据集和评估准则;接着对所提基于深度学习的显著性目标检测方法在多个数据集上进行了性能比较,包括定量比较、P-R曲线和视觉比较;最后指出现有基于深度学习的显著性目标检测方法在复杂背景、小目标、实时性检测等方面的不足,并对基于深度学习的显著性目标检测的未来发展方向,如复杂背景、实时、小目标、弱监督等显著性目标检测进行了探讨。
  • 支持隐私保护的社交网络信息传播方法
    高昂, 梁英, 谢小杰, 王梓森, 李锦涛
    社交网络影响力传播重点关注如何使用少量的种子集合在社交网络中产生尽可能高的影响力,并将转发作为信息传播的唯一方式,忽略了其他传播方式,例如用户可通过发布一条与所见信息内容相似的信息来进行传播,这种传播方式(称为转述)因为难以追踪,所以存在隐私泄漏的风险。针对上述问题,定义了一种支持转述关系的社交网络信息传播模型,提出了一种支持用户隐私保护的信息传播方法LocalGreedy,确保用户发送的信息不泄漏到指定黑名单的同时,最大化传播产生的影响力,平衡了隐私保护和信息传播的矛盾。针对种子集合选取的枚举问题,提出了支持隐私保护的递增策略构造种子集合,减少时间开销;给出了计算节点的局部影响子图方法,快速估计种子集合传播产生的影响力;为确保种子集合满足隐私保护约束限制,提出了推导节点泄漏态概率上限的方法,避免使用蒙特卡洛方法产生的时间开销。使用爬取的新浪微博数据集进行实验验证和实例分析,结果表明了所提方法的有效性。
  • 基于镜像层关联的Docker注册表缓存预取策略
    张晨, 邓玉辉
    随着容器技术的广泛普及,大型Docker公共注册表使用对象存储服务来解决镜像数量剧增的问题,但这种松耦合的注册表设计导致较高的延迟开销。为了增强注册表性能,提出一种基于镜像层关联的Docker注册表缓存预取策略LCPA,当注册表服务器缓存未命中时,通过分析镜像元数据文件构建镜像的存储结构,由关联度模型对存储结构计算得到相关镜像层集合,并从后端存储中主动式预取回注册表中以提高缓存命中率。经真实工作负载下收集的Docker数据集测试,实验结果表明LCPA策略比LRU、LIRS和GDFS等缓存算法提高12%~29%的平均缓存命中率,拉取镜像的平均延迟节省率提高了21.1%~49.4%。与现有的LPA预取算法相比,拉取镜像的平均缓存命中率提升25.6%。仿真实验表明该策略可以有效地利用缓存空间,大幅提升注册表的缓存命中率,并降低镜像拉取的延迟开销。
  • 数据中心网络中基于ELM的流簇大小推理机制
    叶进, 谢紫琪, 肖庆宇, 宋玲, 李晓欢
    近年来研究流簇(Coflow)为单位的调度策略成为改进数据中心网络的新热点。然而现有的信息未知流簇调度器难以快速地推理任务级信息,导致小任务不能被及时调度,以及平均任务完成时间无法最小化。因此数据中心网络需要更加高效的推理模型提升流簇大小判断的准确性和敏感性。提出了一种基于机器学习的流簇大小推理模型(MLcoflow),利用极限学习机(ELM)以最小训练误差为求解目标建立推理模型,并且使用不完全信息建模以提升敏感度。实验证明与其他算法相比,ELM方法的准确性评分平均高出19.8%,敏感度平均高出10.2%。通过仿真模拟对比了几种调度器,基于MLcoflow的调度器将平均任务完成时间降低了20.1%。
  • 面向Java EE程序的SQLIA漏洞分析和验证方法
    郭帆, 范威威
    SQLIA漏洞破坏Web后台数据库的完整性,一直是Web应用安全的主要威胁。提出一种检测和验证Java Web程序的SQLIA漏洞的解决方案,将静态分析与动态验证相结合,并且形式化定义指令级污点传播操作语义,能够有效跟踪跨文件和跨页面的污点传播。静态分析首先对Source进行预处理和分类得到真实可靠的Source集合,然后应用方法、请求、会话、方法调用等多重关系匹配潜在的Source和Sink对,使得分析过程可以过滤无关Source和Sink,最后结合静态污点分析和活跃变量分析排除不可能存在污点传播路径的Source和Sink。动态验证首先对程序插桩,然后在执行程序的同时进行动态污点传播并生成Trace,基于Trace验证静态分析结果的正确性,获得真实污点传播路径的漏洞集合。原型系统基于Soot框架实现,对若干开源程序的实验结果表明了方法的有效性。
  • 基于核诱导的不完整多视角聚类
    张炜, 邓赵红, 王士同
    随着技术的发展,数据往往具有来自不同源的多种形式,多视角聚类算法旨在利用不同源中的互补信息进行聚类。虽然目前多视角聚类算法已在各个领域取得较大发展和成功应用,但是多视角聚类算法仍然面临许多重要挑战,其中一个就是当多个视角的样本存在缺失时,如何充分挖掘数据信息以减少缺失样本带来的负面影响。针对此挑战,提出一种基于核诱导的不完整多视角聚类算法(KIMV)。该方法利用核方法和非负矩阵分解技术在核希尔伯特空间中对所有视角学习一个最优的共性矩阵,并通过视角自适应加权机制和图拉普拉斯正则化提高算法性能。在五个多视角数据集上的实验有效验证了KIMV的上述优势。
  • 融合词和文档嵌入的关键词抽取算法
    祖弦, 谢飞, 刘啸剑
    各类应用领域的文本数据日益增多,如何从这些海量数据中迅速准确地提取核心内容,已成为关键词抽取的主要任务。提出一种基于词和文档嵌入的关键词抽取方法,通过计算单词与文档在同一维度上的向量表示,得出每个单词与文档之间的语义相似度,将其作为无向图中每个单词节点的初始权重。接着使用带语义偏向的随机游走策略,计算出每个单词以及候选词的分值。最后选取得分较高的前[N]个候选词作为最终关键词。在公开数据集上的实验结果表明,该算法在准确率、召回率、[F]值上均超过现有的主流关键词抽取方法,极大提高了关键词自动抽取的效率。
  • 上下文感知与层级注意力网络的文档分类方法
    任建华, 李静, 孟祥福
    文档分类是自然语言处理(NLP)领域中的一个基本问题。近年来,尽管针对这一问题的层级注意力网络已经取得了进展,但由于每条句子被独立编码,使得模型中使用的双向编码器仅能考虑到所编码句子的相邻句子,仍然集中于当前所编码的句子,并没有有效地将文档结构知识整合到体系结构中。针对此问题,提出一种上下文感知与层级注意力网络的文档分类方法(CAHAN)。该方法采用分层结构来表示文档的层次结构,使用注意力机制考虑文档中重要的句子和句子中重要的单词因素,在单词级和句子级不仅依赖双向编码器来获取上下文信息,还通过在单词级注意机制中引入上下文向量,使单词级编码器基于上下文信息做出注意决策全面获取文本的上下文信息,从而提取出深度文档特征。此外,还利用门控机制准确地决定应该考虑多少上下文信息。在两个标准数据集上的实验结果表明,提出的CAHAN模型较长短时记忆网络(LSTM)、卷积神经网络(CNN)、分层注意网络(HAN)等模型分类效果更好,能够提高文档分类任务的准确度。
  • 基于FPGA的油棕检测和硬件加速设计及实现
    袁鸣, 柴志雷, 甘霖
    针对深度学习在高分辨率遥感图像下棕榈树检测方面所面临的准确率不高和检测效率低下的问题,从算法优化和异构硬件平台加速两方面提出一种有效可靠的解决办法。以YOLOv3目标检测算法为例,采用扩大特征选择、加大多尺度特征融合的优化策略,提高了算法对高分辨率的棕榈树的检测准确度。在前向推理过程中,许多应用场景在要求模型高性能的同时往往会有严格的功耗限制。针对这个问题,采用权重整形8位量化和计算核心复用的优化策略,设计了一个基于SIMD的高效卷积计算引擎。此外,对输入模块进行了加速改进,通过对输入图片进行维度变化、向量化处理后,以写队列的方式传送给输入模块,提高了总线带宽的利用率。实验结果表明,经过算法优化后的模型准确率达到了97.84%,在基于Intel Arria10的异构硬件平台上可以获得1.4 TOPS性能,与i9-9980XE CPU相比,性能是它的7.51倍,能效是其33.02倍,与Nvidia推理端专用加速器P40比,能效是其1.2倍。
  • 基于深度学习的实时吸烟检测算法
    陈睿龙, 罗磊, 蔡志平, 马文涛
    在公共场所内吸烟,不仅对自身、他人身体健康造成潜在的危害,还存在造成火灾等现象的隐患。因此,出于健康和安全方面的考虑,为机场、加油站、化工仓库等严禁吸烟的场所,设计了一种基于深度学习的能快速发现和警告吸烟行为的检测模型。该模型使用卷积神经网络对摄像头所拍摄的视频流输入帧进行处理,经过图像特征提取、特征融合、目标分类以及目标定位等过程,定位烟头的位置,进而判断出吸烟行为。常见的目标检测算法针对小目标物体检测效果不甚理想,检测速度亦有待提高。通过设计的一系列卷积神经网络模块,不但减少了模型计算量,加快了推演速度,满足实时性要求,而且提高了小目标物体(烟头)检测准确率。此外,运用了一些模型训练的技巧,提升了模型的鲁棒性。由于缺乏现有数据集,自制了一个与吸烟行为相关的数据集。对比实验证明了提出的算法在本数据集以及一些公开数据集上有着更好的检测效果。
  • 复杂环境下基于边缘扩张的条形码定位方法
    艾达, 马宇豪, 刘颖, 郭建林, 周光军
    条形码识别技术已广泛应用于人们日常生活和工业生产中。针对基于图像处理的条形码定位和识别过程中会受到光照环境、画面内容、镜头对焦等因素的影响导致识别效果不理想的问题,提出了一种利用边缘特性对条形码图像进行扩张处理与判别的定位方法。首先使用改进的Sobel算子提取图像的边缘特征,对条形码边缘进行区域扩张处理,以增大连通性;然后应用图像中连通区域的形状特征对条形码区域进行判别;最后应用Radon变换对倾斜的条形码进行校正以利于条形码识别。实验结果显示,提出方法在公开数据集的对比实验中定位准确率有显著提升。在智能手机应用中,通过定位条形码区域,使得解码运算量降低,识别时间平均减少26.1%,较好地满足了实际应用的需求。
  • 感受野下的小目标检测算法
    陈灏然, 彭力
    早前提出的one-stage类算法SSD,在主干网络特征提取方面,经过3×3的卷积之后会造成计算通道数增多。同时,在SSD中这些被提取出的特征直接生成特征图并分别丢入预测模型中,导致层与层之间没有很好的信息交融。在现实的检测过程中,因为神经网络的主导为大型目标,常常会忽略相对于大型物体更容易被漏检的小型物体,导致小型被检测物的检测成功率较低。因此基于SSD进行研究,融入了一种基于特征融合的感受野模型Receptive Field Block。在特征提取的主干网络上,基于感受视野特征提取融入特征融合模块,以加强对小目标的检测效果。该改进算法框架在VOC公开数据集上的mAP为81.8%,在自制的针对小目标的航拍数据集上的mAP为82.8%,在牺牲了部分速度的情况下,在精度方面产生了较大的优势。
  • 种群具有离散Leslie年龄结构的动力学优化算法
    黄光球, 陆秋琴
    为了解决一些函数优化问题,采用种群具有Leslie年龄结构的动力学模型提出了一种新型群智能优化算法,简称PDO-DLAS算法。在该算法中,假设某种群由具有不同性别、不同年龄的生物个体组成,个体依据其性别和年龄被自动划分成若干类,增加了个体的多样性;每个算子具有明确功能,其中学习算子可实现性别不同但年龄相近个体之间的信息交换;影响算子可实现不同性别、不同年龄个体之间的信息交换;新生算子可增加强壮个体数,死亡算子可以减少虚弱个体数;进化算子可确保算法具有全局收敛性;依据Leslie模型确定该算法中的相关参数,提升了参数确定的科学性;该算法每次进化只处理个体特征数的1/250~1/10,从而使时间复杂度大幅降低。测试结果表明,该算法具有较优越的性能,适于求解维数较高的优化问题。
  • 极小负co-location模式及有效的挖掘算法
    王光耀, 王丽珍, 杨培忠, 陈红梅
    空间co-location(并置)模式是指实例在空间中频繁关联的一组空间特征的子集。在空间数据挖掘中,现有算法主要针对的是正模式的挖掘,而空间中还存在着具有强负相关性的模式,如负co-location模式,这类模式的挖掘在一些应用中同样具有重要的意义。现有的负co-location模式挖掘算法的时间复杂度较高,挖掘到的模式数量巨大。针对该问题,探索了负co-location模式的向上包含性质,提出了极小负co-location模式,证明了极小负co-location模式可推导出所有频繁负co-location模式。在负co-location模式挖掘中,计算模式的表实例是制约挖掘效率的根本因素,为此提出了3个剪枝策略有效地提高了算法的效率。在真实和合成数据集上的大量实验,验证了提出方法的正确性和高效性。特别地,大量实验结果表明极小负co-location模式可将频繁负co-location模式数量压缩80%以上。
  • 带有局部坐标约束的半监督概念分解算法
    李会荣, 张林, 赵鹏军, 李超
    概念分解(CF)算法是一种有效的图像表示算法,目前已经广泛应用于维数约简、特征提取、数据挖掘等机器学习领域中。然而,传统CF算法不能利用有效的标签信息,也不能学习数据的稀疏表示。为此,将局部坐标约束和数据有限的标签信息融入到CF模型中,提出了一种带有局部坐标约束的半监督的概念分解(SLCF)算法。SLCF算法利用局部坐标约束学习数据的稀疏性,数据标签约束矩阵能够保证同类标签的数据映射到低维空间中拥有相同的标签,从而提高了不同类间数据的识别能力。利用交替迭代更新方法对SLCF算法的模型进行求解,证明了算法的收敛性。在COIL20、Yale B以及MNIST数据库上的数值实验表明提出的SLCF算法是有效的,其聚类性能优于其他比较的算法。
计算机科学与探索封面

中文名称:计算机科学与探索

杂志社官网:http://fcst.ceaj.org/

英文名称:Journal of Frontiers of Computer Science and Technology

语言:中文

类别:自动化技术、计算机技术

主 编:周志华

创刊时间:2007

出版周期:月刊

国内刊号:11-5602/TP

国际刊号:1673-9418

出版地:北京市

咨询工作人员

联系我们

  • 地址:北京市海淀区北四环中路211号
  • 电话:(010)89056056
  • E-mail:fcst@vip.163.com