计算机科学与探索杂志2022年第6期
-
- 医学知识推理研究现状与发展
- 董文波, 孙仕亮, 殷敏智
- 知识图谱可以有效地组织和表示知识,被应用于很多高级应用中,比如智能医疗。然而,无论是人工还是自动化构建的医学知识图谱通常是不完整的,这严重限制了它们的使用性能。医学知识推理可以补全医学知识图谱,并可辅助医生进行医学诊断。首先给出了医学知识推理的基本概念和定义,然后对构建医学知识图谱的关键技术和基于医学知识推理的辅助诊断进行了总结与归纳,并重点回顾了医学知识推理研究现状,将其推理方法划分为基于逻辑规则的医学推理、基于表示学习的医学推理以及基于深度学习的医学推理。对于每一类别,分别介绍了代表性算法和最新研究进展。特点是在现有方法的基础上对基于医学知识图谱的推理技术进行了综合的介绍。最后总结了医学知识推理目前面对的一些挑战和重要问题,并展望了其发展前景和研究趋势,希望能促进这一快速发展领域的进一步研究。
-
- 区块链共识算法及应用研究
- 王群, 李馥娟, 倪雪莉, 夏玲玲, 王振力, 梁广俊
- 作为区块链核心技术的共识算法,为区块链的去中心化、开放自治、信息不可篡改、匿名溯源等功能的实现提供了机制支撑和保障,实现了分布式系统中强一致性和最终一致性的高效达成。以比特币出现为时间节点,将共识算法分为之前的经典分布式共识算法和之后的区块链共识算法,在此基础上根据算法的实现原理对共识算法又进一步分类,并选择其中的典型算法,重点从去中心化、可扩展性、安全性、一致性等方面进行了讨论。首先,提出了区块链共识算法的一般模型,给出了共识算法的基本定义。其次,在介绍经典分布式共识算法特点的同时,研究了两军问题、拜占庭将军问题、FLP不可能性定理、CAP定理和Paxos等分布式一致性算法及其改进,分析了算法的执行流程和功能特征。再次,对于区块链共识算法,根据实现原理和应用场景的不同,将其分为PoW共识算法、PoS共识算法、PoW+PoS混合共识算法和PoW/PoS+BFT/PBFT混合共识算法,在每一类中选择了具有代表性的算法后分别给出了算法流程,并结合具体应用场景进行了深入分析。最后,指出了区块链共识算法在性能与可扩展性、激励机制、安全与隐私、并行处理等方面的研究热点和发展方向。
-
- 深度学习应用于遮挡目标检测算法综述
- 孙方伟, 李承阳, 谢永强, 李忠博, 杨才东, 齐锦
- 遮挡目标检测长期以来是计算机视觉中的一个难点和研究热点。目前的深度学习基于卷积神经网络,将目标检测任务作为分类任务和回归任务来处理。当目标被遮挡时,遮挡物会混淆目标之间的特征,使得深度网络不能很好地识别和推理,降低检测器在理想场景下的性能。考虑到遮挡在现实中的普遍性,对遮挡目标的有效检测具有重要研究价值。为了进一步促进遮挡目标检测的发展,对基于深度学习的遮挡目标检测算法进行了全面总结,并对已有的遮挡检测算法进行归类、分析、比较。在对目标检测进行简单概述基础上,首先,对遮挡目标检测的相关背景、研究的难点以及遮挡数据集进行了介绍;然后,对遮挡检测优化算法主要按照目标结构、损失函数、非极大值抑制以及部分语义四方面进行归纳分析,在对各种算法之间的联系以及发展脉络进行阐述后,对各种算法性能进行了比较;最后,指出了遮挡目标检测仍面临的困难,并对遮挡目标检测未来的发展方向进行了展望。
-
- 基于图文融合的多模态舆情分析
- 刘颖, 王哲, 房杰, 朱婷鸽, 李琳娜, 刘继明
- 由于互联网以及移动手机的不断普及,人们逐渐进入到一个参与式的网络时代,越来越多的人们喜欢在网络上通过文本和图像的方式发布自己的观点、评论以及情感。对于这些文本和图像信息进行有效分析,不仅可以帮助企业更好地提高产品的质量,而且有利于为政府决策和社会生产生活提供指导。对基于多模态图文融合的网络舆情情感分析进行了综述。首先对舆情分析的基本概念进行了概括;其次对社交媒体上单模态的文本和视觉舆情情感分析的过程进行了说明;然后对基于图文融合的舆情分析算法进行了总结,并按照不同融合策略,将其分为特征层融合、决策层融合和线性回归模型;另外总结了针对社交媒体的多模态情感分析的常用数据集;最后讨论了网络舆情分析的难点以及未来研究方向。
-
- 深度半监督学习中伪标签方法综述
- 刘雅芬, 郑艺峰, 江铃燚, 李国和, 张文杰
- 随着智能技术的发展,深度学习已成为机器学习的研究热点,在各个领域发挥着越来越重要的作用。深度学习需要大量的标签数据用于提升模型性能。为了有效解决标签问题,研究人员将半监督学习与深度学习相结合。同时利用少量的标签数据和大量的无标签数据构建模型,有利于扩大样本空间。鉴于深度半监督学习的理论意义和实际应用价值,以深度半监督学习方法中的伪标签方法作为切入点进行分析。首先,对深度半监督学习进行介绍,指出伪标签方法优势所在;其次,从自训练和多视角训练角度出发对伪标签方法进行阐述,对已有的模型进行综合性分析;接着,重点介绍基于图和伪标签的标签传播方法,并对已有伪标签方法进行实验分析;最后,从无标签数据效用性、噪声数据、合理性和伪标签方法的结合上总结伪标签方法所面临的问题和未来研究方向。
-
- 程序能耗测量分析工具FPowerTool及其能耗优化实践
- 魏光, 钱德沛, 杨海龙, 栾钟治
- 能耗感知编程(EAP)是通过优化软件的能效来降低计算系统能耗的一种新途径。它把能耗作为主要指标引入软件开发的过程,通过调整代码的编写方式,降低程序的执行能耗。能耗感知编程的实现面临能耗热点发现、耗能原因确定和问题代码定位等问题。为了解决这些问题,提出了一种程序能耗与性能事件协同测量与分析的新方法EPC。首先,简要论述EPC的基本原理和基于该方法的程序能耗测量与分析工具FPowerTool的实现。然后,介绍如何对能耗和性能事件做关联分析,找出影响程序能耗的主要因素。最后,通过一组程序优化案例,说明如何通过关联分析定位与高能耗相关的程序代码,进而改变代码编写和数据放置与访问方式,使程序的执行能耗得到降低。实验结果表明,基于EPC方法提供的能耗感知和分析能力,通过改进数据定义、赋值、放置与访问方式等可以改善程序性能和能效。
-
- Cooley-Tukey FFT算法高性能实现与优化研究
- 郭金鑫, 张广婷, 张云泉, 陈泽华, 贾海鹏
- 快速傅里叶变换(FFT)算法是处理器基础软件生态的重要组成部分,在工程、科学、物理和数学等领域的应用十分广泛,且这些领域对FFT算法的性能也提出了越来越高的要求。研究FFT算法在ARMv8和X86-64上的高性能实现特别是大基高性能的实现,提高FFT算法的计算性能日益重要。针对ARMv8和X86-64计算平台的架构特征,研究FFT算法的高性能实现和优化方法。通过蝶形网络优化、大基网络级数降低、大基蝶形计算优化、SIMD汇编优化以及寄存器使用策略优化等方法的应用,有效提升了FFT算法的性能,特别是提升了FFT大基的计算性能,解决了寄存器不够用的性能瓶颈,并最终总结了一套Cooley-Tukey FFT算法的高性能实现策略和优化方案。实验结果表明,在ARM、X86-64处理器上,实现的FFT算法,较ARMPL、Intel MKL和FFTW性能有明显提升,较中小基性能也有明显提升。
-
- 基于割点的社交网络影响最大化问题
- 杨书新, 宋建缤, 梁文
- 影响最大化问题是社交网络分析中的重要问题,社交网络结构的多样化不断给影响最大化问题注入活力,让它在近二十年里经久不衰,一直是学术界的热门问题。针对已有影响最大化问题的研究,主要关注节点的特征,较少从社交网络的连通性角度来看待影响最大化问题。而割点作为连通分量间的桥梁,是连通性的核心。为此,综合考虑社交网络的节点特征和连通性,提出了基于割点的启发式算法来求解影响最大化问题。该算法用度和连通分量评估节点的影响力,在一定程度上解决了影响力重叠的问题。基于传染病模型,在四个开源数据集上进行了相关实验。在算法对比实验中,基于割点的影响最大化算法在运行时间、影响传播范围和种子富集性指标中表现优异,验证了算法的实用性和有效性。
-
- Paillier加密的隐私保护群智感知任务发布算法
- 田静, 杜云明, 李帅, 刘义
- 针对群智感知任务发布过程中,任务申请者、任务发布者以及授权机构可彼此获知位置隐私的问题,基于Paillier公钥密码系统的同态特性,提出了一种有效保障参与群智感知任务各实体间位置隐私的保护算法。该算法通过对可参与以及发布任务位置网格单元的密态环境的同态计算,完成对任务位置和响应位置的秘密匹配,从而实现位置隐私保护下的群智感知任务发布。最后,通过安全性分析,对所提出的任务发布方法从理论上加以分析证明,同时利用模拟环境的任务发布,对所提算法进行了实验验证,并在同条件下与同类算法进行比较,其结果进一步明确了所提算法的优势。
-
- 传播用户代表性特征学习的谣言检测方法
- 谢欣彤, 胡悦阳, 刘譞哲, 赵耀帅, 姜海鸥
- 谣言的及时发现和有效管控,是互联网+政务服务中公共舆情治理的重要组成部分。互联网和移动互联网的发展,提高了民众沟通交流的便利度,同时也加速了谣言的传播速度和广度,极大地提高了谣言的影响力和危害力,给民众的生产生活带来干扰,也严重影响社会秩序。现有的网络平台辟谣工作大多依赖于人工举报筛查,往往耗费大量的时间和精力。而利用数据挖掘、机器学习技术实现的谣言检测算法大多基于文本信息,常用于追溯性谣言检测,不适用于谣言扩散早期数据量不足的情况。首先收集最新的网络平台数据进行标注构造数据集Weibo2020,对其中用户特征分布进行统计分析并选择具有代表性的用户特征,进而提出了基于传播用户代表性特征学习的早期谣言检测方法(RPPC)。经实验验证,RPPC与同样基于传播路径的算法在同等条件下,在输入数据规模减少50%的同时,将准确率提高了2.57个百分点。此外,该方法能对5 min内发布的消息进行检测,快速发现互联网内容中的疑似谣言且准确率达到近80%。因此可以认为提出的方法在现有的数据集中有较好的表现,能够在一定程度上辅助政府部门的舆情治理工作,从而提高政务服务的时效及质量。
-
- 融合知识图谱与图卷积网络的混合推荐模型
- 郭晓旺, 夏鸿斌, 刘渊
- 针对当前多数基于知识图谱的推荐模型未能充分对用户特征建模,且未考虑知识图谱中实体间的邻域关系的问题,提出了一种融合知识图谱与图卷积网络的混合推荐模型(HKC)。首先,利用KGCN算法捕捉项目间的相关性,通过邻域聚合计算得到项目的特征向量;然后,通过协作传播提取知识图谱中与用户相联系的实体,使用交替学习的方式同时优化模型预测单元和知识图谱嵌入单元,通过交互单元计算得到用户的特征向量;最后,将用户特征向量和项目特征向量送入预测环节,通过向量的内积运算以及归一化操作计算用户与项目的交互概率。在三种公开数据集上与七个基线模型进行了对比实验,在MovieLens-1M数据集上,AUC提升了0.25%~37.41%,ACC提升了0.78%~49.44%;在Book-Crossing数据集上,AUC提升了0.04%~19.38%,ACC提升了6.49%~18.60%;在Last.FM数据集上,AUC提升了1.33%~33.50%,ACC提升了0.36%~30.66%。实验结果表明,提出的混合推荐模型与其他具有代表性的推荐模型相比具有良好的推荐性能。
-
- 基于知识图谱的双端邻居信息融合推荐算法
- 王宝亮, 潘文采
- 针对一些基于知识图谱的推荐算法仅聚合一端邻居而无法有效确定实体与用户之间关系的问题,提出了一种基于知识图谱的双端邻居聚合推荐算法,算法通过探究知识图谱的内在联系以发掘用户和物品之间的潜在关系。在用户端,提出了一种聚合用户邻居信息的方法,在知识图谱的关系空间下,使用知识图谱来传播和提取用户的潜在兴趣,通过迭代将潜在兴趣注入具有注意偏差的用户特征中生成用户嵌入表示向量;在物品端,将融合了用户邻居信息的用户向量送入KGCN模型,并在聚合物品和其邻居信息时,采用新的聚合方式,生成物品嵌入表示向量。最后,将得到的用户和物品向量送入预测环节,通过向量的内积运算并归一化得到用户和物品的关联分数,然后在训练集中进行训练,优化参数。在两个公开数据集上进行对比实验,在 Book-Crossing数据集上,相较于最优基线,AUC和ACC分别提升了1.72%和4.24%;在Last.FM数据集上,AUC和ACC分别提升了1.07%和1.14%,从而验证在聚合两端邻居信息后,算法的有效性得到了提升。
-
- 融入社会心理学理论的教与学优化算法
- 何佩苑, 刘勇
- 教与学优化算法(TLBO)是一种模拟教学过程的启发式优化算法。针对TLBO算法寻优精度低、稳定性差的特点,提出了基于社会心理学理论改进的教与学优化算法(SPTLBO)。该算法在改进中考虑了人的心理因素:在原TLBO算法的“教”阶段中结合社会心理学的“期望效应”理论,教师对高期望学生采取一对一教学策略,使得优秀学生更快向教师靠近;为了保留学生的多样性,学生依据认知风格可分为“场独立”与“场依存”两种类型,不同类型的学生将采取不同的交流方式进行学习;在“教”“学”阶段后,结合自我调节理论,学生进入学习方法调整阶段,从而增强了自我探索能力,提高学生整体水平。此外,引入自适应学生更新因子,模拟环境对学生学习效率的影响,增加算法的全局搜索能力,避免出现在初期迭代中陷入局部最优的情况。在25个标准测试函数上进行实验,结果表明SPTLBO算法相较基本TLBO算法和其他智能优化算法,在寻优精度和收敛速度方面都更具优势。
-
- 不平衡数据的Takagi-Sugeno-Kang模糊分类集成模型
- 张壮, 王士同
- 集成学习是非线性系统的主流建模方法之一。但当常规的集成TSK模糊模型直接用于不平衡数据集时,其学习性能容易受到数据不平衡性的影响,因而常常会导致泛化能力差。为解决这一问题,基于TSK模糊模型提出了一种对不平衡数据处理的分类集成模型。基本思想是:首先利用SMOTE过采样方法对不平衡样本集做预处理,使得类别分布相对平衡,再引入AdaBoost方法对集成TSK模糊模型进行学习,集成时根据权值大小对样本进行随机采样,并通过多次训练对权值进行迭代更新,最后将生成的各个模型结果根据特定的加权方法结合,产生最终输出,使各模型得到充分的训练,进而提升整个集成TSK模糊模型的泛化能力。由此,提出了对应的不平衡数据的集成TSK模糊模型,并使用模型在多个数据集上进行实验,采用均方误差和精度对模型进行评估均有较好的效果,然后改变模型数量和规则数量等参数探究它们对模型性能的影响,并使用图像表示它们的变化情况,实验结果证明了所提出的集成学习算法的有效性。
-
- 应用于非精确图匹配的改进DF模型
- 李智杰, 伊志林, 李昌华, 张颉
- 针对传统深度森林算法提取的特征不够完整,以及采取的等权决策机制对分类结果易产生差异性等问题,提出一种应用于非精确图匹配的改进DF模型(IDF)。首先,在挖掘特征子集的过程中,采取融合移动窗口和随机移动窗口的方式。在移动窗口扫描样本的同时,随机捕获一个与移动扫描窗口相同大小的特征子集,两者构成新的特征子集,从而将新特征子集作为级联森林模块的输入。其次,在级联森林的迭代过程中,计算当前森林的决策结果所占权重,并与上一级森林进行对比,采用Min的权值策略规则赋值给当前森林,逐次迭代直至结果满足模型所设定的阈值。最后,在MUTAG、PTC、COX2等数据集上进行了训练和测试。实验结果表明,相比于传统深度森林算法,IDF充分考虑了图的结构特征,能够有效增强样本的拟合优度及多样性,降低了级联模块中各子树的决策差异及模型的复杂度,有效提升了模型的分类识别率。
-
- 结合价格波动策略与动态回溯机制的蚁群算法
- 赵家波, 游晓明, 刘升
- 针对传统蚁群算法在旅行商问题(TSP)中易陷入局部最优、收敛速度较慢等问题,提出一种结合价格波动策略与动态回溯机制的蚁群算法。在价格波动策略中,结合时间序列思想将蚁群算法完整迭代周期进行分类,并根据价格波动平衡,将影响价格波动的供求关系进行匹配。通过分析算法在不同分类中的不同需求,对信息素挥发因子进行自适应动态供给,加快算法收敛速度的同时改善解的多样性。当价格波动策略的供给关系无法实现平衡时,算法将面临局部最优问题,此时引入动态回溯机制,以迭代最优蚂蚁的个体相似度作为标准,将路径信息素回溯至相似度差异显著的时期,在保证收敛速度的同时能够有效跳出局部最优。通过MATLAB对TSP中的不同测试集进行仿真,结果表明该算法在保证收敛速度的基础上,有效提高了解的质量,在中大规模城市集上较好地平衡了多样性与收敛速度的关系。
-
- 高帧率的轻量级孪生网络目标跟踪
- 李运寰, 闻继伟, 彭力
- 随着目标跟踪在众多生活场景的广泛运用,高精度且高速的跟踪算法需求也日益增多。针对某些特定场景如移动端、嵌入式等设备,在设备算力相对不足的前提下,仍要保证跟踪器达到良好的跟踪精度和高速实时跟踪问题,提出一种高帧率的轻量级孪生网络目标跟踪算法。首先,选取易于部署在嵌入式设备中的轻量级卷积神经网络MobileNetV1作为特征提取网络,深层网络具有对目标特征强大的提取能力;接着,针对主干网络的不足提出两点优化策略,特征图裁剪和网络总步长调整,使得主干网络适用于跟踪任务;最后,在孪生网络的模板分支后添加超轻量级通道注意力模块,加权突出目标特征的重要信息。对比当前主流算法SiamFC,该算法参数量减少59.8%;在OTB2015数据集上仿真实验表明,跟踪精度提升了5.4%,算法能更好地应对跟踪任务中复杂多变的挑战;在VOT2018数据集上的仿真实验表明,综合指标平均重叠期望(EAO)提升了26.6%,同时算法在NVIDIA GTX1080Ti下的平均速度为120 frame/s,达到高帧率实时跟踪。
-
- 融合多特征和通道感知的目标跟踪算法
- 赵运基, 范存良, 张新良
- 针对深度特征描述目标在跟踪过程中出现漂移或过拟合的问题,提出了一种融合多特征和通道感知的目标跟踪算法。应用预训练模型提取跟踪目标的深度特征,依据该特征构建相关滤波器并计算各通道对应滤波器的权重系数,根据权重系数对特征通道进行筛选;对保留的特征通过标准差计算生成统计特征并与原特征融合,采用融合后的特征构建相关滤波器并做相关运算,获取特征响应图确定目标的位置及尺度;利用跟踪结果区域的深度特征对融合特征构建的滤波器进行稀疏在线更新。所提算法和目前一些主流的跟踪算法在公共数据集OTB100、VOT2015和VOT2016上进行测试。与UDT相比,在不影响跟踪速度的同时,该算法具有更强的鲁棒性和更高的跟踪精度。实验结果表明,所提出的算法在目标尺度发生变化、快速运动和背景干扰等挑战下均表现出较强的鲁棒性。
-
- 选择性集成学习多判别器生成对抗网络
- 申瑞彩, 翟俊海, 侯璎真
- 生成对抗网络(GAN)在图像生成方面具有广泛应用,但基于无监督方式与有监督方式的网络生成样本仍有较大差距。为解决生成对抗网络在无监督环境中生成样本多样性差、质量较低以及模型训练时间过长等问题,提出了具有选择性集成学习思想的生成对抗网络模型。将生成对抗网络中的判别网络采用集成判别系统的形式,有效减少了由单判别器判别性能不佳导致判别误差的情况;同时考虑到若集成判别网络均采用统一网络设置,则在模型训练中基判别网络将趋近于一种表现形式,为鼓励判别网络判别结果多样且避免网络陷入雷同,设置拥有不同网络结构的判别网络,并在集成判别网络中引入具有动态调整基判别网络投票权重的多数投票策略,对集成判别网络的判别结果进行投票,有效地促进了模型的收敛且较大减少了实验误差。最后将提出的模型与同方向的模型在不同数据集上使用不同评价指标进行评价,实验结果表明提出的模型无论在生成样本多样性、生成样本质量还是在模型收敛速度上均明显优于几种竞争模型。
