计算机科学与探索杂志2024年第6期
-
- U型卷积网络在乳腺医学图像分割中的研究综述
- 蒲秋梅, 殷帅, 李正茂, 赵丽娜
- U-Net及其变体模型在乳腺医学图像分割领域展现了卓越的性能,U-Net采用全卷积网络(FCN)结构进行语义分割,U-Net对称结构的高度灵活性和适应性可以通过调整网络深度、引入新的模块来适应不同的图像分割任务和挑战,这种创新结构对后续网络设计产生了深远影响。深入探讨了基于U型卷积网络在乳腺医学图像分割中的应用,并对近年来用于乳腺医学图像分割的U型卷积网络进行了分类与归纳。针对U-Net网络结构改进的乳腺医学图像分割技术进行了如下总结。阐述了目前广泛使用的乳腺医学图像数据集及评价指标,陈述了常用的数据增强方法;详细介绍了U-Net模型的网络结构以及用于乳腺医学图像的传统分割方法;对用于乳腺医学图像分割方法的U型网络结构按照残差结构、多尺度特征、膨胀机制、注意力机制、跳跃连接机制、结合Transformer等方面改进进行归纳总结。讨论了当下乳腺医学图像分割所遇到的问题与挑战,对未来的研究走向做出了展望。
-
- AI绘画研究综述
- 张泽宇, 王铁君, 郭晓然, 龙智磊, 徐魁
- AI绘画,作为计算机视觉领域的热门研究方向,正通过自然语言处理技术、图文预训练大模型,以及新兴的扩散模型,不断拓展其在艺术创作、影视媒体、工业设计、艺术教育等领域的应用边界。将以图生图和以文生图两类AI绘画任务作为主线,深入分析了代表性模型及其关键技术和方法。对于以图生图方式,从基于自编码器和基于生成式对抗网络两类模型分别探讨了各自的发展脉络、生成原理以及优缺点,并总结了它们在公共数据集上的效果;对于以文生图方式,归纳了基于扩散模型等三类模型的结构区别,以及在三个数据集上各类模型的生成效果,同时指出利用扩散模型的以文生图方式已成为当下的热点,并预示着未来图像生成方式的多样化发展。对目前主流的AI绘画平台从使用方式、生成速度等角度进行了对比总结。最后在总结AI绘画在技术层面和社会层面所面临的问题与争议的基础上,展望了AI绘画与人类艺术家的互补发展、绘画过程互动性增强以及新职业和产业的出现等未来趋势。
-
- 基于深度学习的虹膜识别研究综述
- 江健, 张琪, 王财勇
- 虹膜识别技术以其卓越的精确性、安全性和稳定性等特点著称。当前的虹膜识别系统在约束用户状态和采集设备的条件下展现出较为稳定的性能,但是无法适应目前复杂多样的开放场景。开放场景中包含大量不确定采集因素,例如采集的虹膜图像容易受到睫毛、头发遮挡和镜面反射等因素的干扰,这些不确定性因素往往会造成图像质量的整体下降,导致虹膜图像分割和特征提取环节性能的显著下降。近年来,深度学习算法已被广泛应用于虹膜识别,旨在提升系统对开放场景的适应性。对深度学习技术在虹膜识别领域的应用现状进行了综述,总结了其在提高开放场景下识别精度的关键作用。首先,介绍了虹膜识别的背景;其次,全面分析了针对虹膜生物识别开发的各类深度学习模型在虹膜分割、特征提取和特征匹配任务中的表现,阐述了它们的优势和局限;然后,系统地总结了常见的虹膜数据集及其特性;最后,指出了虹膜识别任务新挑战以及未来探索的潜在方向。
-
- 区块链环境下隐蔽信道研究综述
- 张璇, 李雷孝, 杜金泽, 史建平
- 隐蔽信道是将信息隐藏在公开的通信信道中进行隐蔽传输的方法,旨在保证数据传输的安全性,使第三方对隐蔽通信的过程毫无察觉。然而,随着流量分析技术的不断进步,传统的网络隐蔽信道已经无法保证其安全性。区块链作为一种新兴技术,结合了密码学、共识算法和P2P网络,具有去中心化、可追溯性、匿名性、不可变性和安全性等特性,成为了构建隐蔽信道的理想平台。首先,简要介绍了区块链技术,对隐蔽信道的发展历程进行了阐述,并对隐蔽信道现有的分类方式进行了研究和总结;然后,在传统网络隐蔽信道的基础上总结了区块链隐蔽信道的一般模型,将隐蔽信道的构建过程划分为信息传输和信息提取两个主要环节;接着,从区块链的六层架构出发,对区块链隐蔽信道进行了深入分析,按照不同的层次将区块链隐蔽信道分为了六大类,并依据每层的结构和机制进行细分,能够更好地理解区块链隐蔽信道的构建过程,挖掘潜在的隐蔽信道;最后,讨论了区块链技术给隐蔽信道带来的局限性,并提出了未来的研究方向。
-
- 强化学习中的注意力机制研究综述
- 夏庆锋, 许可儿, 李明阳, 胡凯, 宋利鹏, 宋志强, 孙宁
- 近年来,强化学习与注意力机制的结合在算法研究领域备受瞩目。在强化学习算法中,注意力机制的应用在提高算法性能方面发挥了重要作用。重点聚焦于注意力机制在深度强化学习中的发展,审视了其在多智能体强化学习领域的应用,并对相关研究成果进行调研。首先,介绍了注意力机制和强化学习的研究背景与发展历程,并调研了该领域中的相关实验平台;然后,回顾了强化学习与注意力机制的经典算法,并从不同角度对注意力机制进行分类;接着,对注意力机制在强化学习领域的应用进行了梳理,根据三种任务类型(完全合作型、完全竞争型和混合合作竞争型)进行分类分析,重点关注了多智能体领域的应用情况;最后,总结了注意力机制对强化学习算法的改进作用,并展望了该领域所面临的挑战和未来的研究前景。
-
- 基于规则集成的可解释机器学习算法及应用
- 闵继源, 鲁统宇, 任婷婷, 陈汝昊
- 机器学习算法因其良好的预测性能已经取得了巨大的成功,但在对模型可解释性有着较高需求的领域,其适用性受到了限制。针对机器学习算法缺乏可解释性的缺点,基于规则集成思想提出一种新的可解释机器学习算法,称之为集成树惩罚逻辑规则回归,它能以较小的结构复杂度实现与集成树算法相当的预测性能,并且保留了逻辑回归的解释效果。首先,从随机森林、XGBoost等集成树中提取分枝,并将其转换为逻辑规则。其次,对规则集进行剪枝和去重处理,以得到精简的规则集。最后,将规则作为变量融入逻辑回归中,并以Lasso算法进行复杂度控制。以企业风险预警作为实例,与多种机器学习算法进行实验对比,结果表明此算法不仅能很好地继承集成树的违约判别能力,在各个分类指标上均超越了大多数机器学习算法,而且可以通过规则给出企业风险指标的阈值,便于企业进行风险管理。进一步地,根据此算法制作企业信用评分,验证了它的广泛适用性,得到的评分符合客观规律且具有区分度,然后通过三个公开数据集验证了模型预测性能的稳健性。
-
- 路灯人影和离家出走改进的黑猩猩优化算法
- 张庭溢, 汪弘健
- 为提高黑猩猩优化算法(ChOA)的求解精度和局部极值逃逸能力,提出一种路灯人影和离家出走改进的黑猩猩优化算法(SSR-ChOA)。首先,采用SPM混沌序列初始化种群,增加初始种群分布均匀性。其次,由夜间路灯下人影变化的物理现象设计一种新的光学类改进方式——路灯人影,用于优化原有ChOA算法开发精度不高问题。同时设计一种名为离家出走的全局优化策略,使普通黑猩猩个体拥有更强的主动探索能力,避免因领导者判断错误陷入局部极值而导致整个种群搜索停滞、过早收敛。测试了25个基准测试函数和CEC2014测试函数,对比了ChOA算法、4种不同类型改进ChOA算法以及粒子群等算法,分析了改进策略有效性。最后,对航拍无人机飞行路径中存在高耸电塔、信号塔的应用情景进行了研究,验证了SSR-ChOA有效性。实验结果表明,SSR-ChOA与ChOA和4种改进ChOA对比不仅具有显著性差异,而且在寻优精度和稳定性上表现更佳。无人机3D路径规划上,SSR-ChOA平均总开销相比ChOA减少3.06%。
-
- 极限学习决策网络指导的多目标粒子群算法
- 张一帆, 宋威
- 在求解多目标优化问题时,粒子群优化算法通常采用预设的榜样选择方法和搜索策略,无法根据具体的寻优状态进行调整。面对不同的优化问题,不合适的搜索策略难以有效指导种群的进化,导致种群的搜索性能降低。为了解决以上问题,提出一种极限学习决策网络指导的多目标粒子群优化算法(ELDN-PSO)。首先,将多目标优化问题分解成若干标量子问题,并构建一个极限学习决策网络。网络将粒子的位置作为输入,根据当前寻优状态为每个粒子选择合适的搜索动作。将粒子在子问题上的适应度值变化作为强化学习的样本用于训练网络,并通过极限学习机提升训练速度。在优化的过程中,网络会根据寻优状态自动调整,在不同的搜索阶段为粒子选择合适的搜索策略。其次,多目标优化问题中存在一系列难以比较的非支配解,将每个解的领导能力量化成可进行比较的数值,从而更明确地为粒子选择合适的学习榜样。此外,使用一个外部档案储存较好的粒子,用于维护解集质量并指导种群的进化。在ZDT和DTLZ测试函数上进行对比实验,结果表明ELDN-PSO能够有效应对不同形状的Pareto前沿,提升种群的寻优速度以及解集的收敛性和多样性。
-
- 增强型群论优化算法求解折扣{0-1}背包问题
- 张寒崧, 贺毅朝, 王静红, 孙菲, 李明亮
- 群论优化算法(GTOA)是基于群论方法提出的一个离散演化算法,非常适于求解以整型向量为可行解的组合优化问题。为了进一步提高GTOA求解折扣{0-1}背包问题(D{0-1}KP)的性能,首先指出了它的随机线性组合算子(RLCO)未能充分考虑当前个体位置信息的不足,基于个体基因保留策略对其进行改进。然后,在随机反向变异算子(IRMO)中引入增强0分量变异策略,用于处理因个体0分量无法及时变异而导致的解的质量下降、种群多样性降低等问题。在改进上述两个算子的基础上,提出了增强型GTOA(EGTOA),并基于它给出求解D{0-1}KP的新方法。随后,将改进策略应用于二进制GTOA(GTOA-2),提出了增强型GTOA-2(EGTOA-2)及其求解D{0-1}KP的新方法。为了验证EGTOA和EGTOA-2的性能提高程度与优异性,分别利用它们求解四类大规模D{0-1}KP实例,通过与GTOA、GTOA-2以及求解D{0-1}KP的已有8个最先进算法的比较表明:EGTOA和EGTOA-2求得最优解的能力比GTOA和GTOA-2提高了至少1.14倍,比8个最先进算法提高了5%~60%,它们的平均性能比GTOA、GTOA-2以及8个最先进算法的性能更佳。因此,EGTOA和EGTOA-2是当前求解D{0-1}KP的最佳算法。
-
- 多分支特征映射的遥感图像目标检测算法
- 闵锋, 况永刚, 郝琳琳, 彭伟明
- 由于遥感图像具有背景复杂、目标较小且密集、尺度连续变化大等特点,通用目标检测器难以较好地适应,导致检测效果不佳。针对以上问题,基于YOLOv5s模型,提出一种多分支特征映射的遥感图像目标检测算法。首先,利用结构重参数化技术设计一种结合门控通道转换的RepVGG模块,采用其串联结构替换原主干网络的C3模块,聚合全局上下文信息,增强特征表达和特征提取能力;其次,使用自适应指数加权池化方法以及逆过程重构特征融合网络的采样方式,最大化地保留特征信息,改善较小目标的检测效果;最后,引入EIoU和Focal Loss组合作为模型的损失函数,优化预测框的回归速率以及难易样本的损失权重分配,进一步提高定位精度。在DIOR和NWPU VHR-10数据集上的实验结果表明,提出算法的平均精度均值分别达到92.2%、92.5%,较YOLOv5s分别提高了3.5个百分点、5.6个百分点,达到了更好的检测效果,同时实时性也满足实际场景下的遥感图像目标检测。
-
- 融合组件位置信息特征的少样本字体生成
- 杨娜, 殷雁君, 张文轩, 云飞
- 局部组件方法实现少样本字体生成任务,通常会忽略组件位置信息对文字生成的作用,造成生成文字整体结构布局存有偏差。为了能够有效捕获组件位置信息,提出一种融合组件位置信息特征的少样本字体生成方法(CPI-Font)。提出的CPI-Font模型以MX-Font为基本框架,设计一种新的全局位置信息提取器。以坐标注意力提取全局位置信息,并通过多头组件注意力关注每个组件在全局位置信息中的不同重要程度,以捕获局部组件在整个字形中的全局位置关系特征,避免生成的字形结构产生偏差。采用公开构建的39种字体作为汉字数据集,与目前主流模型进行大量实验。实验结果显示,提出模型的LPIPS值达到0.112,FID值达到88.5,在内容和风格上的准确率分别达到83.1%、70.4%,在三个评价指标上模型均优于其他算法。结果表明,CPI-Font模型能够有效捕获组件位置信息,并具有较为先进的少样本字体生成性能。
-
- 特征级自适应增强的无人机目标检测算法
- 颜豪男, 吕伏, 冯永安
- 在自然光照条件下,无人机航拍图像中包含着低照度图像,这部分低照度图像会影响目标检测的精度,并且基于航拍图像的检测任务往往具有较高的实时性需求。针对上述问题,提出了一种特征级自适应增强的无人机航拍图像目标检测算法。首先使用改进的拉普拉斯算子与IAT图像增强网络进行融合,以强化目标的边缘特征,提升目标检测能力;其次使用双分支结构对正常图像与增强图像进行并行学习,以自适应选择的方式对学习到的特征进行融合,从而构建BLENet特征级自适应增强网络,自动适应光照并增强图像信息;然后设计基于频域分离的可变形卷积FS-DC模块以及具有参数共享的FS-C2F模块,从而在增强高频信息捕捉能力的同时减少模型参数量和计算冗余;最后改进回归损失函数Wise-IoU,使模型进一步聚焦于中高质量锚框,从而降低边界回归损失,提升定位精度。在公开数据集visDrone2023上的实验结果表明,相较于基线模型,最终模型在保持99 FPS的前提下,mAP@0.50提升了2.3个百分点,适用于露天光照变化环境下的无人机航拍实时检测任务。
-
- 融合多维梯度反馈的生成对抗网络推荐系统
- 李祥霞, 陈楷锐, 李彬
- 互联网时代,推荐系统在日常生活中变得十分重要,生成对抗网络(GAN)与推荐算法的结合为该领域的发展提供了新契机。以往基于生成对抗网络的推荐系统中,鉴别器提供的梯度反馈是二元的,此类反馈为生成器提供的帮助不够全面,造成诸如生成器性能不稳定、迭代速度慢等问题,进而影响模型的整体推荐效果。针对此问题,提出了多维梯度反馈生成对抗网络(MGFGAN),根据生成器生成的多维用户评分向量,该模型将自编码器(AutoEncoder)融入鉴别器中,达到为生成器提供多元反馈的目的,旨在让生成器生成的数据更加贴近用户偏好;此外,融合多维梯度反馈机制给模型整体带来了运算量激增的问题;因此,MGFGAN在生成器中引入了负采样模块,使得生成器同时兼顾用户感兴趣和不感兴趣的物品,从而加速生成器快速生成与真实用户分布一致的数据,提升模型的效率。提出的模型在公开数据集FilmTrust和Ciaos上展开实验仿真。实验结果表明MGFGAN的推荐性能优于其他基于生成对抗网络的推荐模型,并且在效率和稳定性方面取得改善。
-
- 多模态课程学习知识图谱实体预测方法研究
- 许智宏, 郝雪梅, 王利琴, 董永峰, 王旭
- 现有知识图谱实体预测方法一方面只利用邻域和图结构信息增强节点信息,忽略了知识图谱之外的多模态信息对于知识图谱信息的增强;另一方面正负样本对比训练模型时负样本随机排序导致训练效果不佳,且没有额外的信息帮助负样本的训练过程。为此,提出了一种多模态课程学习知识图谱实体预测模型(MMCL)。首先把多模态信息引入知识图谱实现信息增强,利用生成对抗网络(GAN)优化多模态信息融合过程,生成器生成的样本增强知识图谱信息,同时也提升鉴别器判别三元组真伪的能力;其次利用课程学习算法根据负样本的难易程度对负样本从易到难排序,通过步调函数分层次地把排序的负样本加入到训练过程中,更有利于发挥负样本鉴别三元组真伪的效果,同时无标签学习避免了训练后期假阴性问题;多模态信息融合互相优化的鉴别器与课程学习训练模型共享参数,帮助提升负样本的训练效果。在FB15k-237和WN18RR两个数据集上进行实验,结果表明,MMCL与基线模型相比,在平均倒数排名(MRR)、Hits@1、Hits@3以及Hits@10四个性能评价指标均有明显提升,验证了所提模型的有效性和可行性。
-
- 融合热点与长短期兴趣的图神经网络课程推荐模型
- 刘源, 董永权, 陈成, 贾瑞, 印婵
- 近年来大规模在线开放课程(MOOCs)平台为用户提供了海量的学习资源,亟需一种有效的个性化课程推荐方法帮助用户解决信息过载问题。现有的课程推荐方法忽略了课程间的时序性且无法较好地捕获课程间的长距离依赖关系,同时面临用户学习兴趣表示和冷启动两个关键问题。基于此,提出一种融合热点与长短期兴趣的图神经网络课程推荐模型(GHLS4CR)。该模型设计无环时序图和无环快捷图两种会话图构建方法来缓解现有方法存在的时序信息丢失和不善于捕获长距离依赖的问题;将用户长短期兴趣进行图级表示,并与热门课程信息进行融合实现个性化推荐,同时缓解冷启动问题。通过在学堂在线(XuetangX)公开数据集MOOCCourse上的大量实验表明,GHLS4CR在个性化课程推荐领域优于FISSA和LESSR等主流推荐模型。与次好的LESSR模型相比,Recall@5提高了13.28%,MRR@5提高了15.50%。
-
- 联合多模态与多跨度特征的嵌套命名实体识别
- 邱云飞, 邢浩然, 于智龙, 张文文
- 嵌套命名实体识别(NNER)因日趋重要的现实意义成为信息抽取的研究热点。但是,由于语料资源匮乏、穷举窗口受限以及跨度特征缺失等问题,面向垂直领域的NNER研究进展缓慢且存在实体识别错误或遗漏的问题。针对上述问题,提出一种以矿物学为研究背景,融合语料感知词典的垂直领域NNER模型。首先,结合点互信息、词频逆文本频率算法与注意力机制自动集成语料感知词典,同时扩展锚文本知识提升模型的训练精度。其次,从共享视角出发,设计三种多模态信息的融合策略,训练编码器学习字符、字形、词汇的扩展向量表示,通过三重积运算和切片注意力机制,筛选整合由多层感知机捕捉到的私有表征,缩小异质特征的空间差距。再次,以自底向上的层级架构确定跨度间的上下文关联,生成建议跨度集合,以双仿射机制和线性分类器获得目标跨度与相邻跨度、目标跨度内部表征、目标跨度边界等特征。最后,为目标跨度分配对应的实体类型标签。在六项数据集上的实验结果表明,相比于基线模型,提出的方法实现了显著的性能提升,能有效提升低资源场景下的NNER任务效果。
-
- 基于混合自适应损失函数的人脸识别方法
- 王海勇, 潘海涛
- 近年来样本挖掘策略被融入人脸识别的损失函数中,显著提升了人脸识别性能,但大部分工作都集中在如何在训练阶段挖掘困难样本,没有考虑到困难样本中潜在的无法识别的样本图像,从而导致模型对低质量人脸图像的识别性能较差。针对该问题,提出了一种结合样本难度自适应和图像质量自适应的混合自适应损失函数MixFace。该损失函数将基于课程式学习的损失函数CurricularFace与图像自适应损失函数AdaFace相结合,将特征范数作为图像质量指标融入损失函数中,在关注图像质量的前提下在训练前期关注简单样本,后期关注困难样本,降低网络模型对困难样本中部分低质量不可识别样本的关注。分别使用CASIA-WebFace和MS1MV2数据集训练,MixFace在高质量测试集LFW、CFP_FP、AgeDB、CALFW和CPLFW上相比Curricular-Face和AdaFace有不同程度的性能提升,同时MixFace在中等质量测试集IJB-B、IJB-C以及低质量测试集TinyFace上显示出比CurricularFace和AdaFace更好的识别性能。实验结果表明,MixFace能有效降低无法识别图像的干扰,进而提升低质量人脸识别性能,同时受益于MixFace中课程式学习的方式,对于高质量人脸识别仍然能保持较好的性能。
-
- 基于大语言模型的水工程调度知识图谱的构建与应用
- 冯钧, 畅阳红, 陆佳民, 唐海麟, 吕志鹏, 邱钰淳
- 随着水利事业的发展和信息化需求的增加,处理和表示海量水利数据变得复杂而繁琐。特别是调度文本数据通常以自然语言的形式存在,缺乏明确的结构和规范,并且处理和应用这些多样性的数据需要具备广泛的领域知识和专业背景。为此,提出了基于大语言模型的水工程调度知识图谱的构建方法。通过数据层的调度规则数据收集与预处理,再利用大语言模型挖掘和抽取数据中蕴藏的知识,完成概念层本体构建和实例层“三步法”提示策略抽取。在数据层、概念层、实例层的相互作用下,实现了规则文本的高性能抽取,完成了数据集和知识图谱的构建。实验结果表明,大语言模型抽取方法F1值达到85.5%,且通过消融实验验证了模型各模块的有效性和合理性。构建的水工程调度知识图谱整合了分散的水利规则信息,有效处理非结构化文本数据,并提供可视化查询和功能追溯功能。这有助于领域从业人员判断来水情况并选择适当的调度方案,为水利决策和智能推荐等提供了重要支持。
-
- 面向空间分布式计算的动态任务分解及长时保障机制
- 锁啸天, 杨雅婷, 嵩天
- 低轨卫星具有覆盖范围广、离地面近等优势,随着在轨处理能力的不断增强,未来将成为地面网络的重要补充。然而,随着用户对网络服务实时性的需求日益增长,如何在资源有限的条件下,基于低轨卫星为用户提供计算密集型服务,已成为一个急需解决的问题。尤其是在低轨卫星高速移动、星间链路动态切换的情况下,如何保证空间计算能力能持续稳定地驻留在用户区域并提供稳定可靠的服务,无疑是一项巨大的挑战。为了解决上述问题,提出一种动态任务分解聚合的分布式计算策略,通过卫星分布式计算解决单星算力不足的问题。在进行任务分解与调度时,充分考虑卫星网络的资源占用情况以及子任务之间的关联关系,对任务进行灵活的分解聚合。此外,为将低轨卫星算力驻留在用户区域,解决低轨卫星服务周期短的问题,研究并设计了一种长时保障机制。根据实时卫星网络拓扑及任务分解调度图,结合任务间的关联关系进行迁移决策,对卫星迁移过程进行模块化设计,根据实时网络状况调整迁移过程中的数据压缩率以及服务切换方式,降低迁移过程中服务的中断时间。仿真实验结果表明,提出的策略可保障长时分布式计算,能提供服务的平均时长延长了110%,用户满意度提高了约20%,迁移开销以及任务间的传输开销均降低了约15%。
