计算机科学与探索杂志2024年第9期
-
- YOLO系列目标检测算法综述
- 徐彦威, 李军, 董元方, 张小利
- 近年来,基于深度学习的目标检测算法是计算机视觉研究热点,YOLO算法作为一种优秀的目标检测算法,其发展历程中网络架构的改进,对于提高检测速度和精度起到了重要作用。对YOLOv1~YOLOv9的整体框架进行了横向分析,从网络架构(骨干网络、颈部层、头部层)、损失函数方面进行了对比分析,充分讨论了不同改进方法的优势和局限性,具体评估了改进方法对模型精度的提升效果。讨论了数据集的选择与构建方法、不同评价指标的选择依据,及其在不同应用场景中的适用性和局限性,深入研究了在五个应用领域(工业、交通、遥感、农业、生物)YOLO算法的具体改进,并对检测速度、检测精度及复杂度之间的平衡进行探讨。分析了YOLO在各领域的发展现状,通过具体实例总结YOLO算法研究中存在的问题,并结合应用领域的发展趋势,展望YOLO系列算法的未来,详细探讨了YOLO算法的四个研究方向(多任务学习、边缘计算、多模态结合、虚拟和增强现实技术)。
-
- 自然场景文本检测中可微分二值化技术综述
- 连哲, 殷雁君, 智敏, 徐巧枝
- 自然场景中包含的丰富文本对理解现实世界具有重要意义,但由于自然场景文本的多样性和复杂性,检测任务变得困难。随着智能时代的兴起,深度学习技术为自然场景文本检测带来突破性进展,可微分二值化网络DBNet的提出,更是推动了文本检测实时性需求的研究进步,许多研究者基于可微分二值化技术,进行了具有创新性和实用性的研究,并取得丰硕成果。对近年来基于可微分二值化技术的文本检测算法研究进行了深入的分析和总结。简要介绍DBNet模型的背景、工作原理、优势与劣势,根据技术差异将基于微分二值化技术的算法分为特征提取、特征融合、后处理、整体架构以及训练策略五类,对每类方法的改进方式进行详细的图示说明,并对各类技术方法的机制进行详细阐述,对所有方法进行分析总结。介绍了常用公开数据集和文本检测性能评估指标,汇总不同方法的仿真实验结果,列举几个具有实际意义的应用场景。对自然场景文本检测领域的未来发展方向进行了思考,并梳理面对的挑战和亟待解决的问题。
-
- 表面肌电信号在肌肉疲劳研究中的应用综述
- 方博儒, 仇大伟, 白洋, 刘静
- Muscle fatigue is a physiological phenomenon that occurs when muscles are overused or continuously loaded during exercise or labor. Currently, analyzing the fatigue mechanism is still a complex and multi-layered research problem. In recent years, research methods focusing on surface electromyographic (sEMG) signals have garnered significant attention. The application of advanced signal processing techniques and machine learning algorithms has enhanced the precision of interpreting surface electromyographic data, deepening understanding of the mechanisms underlying muscle fatigue. This, in turn, provides crucial scientific support for improving athletic performance, preventing sports injuries, and enhancing rehabilitation treatments. This review of muscle fatigue research based on surface electromyographic signals covers various aspects. Firstly, the definition of muscle fatigue and current commonly used detection methods are explained, and the characteristics and application scope of various methods are pointed out. Secondly, the EMG characteristics that characterize muscle fatigue are introduced in detail from linear characteristics such as time domain, frequency domain, time-frequency domain and the use of nonlinear parameters, and the advantages and limitations of these characteristics are also discussed. Thirdly, combining fatigue characteristics as input data, the classification algorithms commonly used for muscle fatigue are explored, and the applicable conditions, advantages and disadvantages of each algorithm are accurately summarized from the aspects of machine learning and deep learning algorithms. Finally, the challenges faced by muscle fatigue research at this stage are pointed out, and on the basis of proposing feasible solutions, future research directions are prospected.
-
- 基于深度学习的多聚焦图像融合方法前沿进展
- 李子奇, 苏宇轩, 孙俊, 张永宏, 夏庆锋, 尹贺峰
- 多聚焦图像融合是一种有效的图像融合技术,旨在将来自同一场景的不同焦平面的源图像组合起来以获得良好的融合结果,这意味着融合后的图像将在所有焦平面都聚焦,也就是包含着更丰富的场景信息。深度学习的发展促进了图像融合的巨大进步,而神经网络强大的特征提取和重构能力使融合结果大有可为。近年来,出现了越来越多的基于深度学习的多聚焦图像融合方法,如卷积神经网络(CNN)、生成对抗网络(GAN)和自动编码器等。为了给相关研究人员和技术人员提供有效的参考和理解,介绍了多聚焦图像融合的概念和一些评价指标,分析了十几种近几年基于深度学习的多聚焦图像融合前沿方法,讨论了各种方法的特点和创新性,并总结了它们的优缺点,回顾了多聚焦图像融合技术在各种场景中的应用,包括摄影可视化、医疗诊断和遥感检测等领域,介绍了目前多聚焦图像融合相关领域面临的一些挑战并展望了未来可能的研究趋势。
-
- AIGC大模型测评综述:使能技术、安全隐患和应对
- 许志伟, 李海龙, 李博, 李涛, 王嘉泰, 谢学说, 董泽辉
- 人工智能生成内容(AIGC)模型因出色的内容生成能力,在全球范围内引起了广泛关注与应用。然而AIGC大模型的快速发展也带来了一系列隐患,例如模型生成结果的可解释性、公平性和安全隐私等问题。为了降低不可知风险及其危害,对AIGC大模型进行全面测评变得越来越重要。学术界已经开启了AIGC大模型测评研究,旨在有效应对相关挑战,避免潜在的风险。对AIGC大模型测评研究进行了回顾,并对其进行了综述和分析。对模型测评过程进行概述,内容涵盖模型测评前准备和相应的测评指标,并系统性地整理了现有测评基准。讨论了AIGC大模型在金融、政治和医疗领域的代表性应用及其存在的问题。通过可解释性、公平性、鲁棒性、安全性和隐私性等不同角度深入研究测评方法,对AIGC大模型测评需要关注的新问题进行解构,提出大模型测评新挑战的应对策略。最后探讨了AIGC大模型测评未来面临的挑战,并展望了其发展方向。
-
- 基于大语言模型增强表征对齐的小样本持续关系抽取方法
- 李逸飞, 张玲玲, 董宇轩, 王佳欣, 仲宇杰, 魏笔凡
- 关系抽取作为自然语言处理的关键任务,对于深化语言理解、构建知识图谱以及优化信息检索系统具有重要作用。然而,由于新关系不断涌现且缺乏大量标注示例,传统的监督学习方法并不适合实际场景。尽管大语言模型的出现显著提升了许多自然语言处理任务的性能,但仍然无法直接有效地解决小样本持续关系抽取任务的挑战。为了充分利用大语言模型的语义知识来缓解灾难性遗忘与过拟合问题,提出了一种基于大语言模型增强表征对齐的小样本持续关系抽取方法LAFA,通过关系实例改写、语义扩充和关系增强表征等策略,在保持数据量和计算成本较低的同时,有效提升了模型对新关系的适应性和对旧知识的保持能力。在两个关系抽取数据集FewRel、TACRED上进行实验验证,与现有方法相比,LAFA在小样本持续关系抽取任务中展现出较好的效果,尤其在增量阶段取得了最佳的实验结果。通过消融实验进一步揭示了方法中各个模块对整体性能的显著贡献。LAFA的推理效率与开销远远低于现有的基于大语言模型的方法,并且具有很强的扩展性,能够适配多种语言模型。
-
- 生成式大语言模型在中文放射医学领域的应用研究
- 陈龙飞, 高鑫, 侯皓天, 叶初阳, 刘亚欧, 张美慧
- 在中文放射医学领域中,影像学报告是临床决策的重要依据。因此,利用自然语言处理(NLP)技术来理解和学习影像学报告的文本内容,并以此辅助完成放射科临床工作,已成为该领域的重要研究方向。然而,在使用传统方法处理基于中文影像学报告的自然语言分类与生成任务时,仍然面临训练语料匮乏且涉及隐私、模型泛化能力较差等限制导致的综合性能不足的情况。针对上述问题,提出了一种基于本地高效微调大语言模型的中文放射医学领域自然语言任务解决方案。通过收集并构建大规模高质量中文影像学报告自然语言任务数据集,采用LoRA高效微调方法对开源大语言模型Baichuan2进行有监督微调训练,提出了能够同时解决四种中文放射医学领域临床任务的“龙影大模型”。提出了一套中文放射医学领域自然语言分类与生成任务评价体系。在来自两家中心的三个医学影像种类的报告数据集上进行了多组实验,并与几种典型现有方法进行了对比,结果显示所提方法在分类性能、文本总结与扩充能力和模型泛化性上表现更好。
-
- 大模型驱动的科技政策法规问答系统研究
- 向小伟, 申艳光, 胡明昊, 闫天伟, 罗威, 罗准辰
- 科技政策法规问答系统(Q&A)在帮助公众理解和应用科技法规方面发挥关键作用。大语言模型(LLM)可以显著提升科技政策法规问答系统的准确性和效率。然而,基于大语言模型的科技政策法规问答系统仍然存在以下问题:缺乏大规模高质量的科技政策法规问答数据集,且现有自动构建大规模数据集的方法在引用和整合政策法规知识方面存在不足;问答系统在处理科技政策法规问题时,专业性、准确性不足且模型知识更新滞后。为解决这些问题,提出了一种检索增强自提示的问答数据集构建方法,并构建了一个大规模高质量的科技政策法规问答数据集;同时,构建了科技政策法规问答系统,该系统结合了经过低秩自适应(LoRA)微调技术优化的大语言模型与科技政策法规知识库,并运用提示学习技术,来引导系统生成准确的答案。实验结果显示,构建的问答数据集在引用和整合科技政策法规知识方面,比传统方法构建的问答数据集有显著提升;相较于通用大语言模型驱动的问答系统,该问答系统在各项指标上也有明显提高。
-
- 面向工艺规范文本的大语言模型知识注入方法研究
- 纪贵阳, 王裴岩, 余卓
- 使用大语言模型进行工艺规范的应用是解决工艺知识查询不准确的有效途径。现阶段通过领域知识图谱嵌入或指令数据微调的领域模型构建方法效果不佳,难点在于工艺规范中工艺知识涉及多种工艺要素间关系,复杂度较高。各规范间仅通过引文方式使用导致数据稀疏。工艺知识复杂度高及数据稀疏导致模型对工艺领域概念、概念与属性间关系、概念与概念间关系、多概念间关系及参考依据知识的学习受限。针对该难点,提出一种面向工艺规范文本的大语言模型知识注入方法。根据工艺规范数据特点设计了包含辅助句判别任务、概念-篇章生成任务、篇章续写任务及篇章-摘要生成任务的知识注入数据,结合问答对数据对模型进行有监督微调,为模型注入领域概念、属性、多概念间关系及参考依据知识。实验结果表明,结合知识注入数据和问答对数据训练的模型对比只使用问答对数据训练的模型ACC(准确率)提升7.3个百分点,ROUGE-L提升7.4个百分点,BLEU-4提升6.2个百分点,表明提出的知识注入方法的有效性。
-
- 社交平台不平衡文本数据处理与应用研究
- 姜钰棋, 侯智文, 王一帆, 翟晗名, 卜凡亮
- 随着社会信息化程度加深,运用自然语言处理技术从海量网络数据中筛选提取有效信息,具有重要的实用价值。然而,从社交平台收集的文本数据存在有效信息类别数据量少、类别不平衡等问题。因此,提出SimDyFeFL方法解决中文应急关联文本识别任务的数据不均衡问题,EdaDyFeFL方法解决英文网络暴力检测任务的数据不均衡问题。采用SimBERT与EDA方法将类间差异较大的原始数据增强至类间数量相近后,融合加入动态反馈过程的Focal Loss函数对各类别加权,并设计BERT、RoBERTa与BERT_DPCNN作为文本分类模型进行三个阶段的对比实验,证明提出方法的有效性。在中、英文两个真实数据集上的大量实验表明,使用SimDyFeFL与EdaDyFeFL改进后的文本分类模型综合性能提升显著,中文模型准确率最高提升7.70个百分点,英文模型准确率最高提升5.15个百分点。与Kaggle平台已有研究取得的最好成绩相比,英文模型准确率高出了2.92个百分点,Macro F1值与Weighted F1值分别高出2.83个百分点与2.95个百分点。
-
- 空间注意力与位置优化的三维人体姿态估计域适应算法
- 姜友鹏, 华阳, 宋晓宁
- 现有三维人体姿态估计器在单个数据集上表现较好,但受限于训练数据姿态结构的单一,其在跨域实验上的泛化性不足。现有方法通过增加姿态多样性来弥补该缺陷,然而这些方法生成的新姿态缺乏真实有效性且姿态全局位置的分布与目标数据集仍存在显著差距。针对上述问题,提出一种基于生成对抗网络(GAN)的空间注意力与全局位置优化的三维人体姿态估计域适应算法。算法引入空间节点注意力模块约束生成器产生更自然的人体姿态,并结合姿态位置修正模块促使生成姿态向目标数据域对齐,从而解决以上域适应问题。此外,为了提升估计器训练的稳定性,提出一种端到端随机混合的训练策略,使姿态估计器可兼顾新旧数据信息的学习。作为一种生成式的域适应方法,该算法可以高效地应用于各种二阶段三维人体姿态估计器。通过跨场景实验与跨数据集实验,结果表明所提算法在多个基准数据集上的表现均达到当前最佳。其中在3DHP数据集中,该方法MPJPE与AUC指标相比最优工作优化了1.7%和1.4%,验证了所提算法可有效提高三维人体姿态估计器的泛化性。
-
- 融合自适应聚类与母蚁引导策略的蚁群算法
- 邢李成, 游晓明, 刘升
- 针对蚁群算法在求解较大规模旅行商问题时,容易出现陷入局部最优、收敛速度较慢的情况,提出一个融合自适应聚类与母蚁引导策略的蚁群算法(AMACS)。在自适应聚类中,使用改进的聚类方法,利用最大最小距离与类密度的思想,通过自适应聚类策略,获得最佳聚类结果,并快速获得各个类的优化解;利用近邻原则,将相邻的类进行蛛网融合,从而有效提高了初始解的精度。通过母蚁引导策略对初始解进行优化,其中母蚁引导策略包括路径诱导与信息素优化两个部分:路径诱导将初始解设定为第一代的解,提高了算法的稳定性;信息素优化通过对初始解路径进行信息素激励,提高了解的精度。使用随机重组策略对信息素进行重组以及随机激励,使算法尽量跳出局部最优,提高了算法的精度。实验结果表明,提出的算法在求解大规模旅行商问题时,不仅保证了解的精度,而且提高了算法的稳定性。
-
- 目标区域引导的RRT*机械臂路径规划算法
- 孟月波, 张子炜, 吴磊, 刘光辉, 徐胜军
- 针对传统RRT*算法在机械臂路径规划的过程中存在规划效率低、路径质量不佳、机械臂位姿不当等问题,提出一种目标区域引导的RRT*机械臂路径规划算法(TA-RRT*)。在传统RRT*算法基础上,引入目标偏向策略并使用球形子集约束采样,缩小采样范围并使新节点朝向目标点扩展,增强目标导向性;对新节点采用直连策略,让算法可以更快地收敛从而提升路径生成速度。对初始规划路径去除冗余点并使用三次B样条曲线转换成平滑路径,优化了路径质量。对机械臂进行位姿约束,通过机械臂逆运动学判断机械臂连杆位姿可达性,并利用包络盒模型判断机械臂是否与障碍物碰撞。实验结果表明,在二维以及三维场景下,TA-RRT*算法在采样次数、规划时间、路径长度以及平滑度等方面的性能均优于RRT*算法,验证了该方法的正确性及可行性。机械臂仿真实验以及在真实环境下的测试结果显示,加入位姿约束后机械臂运行规划好的轨迹时,机械臂各个关节在运行规划路径的过程中并未与障碍物发生碰撞且具有良好的稳定性。
-
- LEGAN:一种新的暗弱光照图像增强算法
- 郭璠, 刘文韬, 李小虎, 唐琎
- 针对暗弱光照图像所存在的亮度、对比度、信噪比低,以及噪声污染大等问题,提出了一种新的暗弱光照图像增强算法LEGAN。该算法将图像输入至所提伽马曲线估计网络求得包含伽马参数的特征图,再经过LEB模块增强亮度,并通过级联LEB的方式迭代增强结果。采用基于PatchGAN的全局-局部判别器结构来提高图像分辨率和恢复图像细节。通过引入感知损失来限制真实标签和输出结果之间的差距,利用照明平滑度损失保持相邻像素之间的单调性关系,同时结合空间一致性损失来增强图像的空间相关性。实验结果表明,相比于现今大多数主流增强算法,该算法的细节还原度相对较高,且能有效避免增强后的图像出现局部亮度不佳等问题。
-
- 傅里叶增强的无偏跨域目标检测研究
- 王兵, 徐裴, 张兴鹏
- 无偏跨域目标检测的主要目的是借助知识蒸馏最大限度地利用源域的知识,通过领域自适应减小模型的跨域差距。然而,通常用于无偏跨域目标检测的平均教师方法所产生的伪标签并不可靠,从而导致师生模型间仍然存在较大的领域偏差问题。受傅里叶变换中相位信息不变性特点的启发,在平均教师的基础上提出傅里叶增强无偏协同教师模型(FAUMT)。利用傅里叶相位信息的不变性,设计振幅混合的数据增强(AMDA)模块,其可以有效地混合源域和目标域间的相位信息从而实现数据增强。而数据增强会产生额外的噪声,设计两个一致性损失来保证数据增强前后预测的一致性。此外,为平衡模型训练过程中源域和目标域间的跨域偏差,还设计了多层对抗学习(MAL)模块,旨在对不同层次的像素级别特征进行域对齐。在三个基准数据集Cilpart1K、Watercolor2K、Comic2K上,该方法的mAP分别达到了47.5%、58.9%、46.1%,超过了其他算法。
-
- 强化特征图的无参考低光照图像增强
- 袁姮, 王笑雪, 张晟翀
- 针对低光照图像质量不佳、夹杂噪声导致对比度和亮度不足、细节不清晰,且成对的低光照图像数据集获取成本过高的问题,在生物视觉马赫带效应的启发下,提出一种强化特征图的无参考低光照图像增强方法。使用强化滤波块(EFB)对图像和特征图进行特征强化,抑制噪声的同时强化特征细节,提高网络对特征的学习能力。将跳跃连接与空间注意力模块(ESA)结合,通过融合强化的浅层特征与深层特征来提取全局上下文信息和局部区域特征,有效保留了图像的色彩信息,避免细节丢失,提高网络的泛化能力。使用像素估计曲线调整低光照图像像素的动态范围,对其进行亮度增强。实验结果表明,经该算法处理后的图像在PSNR、SSIM、LPIPS和NIQE等指标上分别达到了17.709 dB、0.657、0.239和3.486,该方法相较于现有的主流算法能够更好地达到图像增强目的,有效地提升图像亮度和细节信息,同时保持图像的自然属性。
-
- 问题特征增强的知识追踪模型
- 许智宏, 张惠斌, 董永峰, 王利琴, 王旭
- 知识追踪根据学生过去的答题表现实时跟踪学生的知识状态并预测学生未来的答题表现,是实现个性化教学的关键。近年来,基于RNN的深度知识追踪模型逐渐成为知识追踪领域中的主流研究方法。但是,现有的知识追踪模型存在无法捕获序列间长期依赖以及忽略了问题与知识点间关系的问题,导致无法充分提取问题特征。针对上述问题,提出了基于问题特征增强的知识追踪模型QFEKT。使用图卷积神经网络对问题和知识点相关特征进行建模,建模过程中引入对比学习提升特征表示水平。通过问题匹配模块与学生知识状态表征模块进一步增强问题特征:通过问题匹配模块提取相似问题作为问题特征的补充;通过学生问题表征模块将双向长短期记忆网络与注意力机制结合增强问题特征建模学生的知识状态。预测模块融合相似问题特征与学生知识状态预测学生未来答题表现。在三个公开真实数据集上进行对比实验,QFEKT模型与其他基线模型相比可以更好完成知识追踪任务,在预测学生未来答题表现上具有明显优势。
-
- 基于跨模态语义信息增强的多模态情感分析
- 李梦云, 张景, 张换香, 张晓琳, 刘璐瑶
- 随着社交网络的发展,人类通过不同的方式表达自己的情感,包括文本、视觉和语音,即多模态。针对以往的多模态情感分析方法未能有效地获取多模态情感特征表示,以及没有充分考虑在多模态特征融合过程中冗余信息对实验的影响,提出了一种基于跨模态语义信息增强的多模态情感分析模型。该模型采用BiLSTM网络挖掘各单模态内部存在的上下文信息。通过跨模态信息交互机制对多种模态间的信息交互进行建模,得到文本对语音、视觉,语音对文本、视觉,视觉对文本、语音六种信息交互特征,将目标模态相同的信息交互特征进行拼接,得到信息增强后的单模态特征向量,有效地获取模态间共享和补充的深度语义特征。另外,使用多头自注意力机制分别计算原始单模态特征向量和信息增强后的单模态特征向量间存在的语义相关性,提高识别关键情感特征的能力,降低冗余信息对情感分析的负面干扰。在公共数据集CMU-MOSI和CMU-MOSEI的实验结果表明,所提出的模型既能增强情感特征表示,也能有效降低冗余信息的干扰,在多模态情感分类准确率和泛化能力上的表现优于相关工作。
-
- 融合全局增强-局部注意特征的表情识别网络
- 刘娟, 王颖, 胡敏, 黄忠
- 为抑制自然场景下遮挡和姿态变化等因素对人脸表情识别的影响,提出一种融合全局增强-局部注意特征(GE-LA)的表情识别网络。为获取增强的全局上下文信息,构建通道-空间全局特征增强结构,该结构采用通道流模块(CFM)和空间流模块(SFM),分别获取对称多尺度通道语义以及像素级空间语义,并结合两类语义生成全局增强特征;为抽取局部细节特征,将高效通道注意力(ECA)机制改进为通道-空间注意力(CSA)机制,并以此构建局部注意模块(LAM)获取通道和空间高级语义。为提升网络对遮挡、姿态变化等因素的抗干扰能力,设计一种自适应策略实现全局增强特征和局部注意特征的加权融合,并基于自适应融合特征实现表情分类。在自然场景人脸表情数据集RAF-DB和FERPlus上的实验结果表明,提出网络的表情识别率分别为89.82%和89.93%,比基线网络ResNet50分别提高了13.39个百分点和10.62个百分点。与相关方法相比,提出方法降低了遮挡、姿态变化的影响,在自然场景下具有较好的表情识别效果。
