计算机科学与探索杂志2026年第1期
-
- 大语言模型压缩综述
- 郭晋阳, 贺昌义, 杨戈, 刘祥龙
- 大语言模型由于强大的认知能力,在多个领域得到了广泛应用,成为人工智能领域的研究热点。然而,大语言模型对计算、存储资源的巨大需求,使其难以在资源受限的情境下使用。模型压缩与加速技术成为解决这一问题的关键手段,旨在保持模型性能的前提下,降低计算复杂度和存储成本。基于此,对大语言模型压缩与加速技术的前沿研究进行了全面的综述,旨在把握整个领域的发展现状与未来趋势,推动大语言模型压缩与加速技术的发展,助力其在工业界和学术界的应用落地。系统阐述了大语言模型在计算资源和存储成本方面面临的挑战;从模型剪枝、模型量化、知识蒸馏、低秩分解四个关键技术路径出发,梳理了各类方法的基本原理、典型方法和最新进展,并对主流技术进行了系统对比与总结。从推理效率、精度保持、部署难度等多个维度构建了评价体系,深入探讨了大语言模型压缩的评估指标和实验基准。最后,结合当前技术瓶颈,展望了大语言模型压缩的未来研究方向,为后续相关研究与工程实践提供了系统性参考。
-
- 深度学习在皮肤病变图像分割中的研究综述
- 孟祥福, 李佳讯, 俞纯林, 鲁蕴萱
- 皮肤病变种类繁多,临床表现复杂,涵盖从良性病变到恶性黑色素瘤等多种类型。这些病变的早期检测和准确分割对于皮肤癌的诊断和治疗至关重要,尤其是在恶性黑色素瘤等高风险病变的早期识别和定位中,能够显著提高患者的生存率。近年来,深度学习技术在皮肤病变图像分割领域取得了显著进展,极大地提高了分割的准确性和速度。对深度学习在皮肤病变图像分割中的研究展开综述。介绍了多种皮肤病变成像方式及常用的公开数据集,并对常用的评价指标进行了归纳。针对图像普遍存在的噪声和伪影问题,详细探讨了多种图像预处理和增强技术。深入阐述了基于深度学习的皮肤病变分割方法,涵盖了U-Net、Transformer、SAM、Mamba以及多网络融合模型。同时,综合对比了各网络模型的主要结构设计、优势、局限性及其分割性能。对该领域当前所面临的挑战和问题进行了剖析,并对未来的研究方向提出了展望,以期为皮肤病变图像分割领域的进一步发展提供参考。
-
- 基于深度学习的无人机单目标跟踪综述
- 陈泷, 石磊, 黎智辉, 丁锰, 潘亦伦
- 基于深度学习的无人机(UAV)单目标跟踪算法旨在从航拍视频序列中准确跟踪指定目标,已成为计算机视觉领域的研究热点。与传统地面视觉跟踪相比,无人机单目标跟踪面临着视角变化剧烈、目标尺度复杂多变、计算资源受限等独特挑战。基于网络架构特点,将基于深度学习的无人机单目标跟踪方法系统梳理为传统Siamese网络、CNN-Transformer混合架构和全Transformer三大技术路线,重点关注2022—2025年间的最新研究进展。创新性地提出了两个细化分类框架:针对CNN-Transformer混合架构提出模块替代、特征后融合和协同建模三分类;针对Transformer单流方法提出静态计算、混合机制和动态计算三分类。系统揭示了无人机单目标跟踪算法从追求性能最大化向性能与效率协同优化的演进趋势。通过在UAV123、DTB70、UAVDT、VisDrone2018等主流数据集上的性能对比分析,验证了不同技术路线的优势与局限性。识别当前技术面临的关键挑战并提出未来发展方向和工程部署指导。
-
- 视觉Mamba:结构、应用与前景
- 张鑫, 智敏, 萨茹拉, 阿日木扎
- 传统卷积神经网络(CNN)因感受野受限难以建模全局特征,视觉Transformer虽具备序列建模优势,却面临二次计算复杂度的问题,给图像处理提出了严峻的计算挑战。为此,研究者开始探索兼具高效计算与全局感知能力的新型架构,基于状态空间模型(SSM)的视觉Mamba模型保留序列建模能力的同时能够实现线性计算复杂度下的全局上下文建模,标志着基于状态空间模型的视觉建模迈入新阶段。详细介绍视觉Mamba块的基本框架,包括由残差模块、二维选择性扫描(SS2D)模块与前馈网络(FFN)构成的双残差结构,分析了SS2D模块中跨扫描、S6块处理与跨融合的工作机制。从扫描、堆叠和混合结构等三个方面对视觉Mamba模型进行分析和探讨,扫描方式包括顺序扫描与动态扫描,对比分析了不同扫描策略的优劣;堆叠方式分为串行Mamba、并行Mamba、U型Mamba和图Mamba四类,详解各类堆叠结构的网络构建逻辑及在多尺度特征提取、长距离依赖建模中的适配性;混合结构聚焦在与CNN、Transformer、注意力机制的融合形式,包括单一模块融合与多模块协同架构,分析各模型优缺点。通过分析指出,视觉Mamba模型解决了CNN的局部感知限制和Transformer的二次项计算复杂度,在视觉任务中优于主流基础架构,展现出了成为视觉基础架构的巨大潜力。
-
- 面向2D医学图像检测的YOLO算法研究综述
- 郭振, 刘静, 仇大伟, 李宇皓
- 近年来,人工智能技术的突破性发展推动了医工交叉领域的范式变革,其中基于深度学习的目标检测算法在医学图像分析中展现出显著优势。作为单阶段检测框架的典型代表,YOLO系列算法通过“端到端”的检测范式,在医学影像分析领域展现出高实时性、强泛化能力和精准定位的独特优势,现逐渐成为病灶检测、细胞识别等任务的主流研究方法。对YOLO改进算法在医学目标检测研究进行梳理,基于算法架构创新维度,整理了从YOLOv1到YOLOv11共12代基础算法的核心演进路径,并深入对比分析各版本YOLO的改进突破、优势与局限性、医学场景表现;归纳了医学目标检测领域中的经典开源数据集,阐述了目标检测中常用的评价指标;重点综述了YOLO改进算法在2D医学图像的宫颈细胞检测、血细胞检测、肺结节检测和糖尿病视网膜病变检测的文献研究,并对不同改进方法进行综合对比分析;总结YOLO不同改进思想相对应的医用场景,并讨论指出该领域面临的挑战与未来发展方向。
-
- 混合增强黑翅鸢优化算法及其应用
- 王玉芳, 程培浩, 闫明
- 针对黑翅鸢优化算法(BKA)收敛速度慢和易陷入局部最优的局限性,提出了一种混合增强黑翅鸢优化算法(HEBKA),旨在提升算法的全局搜索能力和优化性能。HEBKA通过引入红尾鹰优化算法替换BKA的攻击阶段,并结合Bernoulli混沌映射作为攻击调节因子,以简化算法流程并显著增强全局搜索能力,从而有效提高收敛效率。借鉴黑寡妇优化算法的信息素机制,HEBKA将种群划分为优秀个体和劣质个体两类:对优秀个体实施迁徙操作以引导种群向最优解方向移动,而对劣质个体施加随机扰动以增加种群的多样性,从而减少对领导者迁徙的盲目依赖,避免种群过早收敛。当种群出现聚集现象时,HEBKA针对最优个体引入正交试验-准反射扰动策略,通过正交试验设计高效探索解空间,并利用准反射机制引入适度扰动,进一步增强算法跳出局部最优的能力。为验证HEBKA的改进效果,在CEC2017测试函数集上开展了仿真实验,与多种优化算法进行收敛性分析及Wilcoxon非参数统计检验,结果表明HEBKA在收敛速度、优化精度和鲁棒性方面均显著优于对比算法,展现出优秀的全局搜索能力和稳定性。HEBKA被应用于二维和三维旅行商问题(TSP)的求解,通过在实际复杂优化问题中的表现,验证了其高效性和应用潜力。
-
- 重叠感受野间隙耦合的方向差分运动感知神经网络
- 陶星宇, 胡滨
- 认知神经科学研究发现,脊椎动物视网膜存在方向差分神经元(OMS-DS),具有局部-全局方向差异偏好的视觉神经响应特性,有助于动态视觉场景中区分前景局部和背景全局之间的运动差异,但目前鲜有该神经特性在视觉运动感知问题研究的计算模型报道。针对该问题,基于蝾螈视网膜差分运动响应特性,提出一种方向差分运动感知神经网络(dirDMPNN)。所提出的神经网络包含突触前和突触后两部分。突触前网络感知运动变化在视野域中引发的低阶视觉线索;突触后网络基于重叠感受野间隙连接耦合机制以对前景、背景方向差分实现响应输出。系统性实验研究表明,dirDMPNN能感知视野域中平移自运动的前景-背景方向运动线索,并对其差分运动模式输出强烈神经尖峰响应。该工作涉及生物视脑神经机制启发的视觉信息加工处理,可为自运动视觉场景,诸如空间飞行器、无人驾驶、机器人自主导航等自治环境下的运动感知与识别、目标检测与跟踪问题的研究与解决提供新思想、新方法。
-
- 反向最大化学习:反蒸馏场景下的暗知识清除
- 张瑶, 李阳, 潘志松
- 知识蒸馏是一种通过传递教师模型的学习表征能力来增强学生模型性能的技术。然而,随着无数据知识蒸馏技术的发展,这种技术也可能被用于不正当的模型复制或增强,导致模型知识产权受到侵害,模型安全面临挑战。为应对这一挑战,反蒸馏技术应运而生,旨在去除教师模型中的暗知识,防止潜在的盗窃者通过知识蒸馏学习到教师模型的特征提取能力。现有研究主要通过生成多峰的输出来混淆学生模型,然而这种方法可能会在反蒸馏模型的训练过程中引入噪声,从而影响模型性能。为了解决这一问题,提出了一种名为反向最大化学习的方法,旨在训练一个能够保持原模型性能的反蒸馏模型,降低知识蒸馏过程中的潜在风险。该方法通过二元概率机制将原模型输出中的正负类解耦,同时通过反向排序模块学习原模型反向的负类输出,消除反蒸馏模型输出中负类之间的置信度差异以破坏知识蒸馏,同时保持正类的置信度优势以维持原始性能。在Cifar-100和ImageNet200等数据集以及多种模型上的实验表明提出的方法在有数据和无数据两种知识蒸馏场景下均具有显著的有效性,优于对比方法。
-
- 开放环境下无监督跨模态概念自动提取
- 海峻嘉, 景丽萍, 刘华锋, 于剑
- 随着机器学习模型的复杂性不断增加,对其决策过程的可解释性需求也日益增长。概念学习作为一种能够提升模型透明度和可理解性的手段,在机器学习领域变得越来越重要,通过概念来帮助解释大语言模型等黑盒模型的推理过程也随之发展,如何准确、自动地提取概念是在这一解释过程中最为关键的一环。针对现有的概念提取方法中存在的依赖人工标注、粒度不一致、扩展性差等问题,设计了一套跨模态视觉概念自动提取框架。基于多模态大模型的问询方式,实现了图像中目标对象的自动提取,并通过CLIP模型和目标检测模型实现了区域对应机制,提高了提取的准确性。采用基于文本分割的大语言模型来提取目标对象的属性和关系,确保了概念与数据的一致性。引入ConceptNet概念网络扩展了提取到的概念的语义信息,增强了框架的灵活性和适用性。通过实现这些技术,展示了该框架在三种不同场景下的实际应用效果,证明了其在提升概念提取效率和准确性以及可扩展性方面的潜力。
-
- 智能家居信息安全知识图谱构建研究
- 杨跃翔, 郑怀城, 刘学文, 涂新雨
- 随着智能家居行业的发展和信息安全需求的增加,设计时需考虑的信息安全因素逐渐变得复杂。标准文本中虽包含大量智能家居信息安全的设计要求,但文本之间缺乏结构关系,无法进行有效切割来提升大语言模型的知识抽取性能。为此,针对标准文本提出了一种大语言模型结合按标题切割策略-提示工程知识抽取方法。将长文档转化为Markdown格式,通过TF-IDF方法提取领域词,进行文本过滤,并依据Markdown半结构化特征进行文本分割,构建数据层;结合专家知识与智能家居信息安全领域多源数据,构建场景-设备-部件与危害-事故-控制链路本体,形成概念层;使用大语言模型、按标题切割的文本分割策略和“领域-模板-需求”的提示工程框架进行信息抽取,构建实例层。实验结果表明,经过领域词进行文本过滤后的大语言模型需要处理的文本减少了近60%,大大降低了调用API的成本,提出模型的最佳F1分数达到83.1%,通过消融实验,验证了提出的按标题切割的文本分割方法与提示工程框架可以极大地保留文本语义关联的合理性与有效性,再通过对比实验,证明了大语言模型比传统深度学习UIE模型明显更适配所提出的抽取方法,性能提升显著,说明大语言模型结合该方法在长文本的复杂结构语境下具有明显的优势。构建的知识图谱以场景-设备-部件为基础,连接了分散的危害与事故,并从标准中抽取出了相关的应对措施,提供了可视化查询和事故致因分析功能,有助于智能家居在设计时识别和评估潜在风险,预防信息安全事故。
-
- 单中心损失监督的人脸伪造检测双流网络
- 胡驷驹, 芦天亮, 彭舒凡, 杨刚, 尹浩然
- 深度伪造技术正变得越来越流行,引发社会对信息真实性的广泛质疑。从特征和学习层面考虑限制检测器泛化的因素:基于CNN的检测器往往过度拟合特定方法的颜色纹理;由于伪造样本之间的分布差异远大于真实样本之间的分布差异,应当对真实样本与伪造样本施加不同的约束。因此,为了优化人脸伪造检测模型,从多个维度展开创新,设计了基于单中心损失的双流网络(SCLTSNet)检测框架。在特征提取环节,引入多频段统计模块,提取图像的频域特征,以此作为RGB特征的有力补充。在特征融合环节,提出跨模态注意力混合模块和多尺度块特征融合模块,深入挖掘不同特征层级中,频域特征和RGB特征的相关性,并实现有效融合。从模型训练角度出发,基于异常检测的思想,引入单中心损失,通过放宽对伪造样本的约束,提升模型的泛化性能。对提出的方法在FF++、DFD、CDF等基准数据集上进行了综合评估,实验结果表明,SCLTSNet在FF++高压缩数据集上表现出色,准确率(ACC)指标和ROC曲线下面积(AUC)指标分别达到91.18%和94.57%。同时,在常见扰动的鲁棒性实验中,其AUC分数下降幅度低于其他模型,证明了该模型具有一定的鲁棒性。此外,在FF++数据集内四种不同伪造方式的子数据集以及跨数据集实验中,SCLTSNet的平均性能指标均优于当前先进方法,表明其具有良好的泛化性。消融实验进一步证实,该框架能够在不显著增加模型复杂度的前提下有效提升检测性能,体现了其轻量化设计的优势。
-
- 注意力引导多模态特征融合的虚假新闻检测方法
- 邓兴宇, 王龙业, 曾晓莉, 叶浩, 车熹昊
- 现有多模态虚假新闻检测方法在图像多层次频域信息利用和模态间信息深度交融方面存在局限,难以充分挖掘图像的潜在特征及多模态特征之间的相关性,进而影响检测性能。虚假新闻图像在传播过程中通常经历多次压缩或篡改操作,从而引发频域异常响应。传统方法多依赖傅里叶变换提取频域特征,但其全局频域分析会丢失局部篡改痕迹,且无法实现多尺度特征解耦。为了深入发掘并充分利用这些关键特征及其内在联系,提升虚假新闻检测效能,提出一种注意力引导多模态特征融合的虚假新闻检测方法(AGMFN)。该方法使用基于小波变换的双路径特征提取模块对图像的多层次频域信息进行建模,通过二级小波分解捕获低频全局结构与高频局部异常,并结合特征增强卷积强化细节特征。同时,预训练模型与频域特征提取模块分别提取文本、图像和频域特征,构建物理取证与语义线索的联合鉴别框架。为实现多模态特征融合并捕捉不同模态之间的深度关联特性,设计了一种基于注意力机制的长序列特征融合模块,引入指数递减加权系数建模不同模态之间的长期依赖关系,解决传统拼接融合的时序失配问题。通过跨模态注意力实现了文本-频域-视觉的层次化融合,在保持计算效率的同时增强虚假新闻判别能力。实验结果表明,AGMFN在Weibo数据集和Twitter数据集上的分类准确率分别达到了0.917和0.847,优于现有基线模型。可视化实验进一步验证了融合后的多模态特征具有更强的泛化能力,提高了虚假新闻的识别效果。
-
- 融合生成扩散模型的不完全多模态情绪识别
- 马飞, 王玉婷, 杨飞霞, 徐光宪
- 人类多模态情绪识别将文本、视觉和声音等各种异构模态数据用于感知并理解人类情感。与单一模态相比,多模态数据中的互补信息有助于更稳健地理解情感。然而,在实际多模态场景中常存在不完全或缺失模态信息,严重阻碍对多模态特征的理解,从而导致情绪识别精度下降。针对以往的多模态情绪识别方法未能有效地处理模态在不完全或缺失情况下产生的识别精度下降的问题,提出了一种融合生成扩散模型的不完全多模态情绪识别方法,通过重构不完全模态数据信息,以提升情绪识别的精度。构建基于跨模态条件随机微分方程的生成扩散模型,在逆扩散过程中将可用模态信息通过可学习投影转化为漂移项的动态约束,生成不完全模态信息特征;构建不完全模态生成网络与融合重构模块的双向协同优化框架,利用联合目标函数实现生成质量与特征融合的梯度反向传播交互,通过分层注意力机制建立补全的不完全模态特征与真实特征的情感语义一致性约束。经过几组数据集测试结果表明,所提出的多模态情绪识别方法在多种不完全模态场景中取得了优越的情绪识别性能。
-
- 融合定位图与上下文感知的伪装目标检测网络
- 余肖生, 陈灿, 李旭, 陈鹏
- 基于区域先验的伪装目标检测(COD)模型通常在早期阶段提取目标在图像中的位置信息,通过将目标的位置信息与图像特征相结合,网络能够更加有效地聚焦于目标区域,从而提高检测精度。而在许多具有挑战性的场景中,当前伪装目标检测算法对目标位置信息的提取能力有限,从而导致区域先验不准确甚至目标缺失。为此,提出了一种融合定位图与上下文感知的伪装目标检测网络FLMCA-Net。构建定位模块融合来自主干网络的多尺度特征并从全局、局部两个维度上提取目标的位置信息;设计了感受野增强模块细化不同尺度的特征表示;引入上下文感知融合模块将多尺度特征和目标区域先验充分交互融合并挖掘目标的全局上下文特征。在3个公开数据集上的实验表明,FLMCA-Net相较于其他20种代表性模型均取得了最优表现,比RISNet在[Sα]、[E?]和[Fωβ]方面的性能平均提升了2.5%、1.8%和3.6%。
-
- 反思性思维链在智能车任务级控制中的应用研究
- 钱鹏, 储开斌, 殷聪聪, 黄思涵
- 现阶段,大语言模型在处理复杂的长程任务推理时仍面临“幻觉”等问题,这对机器人控制构成了重大挑战。传统的思维链(CoT)技术在应对多模态信息整合与错误校正方面仍存在局限。为此,提出一种基于反思性思维链的大模型微调方法,以提升大语言模型在智能小车任务级控制中的规划能力。该研究以ChatGLM2-6B模型为基础,结合P-Tuning v2微调技术实现深度提示优化,构建了三类逐步增强推理能力的数据集:基础的CoT数据集、以自洽性为目标的CoT-SC数据集,以及具有反思和修正能力的反思性CoT数据集。通过引导模型进行逻辑推理和错误纠正,大幅度提升了规划结果的准确性和鲁棒性。实验结果表明,相较于基准模型,经过反思性CoT微调的模型在单步和双步任务指令中,BLEU-4指标分别提升20.91和26.80个百分点,在逻辑推理、任务规划及多步骤指令处理方面均优于其他微调方法。
-
- 三维重排MLP驱动的跨维交互式弱监督视频异常检测
- 张一帆, 严豫, 刘特立, 陈鹏
- 目前,弱监督视频异常检测(WVAD)已经成为视频异常检测的主流方法之一。然而,现有方法存在将各视频段视为独立同分布的示例,忽略了视频级时空依赖关系的问题。针对上述问题,提出了一种三维重排MLP驱动的跨维度特征交互式弱监督视频异常检测方法(rMLP-WVAD)。使用I3D编码器提取视频帧的多尺度特征,并通过三维重排MLP驱动的视频级特征交互及时空注意力机制(VSA)进行特征增强,以保留视频级的时空依赖关系并充分挖掘关键的跨维度异常特征。随着跨维度特征被进一步挖掘和丰富,如何更加精准地定义并量化“异常”便成为能否有效检测视频异常的关键。为此,提出将特征与加权平均特征的差异(DFWM)作为异常判别标准,以充分利用增强后的时空特征表达,更准确地量化“异常”并提升检测的性能。在公开数据集上的实验结果显示,rMLP-WVAD在XD-Violence数据集上的AP达到86.39%,在UCF-Crime数据集上的AUC达到85.70%,验证了该方法的有效性。
-
- LDD-YOLO:改进YOLOv8的轻量级密集行人检测算法
- 杨迪, 张喜龙, 王鹏
- 针对当前行人检测算法在密集场景中由于遮挡和尺度变化导致的漏检、误检,以及模型计算复杂度高等问题,提出了一种基于YOLOv8的轻量级密集行人检测方法(LDD-YOLO),以实现检测效率与精度的平衡。设计了一种重参数化层聚合网络RELAN,融合了重参数化卷积和多分支结构,分别在训练阶段和推理阶段强化特征表达能力与模型推理效率。引入了分离式大卷积核注意力机制的空间金字塔池化模块SPPF-LSKA,结合分离式大卷积核操作以扩大感受野,增强对密集目标的特征捕获能力,抑制背景干扰。为解决YOLOv8在特征处理中未能充分挖掘局部与全局信息的局限性,提出了一种改进的多尺度特征融合模块FFDM,通过融合多尺度特征信息,提升模型密集行人检测的特征表达能力。设计了一种轻量化的特征对齐检测头LSCSBD,利用不同特征层级之间的共享卷积层,提高参数利用效率并减少冗余计算。在CrowdHuman与WiderPerson数据集上的对比实验结果表明,LDD-YOLO在总体性能上优于对比模型,实现了精度与效率的平衡。
-
- DEPA-YOLO:无人机视角下的小目标检测模型
- 刘臣杰, 刘巍, 杨雯迪, 王成
- 针对无人机视角下小目标检测中存在的目标密集分布、背景复杂干扰及特征分辨率不足等问题,提出了一种基于YOLOv10的改进模型DEPA-YOLO。该模型设计了动态多尺度特征提取模块DCMB,该模块通过融合动态权重分配与多形态特征混合策略,有效增强了浅层局部纹理与高层全局语义的联合建模能力,从而改善小目标的特征表达。提出了HFEP特征金字塔结构,将SPDConv与ECFI的多分支动态融合相结合,实现了对不同尺度目标的细节保持与多层次语义的高效传递,显著缓解了传统特征金字塔在密集场景中信息丢失的问题;在主干网络中引入CPCA注意力机制,引导网络聚焦于显著目标区域,减少复杂背景干扰带来的误检与漏检;并在损失函数中采用WIoU回归策略,通过引入梯度调控与边界惩罚机制,提高了小目标定位的稳定性与鲁棒性。在VisDrone2019数据集上的消融实验结果表明,DEPA-YOLO相较YOLOv10基准模型在精度、mAP50和mAP50:95上分别提升4.7、4.3和2.5个百分点;在DOTA数据集的泛化实验中进一步提升7.9、2.0和1.2个百分点。DEPA-YOLO模型显著提升了无人机视角下的小目标检测精度,为无人机小目标检测提供了一种高效的解决方案。
-
- 多智能体协作驱动的审计问题定性法规推荐系统
- 徐超, 刘子硕, 周立云, 朱浩然, 黄佳佳
- 针对审计问题定性中多维特征解析与动态法规匹配的技术难题,提出了多智能体协作框架下的审计问题定性法规推荐系统。传统大语言模型在法规推荐任务中存在三重局限性:法律文本的语义特征与审计问题存在表征差异,动态更新的法规体系导致知识时效性不足,以及单一检索策略难以支撑复杂案例的多级推理需求。基于上述问题,构建了包含问题抽取、逻辑推理、伪例生成等专业化智能体的协同架构,通过任务分解机制将复杂审计案例解析为可并行处理的子问题空间。方法层面创新性地融合指令微调与检索增强生成技术,构建覆盖国家级、企业级和内控手册的三级法规知识库,并设计基于智能体的动态检索策略。经大量真实审计案例数据的实验验证,在国家级法规推荐任务中,系统实现30.56%的法规条款直接命中率,较ChatGPT-4(13.89%)提升116%,BERTScore与Rouge-L指标分别达71.19%与20.20%。在多级综合法规推荐任务中,命中率、BERTScore与Rouge-L分别达到63.91%、26.50%和27.80%,均超过基线模型至少15.2%。结果表明,通过智能体协同的任务分解机制可有效解耦复杂审计问题中的多维度特征,而多级知识库架构显著提高了法规推荐的准确度,为审计实务提供了可解释的法规推理路径。此外,模块化的设计支持不同司法辖区的法规库动态扩展,具有重要的工程应用价值。
-
- 基于多注意力机制的脊柱病灶MRI影像识别模型
- 周慧, 宋新景
- 人工检测脊柱病变是一项耗时的工作,并且高度依赖于该领域的专家,因此脊柱病灶的自动识别是非常必要的。然而,因为脊柱病灶的大小、位置和结构存在着广泛的差异,同时脊柱肿瘤与稀有病布鲁氏菌在影像上高度相似,所以脊柱病灶的准确定位和分类是一项具有挑战性的工作。为了应对这些挑战,提出了一种改进的脊柱病灶MRI影像识别模型。引入以ResNet-101为基础的双向特征金字塔主干网络,利用可变卷积在不同层替代传统的卷积神经网络,从特征层中获得更多的特征信息。在不同的模块中加入了多重注意力,包括自注意力机制和柔性注意力机制,有效地融合特征中贡献较大的部分。为了克服脊柱肿瘤、感染性病变、稀有病布鲁氏菌的数据不平衡问题,引入了改进的平衡交叉熵损失函数。在大连某医院提供的临床数据集上进行验证,识别精确率达到了94.2%,识别召回率达到90.8%。与其他识别模型进行对比实验,结果说明了该方法相对于其他模型识别性能更好。
