计算机科学与探索杂志

计算机科学与探索杂志2026年第4期

  • 气象多模态数据融合方法研究综述
    吴若飞, 方巍, 蒋鸿儒, 鲍艳松
    多源观测技术的进步开启了多模态气象数据时代。单一模态的气象数据在表征复杂多变的大气系统时存在固有局限性,难以满足更精准的预测需求,因此融合多模态数据来实现信息互补和性能提升,成为气象研究的前沿方向。针对如何有效融合不同模态的气象数据这一核心问题,对气象领域的多模态数据融合方法进行了系统性的综述。系统梳理了多模态融合技术的发展脉络,重点对基于深度学习的融合策略进行了深入探讨,详细阐述了编码器-解码器、注意力机制、图神经网络以及生成对抗网络等主流模型在融合多模态数据时的核心思想、架构特点与优势。对多模态融合技术在气象领域的应用现状进行了全面的归纳与分析。在系统整理现有公开多模态气象数据集的基础上,聚焦于该技术在几个关键气象任务中的具体应用,包括临近降水预报、台风与热带气旋的路径及强度预测等,并总结了不同融合方法在这些场景下的研究进展与效果。进一步分析了当前气象多模态融合所面临的核心挑战。根据所提出的挑战对该领域的未来发展方向进行了展望。
  • 基于图神经网络的行人轨迹预测研究综述
    杜婷, 庄旭菲, 王玉杰, 黎子珩, 吕洁, 智媛媛, 赵宇鹏
    行人轨迹预测作为自动驾驶、智能监控等场景中的关键技术,其预测精度直接关系到下游决策系统的安全性和可靠性。然而,行人运动受社会交互、环境约束以及个体意图差异的共同影响,具有明显的动态性和复杂性,传统方法通常难以在统一框架下同时兼顾这些复杂因素。近年来,图神经网络凭借其强大的关系建模能力,在行人轨迹预测领域展现出显著的优势,并成为当前研究的热点。系统梳理了近年来基于图神经网络的行人轨迹预测研究进展,依据模型结构特点将其划分为三类:基于时空图神经网络的方法、图神经网络与生成式网络相结合的方法和基于图神经网络与Transformer相结合的方法。深入分析了上述各种方法的建模机制、方法优势以及局限性,比较了部分具有代表性的方法在公共数据集上的性能表现。总结该领域的主要挑战,对未来的发展方向进行展望,不仅为理解现有图神经网络轨迹预测方法的研究脉络提供了系统化的理论框架,也为后续相关研究提供了有价值的参考依据。
  • 联邦学习中的模型中毒攻击防御策略综述
    张磊, 姜鸽, 蒲冰倩, 常亮
    模型中毒攻击是联邦学习中的一种严重威胁,在模型中毒攻击中,恶意攻击者通过在训练数据或模型更新中注入恶意信息,从而干扰全局模型的正常收敛,直至操控其预测结果。模型中毒攻击的隐蔽性和多样性使得防御极为困难,因此引起研究者的广泛关注。对模型中毒攻击的原理加以分析,重点剖析攻击者如何通过篡改本地训练数据或伪造模型参数来破坏全局模型性能的内在机制,在此基础上,系统性地将现有防御策略划分为三类:基于恶意模型分析的防御策略,这类方法主要通过模型更新相似性比较和质量评估来有效识别潜在的恶意行为;基于模型更新鲁棒聚合的防御策略,其核心在于采用移除极值或自动加权创新的聚合方式来显著降低攻击造成的影响;基于模型更新加密聚合的防御策略,这类策略创造性地结合了差分隐私和同态加密前沿技术,在确保数据隐私安全的同时大幅提升了模型的鲁棒性,并对其优缺点以及应用场景加以分析说明,最后对模型中毒攻击的隐私保护问题和具体的解决方案详细分析,并从攻击和防御两个角度提出未来的发展方向。
  • 面向AGV环境感知的图像点云融合研究综述
    王荣儿, 伍济钢
    随着自动化工业生产线和智能物流仓储系统的快速发展,自动导引车(AGV)作为工业自动化与智能制造的核心载体,其环境感知能力是实现高精度自主导航与智能化作业的先决条件。通过人工智能与多模态传感技术的深度融合,AGV能够突破传统感知模式的局限性,实现对复杂工业场景的动态理解与自主响应。其中,基于图像与点云的融合感知技术,凭借其在三维空间解析与语义信息互补方面的优势,成为提升AGV环境感知鲁棒性与适应性的关键突破方向。因此,对图像点云融合技术在AGV环境感知中的演进脉络进行梳理,对比典型融合策略的性能边界与应用场景,并且重点对基于深度学习的图像点云融合技术方法进行分析和总结,针对多传感器标定与长期稳定性、算法实时性、边缘计算资源与算法复杂度的矛盾及极端工况适应性等瓶颈问题,从无监督在线标定、动态感知-决策闭环优化、算法-任务协同设计以及极端场景自适应感知等维度探讨技术发展方向,为构建更安全、高效、普适的AGV环境感知体系提供理论支撑与技术路径参考。
  • 基于检索增强生成的任务规划方法综述
    马逸博, 陈希亮, 章乐贵, 赖俊
    检索增强生成(RAG)技术通过动态集成外部知识有效缓解大语言模型的幻觉问题和知识时效性的限制,已经成为提升大语言模型任务响应准确性的关键范式,但是如何高效使用检索增强生成架构以适配复杂任务的规划需求仍然是当前的核心挑战。作为一种流行的解决方案,根据不同的时机触发检索增强生成,显著增强了大语言模型在知识密集型场景和复杂规划任务中的规划鲁棒性。阐释了检索增强生成框架中决策触发时机的必要性;聚焦RAG增强任务规划的触发时机这一核心议题,将相关触发机制分为规则导向型触发、状态自适应型触发以及交互反馈型触发三类,并展开系统综述;从检索增强规划的基础范式出发,介绍任务规划中检索生成架构的一般作用,将现有工作抽象为全局节点规划与层级任务规划两种进阶范式,并进一步从时间、空间与安全三个维度对三种范式进行统一扩展,形成记忆增强RAG、多智能体协同RAG与对抗鲁棒RAG的跨范式演进框架;总结了目前检索增强生成技术辅助任务规划在实际应用上存在的挑战。
  • 基于大语言模型提示调优的教育文本分类方法
    戎璐, 喻梅, 赵东明, 王永刚, 张亚洲
    教育文本分类是智能教育的核心任务,广泛应用于教材内容分析、自动试题分类和教学资源推荐等场景。然而,与新闻、评论等通用文本相比,教育类文本具有术语密集、结构化知识丰富等特征,导致模型的语义理解与迁移学习难度显著增加。在低资源条件下,现有依赖大规模标注数据和监督微调的主流方法面临样本稀缺的困境。提出了一种适用于低资源与小样本场景的文本分类方法,基于提示调优策略引导预训练语言模型与大型语言模型的先验知识迁移。该方法设计了离散、连续与混合三类提示模板,并引入双向长短期记忆网络以建模提示词元之间的依赖关系,从而提升模型对任务语义的适配能力。在EduBooks、AGNews、MELD与IMDB四个典型文本分类数据集上的实验结果表明,该方法在F1指标上分别较八种主流基线方法提升了3.7%、3.3%、5.7%和1.1%。结果显示,所提方法在无需微调预训练模型参数的前提下,能够实现对不同类型文本的高效、准确分类,具有较强的通用性。消融实验进一步验证了冻结策略的合理性。
  • 指令-示例交叉进化的大语言模型提示词优化方法
    田一帆, 蔡满春, 石拓
    大语言模型(LLM)作为近年来人工智能领域的代表性突破之一,已广泛应用于学术、商业、生产、生活等各个领域,为各行各业提质增效带来强大动力。有研究表明,大语言模型的性能表现与提示词的质量密切相关。传统提示词多依赖于人工编写和试错,存在效率低、可扩展性差等缺陷。指令-示例交叉进化的大语言模型提示词优化方法(POIECE)的提出为上述问题提供了较好的解决方案。方法构造了一个指令空间与示例空间的双维度交叉进化框架,通过自反馈的梯度下降算法(GD),实现提示词空间的局部定向探索,通过遗传算法(GA)的交叉与变异机制,实现提示词空间的全局探索;同时引入文本相似度抑制、回译等策略,在提示词语义合理的基础上进一步扩展探索空间,确保迭代优化的持续有效性。POIECE方法在Ethos、Liar、Jailbreak数据集上分别进行了对比实验和消融实验,结果表明,POIECE方法相较传统提示词构建方法、现有提示词优化方法以及单独指令或示例的优化方法,取得了实验结果的显著提升,验证了方法的有效性。
  • 基于多任务微调大语言模型的重症医疗知识抽取方法研究
    王会勇, 苏秋雨, 张晓明
    随着重症医学的不断发展,医护人员在重症医疗实践过程中需迅速且准确地获取并应用专业知识,以应对复杂多变的临床情境。然而,目前重症医疗领域中的知识主要以非结构化文本呈现,缺乏系统化和结构化支持,难以满足临床决策对实时性和准确性的高要求。此外,传统知识抽取方法在处理非结构化数据时存在效率低下的问题。为此,提出了一种基于大语言模型(LLM)的多任务微调方法MCFT-KG,以实现大语言模型对重症医疗数据进行高效、准确且快速的抽取。该方法在专家指导下,依据重症数据的特性构建重症医疗本体;根据本体对天池数据集CMeIE和寻医问药网数据集进行调整,并利用大语言模型对数据集质量进行自动化评估;在本体约束的前提下,根据重症数据的特点,通过严格要求大语言模型,构建针对重症领域的多任务微调指令模板;将修改后的数据集与微调指令模板融合,经过扁平化和规范化处理形成基于重症领域的微调数据集;通过合理设置参数,利用LoRA实现指令微调。实验结果表明,该多任务微调大语言模型在重症医疗知识抽取任务中的准确率相较于基线模型有显著提升。
  • 基于多模态因果感知的大规模培训智能巡查与评估方法
    安宁, 许文静, 于重, 刘珠慧
    针对大规模干部教育培训质量评估中跨场景数据割裂、角色同质化及行为-认知映射衰减等核心问题,提出双轨融合因果评估框架(DICE-Frame)。该框架创新性构建“知识内化与实践转化”双层级时滞因果传导模型,通过自适应延迟机制桥接线上政策学习与线下能力转化链条,并设计了层级解耦权重矩阵实现职务特征自适应评估。核心技术突破体现为三级联立机制:在多模态感知增强层面,融合声纹分离技术与眼动-微表情动态关联解析群体互动质量,设计基于行为协同模式(停留时长/滚动速度/批注密度耦合)的学习深度量化算法;在混杂鲁棒因果推断层面,集成因果检验与政策规则先验库验证跨场景滞后效应,通过分层回归模型控制环境混杂因素;在跨域时空对齐层面,研发以政策术语为语义锚点的弹性时空规整算法,实现多源异构数据流精准同步。实证研究表明,该框架显著提升评估信效度(综合F1值提升11%,公平性KL散度降低62.5%),成功识别学用转化偏差模式并优化调训资源配置。相较于传统方法,创新贡献集中于两点:一是建立跨场景因果传导的解耦表示,突破评估同质化僵局;二是提出职务-能力解耦评估模型,生成多粒度干部能力动态画像。
  • 基于双图正则化的鲁棒非负矩阵分解聚类算法
    高海燕, 刘孟淑, 周改改, 钟灵
    非负矩阵分解(NMF)作为一种有效的数据表示和降维方法,已广泛应用于图像处理、文本聚类等领域。然而,标准的NMF仅能处理非负数据,对异常值和噪声敏感,并且未能充分捕捉隐藏在样本空间和特征空间中的流形信息。为了基于Semi-NMF、特征流形、样本流形和鲁棒性获得更好的聚类性能,提出了一种基于双图正则化的鲁棒非负矩阵分解聚类算法(DGRNMF)。利用[L2,1]范数增强NMF对异常值或噪声的鲁棒性,引入样本图和特征图正则化保留数据空间的局部几何结构,使降维后的表示不仅保持样本间的局部近邻关系,也保留特征间的内在关联,并对分解误差进行稀疏约束以降低异常值和噪声对全局优化目标的影响,同时采用半非负矩阵分解处理混合数据,从而扩展算法对真实世界中混合符号数据的适用性。从理论和实证分析验证了所提算法的收敛性。在12个公开数据集上进行了聚类实验,涵盖人脸图像、文本等多种数据类型。实验结果表明,DGRNMF算法优于其他经典的聚类算法,具有聚类精确性与鲁棒性的显著优势,为拓展NMF在实际复杂场景中的应用提供了新思路。
  • 基于重构算子的约束多任务差分演化算法
    李晰, 冯艳红
    基于知识迁移的演化多任务的研究吸引了越来越多的注意,然而大多数的多任务算法集中在求解无约束的优化问题,约束多任务算法比较少见。遵循“以简驭繁”的原则,设计了基于重构算子的约束多任务差分演化算法(CMTDE)。将差分演化算法的交叉算子重构为交叉迁移算子,完成任务内个体信息的重组和任务间知识的传递任务。将选择算子重构为复合竞争算子,采用不同的个体竞争方式进行约束处理,实现对“挖掘”和“探索”的平衡,负担知识传递任务的迁移个体采用可行性规则推选,可以传递目前搜索到的最有效信息;进化的后代个体采用ε-比较方式竞争,可以探索有潜力的区域。两种算子实现了多任务优化的信息迁移和约束优化的平衡目标与约束条件的功能。将设计的算法在约束多任务基准函数下测试,并与5个同类先进算法比较,结果表明,该算法虽然实现简单,但求解效率高且有良好的稳定性。此外,采用实际工程优化的最优潮流问题(OPF)对CMTDE验证,结果证明了它求解实际问题的有效性。
  • 多任务学习视角下的持续学习稳定性和可塑性均衡策略
    张咪咪, 冯翔, 虞慧群
    持续学习(CL)是一种先进的机器学习范式,其目标是模拟和优化人类学习机制,在其整个生命周期中增量地获取新知识、更新旧知识并有效地积累和利用知识。持续学习追求在保留历史任务知识(稳定性,S)的同时,灵活适应新任务(可塑性,P)。为此,模拟并分析了影响函数(IF)计算中的关键环节,分别获得了稳定性(S)和可塑性(P)的样例影响评估。进而,创新性地提出了Pareto SP算法,该算法通过求解双目标优化问题,将这两种样例影响融合起来,旨在找到对SP均达到帕累托(Pareto)最优的融合影响策略。这一策略采取多任务学习(MTL)中多目标优化的思想,将帕累托多任务学习算法推广至持续学习系统,通过并行解决具有不同权衡偏好的子问题,获取一组能够体现竞争任务间不同权衡的代表性帕累托最优解。尤为重要的是,该算法识别并解决了由二阶影响带来的潜在问题,这些影响可能放大重放缓冲区中的随机偏差,影响样本选择过程的有效性。为此,引入了一种新颖的目标选择策略,对核心集选择过程进行正则化,从而增强了核心集的选择效率与效果。实验结果显示,该算法在任务增量与类别增量两类持续学习基准数据集上,均展现出相较于当前最先进方法的显著优势。在有限的计算内存下,Pareto SP算法超越了最先进的方法,在3个不同的持续学习基准中持续实现超过2个百分点的显著改进。
  • 低秩注意力与对比对齐的深度多视图聚类
    温珍平, 孙颖慧, 李杏峰, 孙权森
    多视图聚类(MVC)作为无监督学习的一个关键研究方向,在处理大规模数据时,结合深度学习可以显示出其独特的优势。然而,三个关键挑战仍未得到解决:(1)如何有效地从海量数据中提取判别特征,同时减少过多的训练开销;(2)如何协调视图之间的异构特征表示;(3)如何保持多种模态之间的语义一致性。为了应对这些挑战,提出了一种基于线性注意力与簇对齐的框架(LRACA)。开发了一种标签驱动的锚点采样策略,其中类别感知K-means算法选择交叉视图对齐的锚点来指导训练方向的确定。为特征预训练设计了特定于视图的自编码器,并引入了一种动态低秩注意力机制,将键/值矩阵投影到线性子空间中,将注意力操作的计算复杂度从[O(N2)]降低到了[O(N)],同时显著增强特征区分性,并更新伪标签。提出了一种集群级对比学习范式,以聚类伪标签为纽带强化跨视图语义一致性,稳定和巩固了整个框架的聚类表现。对六个基准数据集的广泛实验表明,LRACA在聚类准确性、纯度和归一化互信息方面优于八个最先进的MVC基线,验证了其有效性和效率。
  • 结合多模态时序特征与变分编码的视频流行度预测算法
    水映懿, 张琪, 李根, 张士豪
    当前,视频流行度预测在社交媒体营销、智能广告投放等领域应用广泛,传统的基于多元线性回归、支持向量回归模型等的预测方法在处理数据多样性、捕捉预测的不确定性等方面存在一定的局限性。从多模态数据出发,提出了一种多模态时序变分自编码器(MTVAE)视频流行度预测模型。从视频数据中提取视觉、音频、文本和社交等多模态特征,利用变分自编码器对多模态特征进行降维并提取隐层信息,借助时间卷积网络挖掘长序列特征的内在联系,同时在网络层面添加了残差连接,用于增强模型的深度表达能力和训练稳定性。运用贝叶斯专家乘积系统进行多模态特征融合与预测判别。构建了基于新浪微博平台的全过程多属性视频流行度预测数据集(WPMAD),弥补了当前数据集在模态多样性、时序完整性等方面的不足。大量的实验结果表明,MTVAE模型在WPMAD数据集上的预测准确率提升了3.93个百分点,在公开数据集MicroLens上的预测准确率也有所提升,较之于当前已存在的预测方法,性能表现更为优异,为社交媒体平台内容推荐、舆情监测等应用方向提供了创新性的技术支持。
  • 用于行人轨迹预测的多头注意力增强图网络
    张霄雁, 张萌, 周宗润, 孟祥福, 方金凤
    行人轨迹预测对自动驾驶与智能交通系统至关重要,其预测精度受到人类行为的高度随机性、动态交互性及多模态分布等因素的显著影响。为应对上述挑战,提出一种基于多头注意力增强图网络的行人轨迹预测框架,通过动态交互建模与多阶段优化实现高精度预测。该方法以构建多关系时空图(MR-Graph)为基础,利用多头注意力机制(MHA)显式分离社交、运动与环境交互特征,从而提升了模型对复杂场景的建模能力。为进一步提高预测的多样性与合理性,设计了一种控制点驱动的高斯剪枝策略,通过混合密度网络生成多模态终点假设,并结合置信度动态剪枝机制,有效抑制了异常行为的影响。此外,轨迹优化被设计为“假设-引导-修正”三阶段轨迹优化机制,融合社交感知插值与时空修正向量场,实现了平滑且符合物理约束的高质量轨迹生成。基于ETH/UCY等公开数据集的实验结果表明,所提方法在建模复杂交互关系和生成符合社会规范的轨迹方面展现出明显优势,特别是在处理密集人群场景和突发行为预测时表现突出,为智能系统的安全决策提供了可靠的技术支持。
  • 面向方面级多模态情感分析的双交互异构图神经网络模型
    杨力, 文腾, 廖远, 姜春雨
    当前方面级多模态情感分析(MABSA)中普遍存在图像特征利用不足、模态间交互机制薄弱的问题。为此,提出一种新颖的图像双交互异构图神经网络模型(DIGN),以提升图像语义理解能力与跨模态特征融合效率。使用ResNet50和RoBERTa分别提取图像与文本的初始语义特征,并结合多头注意力机制增强文本的上下文表达;设计图卷积双交互模块,构建图像-文本与图像-方面两个异构图结构,利用GCN分别建模其语义关系,深入挖掘图像的局部与目标相关语义信息;引入注意力感知辅助模块,将两种交互特征通过多头注意力机制进行融合,并加入残差连接和归一化增强特征一致性与稳定性;提出多模态语义融合模块,结合全局注意力机制(GAM)与多层感知机(MLP),动态调控通道和特征维度权重,实现交互特征与原始方面特征的深层融合;通过Softmax函数完成情感分类任务。在Twitter-2015与Twitter-2017两个数据集上进行的对比实验和消融实验验证了该模型在精确度、鲁棒性及泛化能力上的显著提升。
  • 面向私域运维问答的多任务监督微调方法
    薛建新, 张智睿, 高梦琦, 吴怜颐, 李梓欣, 常曦
    随着大模型技术的迅速发展,基于大模型的智能问答系统已经成为企业运维中不可或缺的核心工具。然而,现有的智能问答系统通常依赖固定的数据集和预定义的规则,这使得其在应对私域运维知识的实时更新时表现出较低的灵活性和适应性。因此,提出一种面向私域运维问答的多任务监督微调方法Privofine。该方法的核心思想是基于先验知识将常见的运维问答问题划分为四种类型:设备安装、网络配置、性能优化和失效处理。通过对这些类型的运维问题进行分析,显式表达用户不同的提问意图,并设计相应的提示模板,从而自动生成并优化多类型问答对。这些问答对为后续的模型训练提供丰富的私域运维问答样本。在模型训练过程中,Privofine方法将生成的问答样本解耦为三个子任务:判断任务、关联任务和回答任务。每个子任务通过监督微调的方式共同作用于基座大模型,优化其在处理私域运维文档时的能力。为验证Privofine方法的有效性,在2024年CCF国际AIOPS挑战赛中的5G智能运维数据集上进行实验。结果表明,Privofine在性能上显著优于传统的低秩适应和领域特定微调方法。
  • 融合全局感知与多尺度协同的YOLO-Mamba违禁品检测方法
    生春雷, 刘成恺, 李泽龙, 卢树华
    针对X光安检图像空间多尺度变化、目标重叠遮挡以及小尺寸违禁品易漏检误检等问题,提出了一种融合全局感知与多尺度协同的YOLO-Mamba违禁品检测方法。以YOLOv10为基线,在主干部分引入门控结构感知块(GSSBlock)改进的状态空间模型,优化空间信息建模能力,有效关注关键区域特征。设计多残差连接池化结构(M-RCP)提升对全局信息和边缘信息的感知能力,更好地区分X光图像前后景,降低复杂背景信息带来的干扰。在模型颈部设计深度特征金字塔网络(DFFPN),采用双向跨尺度和多层级交互的方式加强特征融合,增强多尺度特征感知能力,改善目标漏检误检问题,其中利用双支路深度可分离卷积(DWConv)设计融合模块,拾取不同感受野的信息,有效捕捉小尺寸违禁品细节特征,同时保持较低的计算量。所提方法在OPIXray、HIXray和SIXray等3种公开数据集上进行了训练和测试,mAP50分别达到94.0%、82.9%和94.6%,较基线分别提升5.7、2.7和4.6个百分点,实验结果优于诸多先进算法,且参数量较小,较好地兼顾了检测准确率与速率,是一种性能较为优异的违禁品检测方法。
  • 基于双分支并行编码网络的医学图像分割模型
    吴灿辉, 王乐, 毛国君, 饶艳莺, 苏宇征
    在磁共振(MRI)和计算机断层成像(CT)等医学图像分割任务中,人体器官的边缘模糊、小器官难识别以及腹部多器官重叠等问题显著制约了分割精度。同时,主流方法如纯卷积神经网络(CNN)难以建模长距离依赖,而纯Transformer对局部细节捕捉不足且计算开销大。针对上述问题,利用全局特征与局部特征之间的互补性,提出双分支编码器DPEncoder,并在此基础上构建了医学图像分割模型PMCNet。DPEncoder采用双分支并行结构:一个分支基于视觉状态空间模型捕捉图像的全局上下文信息与长距离依赖关系;另一分支则利用卷积神经网络提取精细的局部特征和空间细节,并通过通道多尺度卷积特征融合模块有效增强了模型的复杂特征表征能力,很好地实现了全局与局部信息的互补融合。PMCNet基于U型结构,由DPEncoder编码器、对应的解码器以及跳跃连接共同组成,能够实现对MRI或CT切片的高精度分割。实验结果表明,所提出模型在Synapse、ACDC和AMOS2022数据集上的Dice指标分别较基于Mamba的模型Swin-UMamba提高了4.06、1.82和2.74个百分点,并且在与其他先进模型的对比中也展示出了显著的优势。
  • 面向面部动作单元的自适应图注意力微表情检测网络
    马飞, 安佳祺, 杨飞霞, 徐光宪
    微表情检测旨在视频中定位幅度微弱、时间短暂的表情区间。其难点在于有效提取面部区域间的动态关联特征和多尺度时序特征,进而精准捕捉面部各区域微小动作之间的关联。针对这些问题,提出了一种融合自适应图注意力和多尺度可变空洞卷积的微表情检测网络(AG-DDNet)。通过引入参数可学习矩阵来实现键值对的特征变换,通过计算面部区域特征向量间的相似度得到动态邻接矩阵,并结合图注意力机制计算区域间权重系数,实现特征的动态融合;采用了多尺度可变空洞卷积模块,通过自适应池化与卷积组合的预测器生成动态感受野,从而实现多尺度的特征提取;引入基于Fisher信息矩阵的自然梯度优化机制,通过Fisher Adam优化器有效捕捉参数空间的几何结构信息,实现学习率的精确自适应调整,从而显著增强了模型对微表情和宏表情的协同检测能力。在微表情检测任务中,该算法与同类代表性算法相比,在CAS(ME)2数据集和SAMM Long Videos数据集上的性能分别提升了54.20%和20.11%。与最新算法相比,两个数据集上的提升幅度分别为38.43%和6.81%,有效证明了该方法在长视频微表情检测任务上的优越性能。
计算机科学与探索封面

中文名称:计算机科学与探索

杂志社官网:http://fcst.ceaj.org/

英文名称:Journal of Frontiers of Computer Science and Technology

语言:中文

类别:自动化技术、计算机技术

主 编:周志华

创刊时间:2007

出版周期:月刊

国内刊号:11-5602/TP

国际刊号:1673-9418

出版地:北京市

咨询工作人员

联系我们

  • 地址:北京市海淀区北四环中路211号
  • 电话:(010)89056056
  • E-mail:fcst@vip.163.com