计算机科学与探索杂志2025年第2期
-
- 物理引导的深度学习研究综述:进展、挑战和展望
- 陈冲, 朱啸宇, 王芳, 许雅倩, 张伟
- 尽管深度学习在处理非线性高维问题时表现出强大的能力,但在复杂科学与工程问题中仍面临诸多挑战,如高昂的计算成本、大量的数据需求、难以解释的黑盒特性,缺乏对物理规律的建模能力等。为此,近年来涌现了一种新的框架——物理引导深度学习,通过将领域内的物理知识融入深度学习模型的构建和训练过程中,旨在增强模型的性能、可解释性及其物理一致性。对国内外关于物理引导深度学习的相关工作进行了全面梳理与分析。介绍了物理引导深度学习框架的主要动机与理论基础。对物理信息组合与物理信息融合两种模式进行了详细讨论,总结了各方法的特点、局限性与应用场景。分析了物理引导深度学习在多个领域应用中的表现,并从计算复杂性与优化收敛问题、控制方程偏离问题、观测数据依赖问题与知识融合困难问题四个方面探讨了该框架目前面临的挑战,并基于此展望该领域未来的发展方向,以期为研究者提供借鉴思路及多维度视角。
-
- 时序知识图谱构建研究综述
- 陆佳民, 张晶, 冯钧, 安琪
- 知识图谱作为连接数据、知识和智能的桥梁,已被广泛应用于辅助搜索、智能推荐、问答系统、自然语言处理等多个领域。然而,随着应用场景的不断拓展,传统静态知识图谱逐渐暴露出在处理动态知识方面的局限性。时序知识图谱的出现弥补了这一缺陷,它将时间信息融入图谱结构,能够更准确地表示知识的动态变化。对时序知识图谱的构建进行了全面的研究,介绍了时序知识图谱的概念,明确了其在处理动态知识时的价值。解析了时序知识图谱构建流程,将其核心过程划分为知识抽取、知识融合和知识计算三大环节。对每个阶段进行了梳理,明确了任务定义,总结了研究现状,并探讨了大语言模型在这些任务中的应用。在知识抽取阶段,重点关注命名实体识别、关系抽取和时间信息抽取;在知识融合阶段,探讨了实体对齐和实体链接;在知识计算阶段,聚焦于知识推理。深入分析了每个阶段面临的挑战,并针对特有挑战展望了未来的研究方向。
-
- 图像重定向及客观质量评价方法综述
- 马倩, 董武, 曾庆涛, 张艳, 陆利坤, 周子镱
- 图像重定向方法通过改变图像的尺寸与宽高比,使生成的图像在不同的显示设备上均有良好的兼容性。当前已有的图像重定向方法虽然已经取得了一定的研究成果,但它们仍不能适用于所有类型的显示设备。在图像重定向过程中易产生人工失真,降低了用户的视觉体验,针对不同的失真类型,需要使用不同的质量评价方法来准确预测重定向结果图像的质量。对目前图像重定向方法及客观质量评价方法的研究进展均进行了较为全面的总结。总结了重定向方法,分为传统的基于内容感知的图像重定向方法和基于深度学习的图像重定向方法,并分析了这两类方法的优缺点;重点阐述了图像重定向客观质量评价方法的特点,包括基于底层特征的方法和基于多层次特征的方法,质量评价方法对图像重定向方法的优化与发展至关重要;列举了现有的三个数据集,并对不同的图像重定向客观质量评价方法的性能进行了分析比较;根据现阶段图像重定向领域存在的问题,对该方向的未来发展趋势进行了展望。
-
- 神经机器翻译中课程学习研究综述
- 胡春月, 斯琴图, 王斯日古楞
- 课程学习作为一种新兴技术,近年来逐渐受到关注,它符合人类的学习习惯,由简到难、由浅至深。其核心思想是让模型从简单的、基础的概念开始学习,逐渐过渡到更复杂、更高层次的内容。在神经机器翻译中,课程学习作为一种训练策略,旨在帮助模型按照一定规律学习。课程学习现已被证明可以加速模型收敛,提高模型翻译质量和稳定性。从机器学习的角度介绍了课程学习的定义及其基础框架,并进一步探讨了课程学习在神经机器翻译领域中的应用。从样本难度评估与模型训练调度策略两个方面,详细阐述了预定义课程学习和动态课程学习两种方法。预定义课程学习通过事先确定样本的难度顺序,引导模型从简单到复杂的任务逐步学习;而动态课程学习则依据模型当前的学习状态动态调整样本的难度,提供了更灵活的训练方式。分析了课程学习在神经机器翻译领域的未来研究趋势,并提出了三个值得进一步探索的研究方向。
-
- 基于深度学习与大语言模型的序列推荐研究进展
- 徐凤如, 李博涵, 胥帅
- 推荐系统旨在解决传统信息检索系统中信息过载的问题,并且致力于向用户推荐个性化感兴趣的内容。人与系统交互的行为具有一定的顺序性,在提供推荐时需要将其纳入考虑,这就是序列推荐系统。序列推荐系统通过分析用户行为序列,捕捉用户偏好的动态变化,为电子商务、社交媒体和在线视频等多个领域提供精准的个性化推荐服务。全面阐述了序列推荐系统的当前研究进展,并探讨了其在个性化推荐领域的重要性与应用潜力。定义了序列推荐的研究问题,明确了推荐序列的核心目标和挑战。详细分类并总结了序列推荐的主要技术,包括:基于马尔可夫链的传统方法,该方法在建模用户行为序列时依赖于状态转移概率;深度学习驱动的方法,利用神经网络模型来捕捉长期依赖关系与复杂模式;混合模型方法,结合多种算法来增强推荐系统的准确性和鲁棒性;以及新兴的基于大语言模型的方法,这些方法通过引入预训练的大语言模型来提升对用户行为和推荐内容的理解能力。展望了未来的研究方向,强调了上下文感知、多模态融合、因果推断、垂直领域特定大语言模型以及缓解幻觉问题等研究点的重要性。
-
- SbSER:基于外部子图生成的大语言模型分步增强推理框架
- 冯拓宇, 王刚亮, 乔子剑, 李伟平, 张雨松, 郭庆浪
- 大语言模型(LLM)自问世以来在各种任务中取得了显著的成功,尤其是在机器翻译、文本生成、问答系统等任务中的卓越表现,它们的应用也迅速扩展到了更多复杂的任务中。尽管LLM在多种任务中展现了强大的能力,但在需要深入推理和逻辑推导的任务场景中,它们仍然面临显著的挑战。由于模型训练过程中依赖大量的文本数据,往往难以全面涵盖所有领域的专业知识,导致LLM在处理特定领域问题时容易产生“幻觉”问题,即输出不准确或与实际知识不符的答案。该问题可以通过在大语言模型推理中引入外部知识图谱(KG)来辅助解决。提出基于外部子图生成的大模型分步增强推理框架(SbSER)。通过生成清晰的子图Schema引导大模型完成准确的语义解析以完成问题到逻辑查询语句的转换,将知识三元组导入图数据库中以完成准确的知识查询,通过采用直接查询推理和联合推理两种推理方式实现问题的最终增强推理输出。实验表明,提出的SbSER在多个数据集上取得优异结果,显著提升了LLM在解决复杂问题上的能力。
-
- 基于大语言模型的CIL-LLM类别增量学习框架
- 王晓宇, 李欣, 胡勉宁, 薛迪
- 在文本分类领域,为了提升类别增量学习模型的分类准确率并避免灾难性遗忘问题,提出了一种基于大语言模型(LLM)的类别增量学习框架(CIL-LLM)。CIL-LLM框架通过抽样和压缩环节选取具有代表性的样本,利用较强语言理解能力的LLM基于上下文学习提炼关键技能,以这些技能作为分类的依据,从而降低了存储成本;采用关键词匹配环节选取最优技能,以此构建提示词,引导下游弱LLM进行分类,提高了分类的准确性;根据基于知识蒸馏的技能融合环节,不仅实现了技能库的有效拓展和更新,还兼顾了新旧类别特性的学习。对比实验结果表明,在THUCNews数据集上的测试中,与现有的L-SCL方法相比,CIL-LLM框架在所有任务上的平均准确率提升了6.3个百分点,性能下降率降低了3.1个百分点。此外,在消融实验中,经由CIL-LLM框架增强的SLEICL模型相比于原有模型,所有任务的平均准确率提高了10.4个百分点,性能下降率降低了3.3个百分点。消融实验进一步验证了提出的样本压缩、关键词匹配和技能融合环节均对模型的准确率和性能下降率产生了优化效果。
-
- 基于大语言模型多轮对话的推荐模型研究
- 常保发, 车超, 梁艳
- 近来结合大语言模型的推荐方法在提高推荐准确度和增强用户体验等方面展现出明显的优越性。然而这些方法存在没有充分利用用户信息、仅使用单轮对话无法学习用户多次交互的行为特征、大语言模型与推荐系统之间存在巨大的语义差异等问题。针对这些问题,提出了一个基于大语言模型多轮对话模式的推荐模型。该模型利用矢量量化技术将用户信息转化为用户索引,并通过微调任务把大语言模型的语言语义与推荐系统的协作语义整合,不仅学习了用户特征而且缓解了语义差异问题;将用户索引与历史交互数据拼接成提示语,再经过多轮对话机制进行推荐微调,从而学习用户交互行为之间的特征。模型在亚马逊Instructions、Arts和Games三个数据集上进行实验,结果表明模型在命中率(HR)和归一化折损累计增益(NDCG)两个评价指标上优于对比基线算法,在三个数据集上与最优对比基线算法相比,HR平均提升10.53%,NDCG平均提升5.10%,证明了模型的有效性。
-
- 改进RRT-Connect算法的机器人路径规划研究
- 陈志澜, 唐昊阳
- 针对标准RRT-Connect算法在路径规划中存在的路径冗长、转折较多和区域通过性欠缺问题,提出了一种新的改进RRT-Connect算法(TRRT-Connect)。采用改进RRT算法搜索并添加一个中间根节点,实现同时扩展四棵随机树,加快算法收敛速度。在随机点的选取上使用目标偏置策略,在新节点的生成上叠加引力场,同时融合贪婪搜索策略。结合新的动态步长调节方法,通过识别扫描区域内障碍物的个数动态选择合适的步长。对生成的初始路径使用双向剪枝优化方法,加快剪枝效率,剔除路径上的冗余节点。对路径转折处进行光滑处理,减少路径转折。在三种不同环境地图中进行仿真对比实验,结果表明,TRRT-Connect算法与标准RRT-Connect算法相比较,在路径长度、迭代次数和节点数上有较大改善,在密集障碍物区域的通过性较好,路径更加光滑且无转折,证明了该算法的有效性。同时将TRRT-Connect算法应用于现场实例仿真中,使得移动机器人的运输路径长度相较于传统固定路径降低了15.4%,且路径光滑,进一步验证了该算法的实用性。
-
- 多模态特征增强的双层融合知识推理方法
- 荆博祥, 王海荣, 王彤, 杨振业
- 现有的多模态知识推理方法大多采用拼接或注意力的方式,将预训练模型提取到的多模态特征直接进行融合,往往忽略了不同模态之间的异构性和交互的复杂性。为此,提出了一种多模态特征增强的双层融合知识推理方法。结构信息嵌入模块采用自适应图注意力机制筛选并聚合关键的邻居信息,用来增强实体和关系嵌入的语义表达;多模态嵌入信息模块使用不同的注意力机制关注不同模态数据的独有特征,以及多模态数据间的共性特征,利用共性特征的互补信息进行模态交互,以减少模态间异构性差异;多模态特征融合模块采用将低秩多模态特征融合和决策融合相结合的双层融合策略,实现了多模态数据在模态间和模态内的动态复杂交互,并综合考虑每种模态在推理中的贡献度,得到更全面的预测结果。为了验证方法的有效性,分别在FB15K-237、DB15K和YAGO15K数据集上进行了实验。结果表明:该方法相比多模态推理方法,在FB15K-237数据集上MRR和Hits@1分别平均提升3.6%和2.2%;相比单模态推理方法,MRR和Hits@1分别平均提升13.7%和14.6%。
-
- 基于SDNE嵌入表达的深度学习跨网络身份关联方法
- 程佳琳, 袁得嵛, 孙泽宇, 陈梓彦
- 挖掘海量虚拟身份之间的关联关系,确定不同虚拟身份的同一性对于用户精准推荐、异常用户检测、舆情管控等具有重要意义。为了判别多个不同虚拟网络身份是否为同一个人所拥有,提出了一种基于SDNE嵌入表达的深度学习算法(eSUIL)来解决跨网络用户身份关联的问题,并构建了一个跨网络用户身份关联统一框架。对社交网络中的用户关系进行扩展,借鉴SDNE模型的思想对不同网络中的用户节点进行嵌入学习,将用户节点映射到低维向量空间中。使用深度神经网络构造映射函数得到用户节点的准确表达。计算用户节点间的相似度以进行用户对齐,从而实现跨社交网络的用户身份关联。为了提高身份关联的准确性,还引入用户名信息作为辅助判断。在真实社交网络数据集和人工合成网络数据集上分别进行实验验证,实验结果表明,对比基线算法PALE、CLF以及Deeplink,在准确率和F1值上均提高了8个百分点以上,表明提出的eSUIL算法在身份关联方面具有优异的性能,能够准确关联不同网络中的同一用户身份。
-
- 改进YOLOv8模型实现多类型肺结节检测
- 包强强, 唐思源, 李擎乾, 王乃钰, 杨敏, 谷宇, 赵金亮, 高婧博, 王嘉欣, 曲禹涵
- 目前,肺结节检测通常是对实性肺结节的单一型检测,不同类型肺结节对应多种肺癌类型,多类型检测有助于提高肺癌的整体检出率,提升治愈率。为实现对实性、混合型、磨玻璃型多类型肺结节检测,对YOLOv8模型进行针对性改进。提出RepViTCAA模块对主干部分的C2f模块进行改进,提升微小肺结节检测精度并对模型进行轻量化设计。提出ECLA-HSFPN模块,重建模型特征融合部分,提升尺度不固定肺结节检测精度。将KAN网络融入模型当中,基于KAN网络非线性特征学习能力强的特性,进一步提升微小肺结节检测精度,增强模型泛化能力。基于Inner-IoU辅助框思想,对CIoU损失函数进行改进,进一步解决肺结节尺度不固定问题,提升模型检测精度。在LUNA16数据集中进行测试,改进模型相比原模型及YOLOv9、RT-DETR等主流模型各项评价指标均有提升。在4种类型(实性、磨玻璃型、混合型、微小型)肺结节的专项数据集中测试,改进模型检测效果优于原模型。在LUNA16与本地医院的混合数据集中进行泛化性测试,改进模型具有较强的泛化能力。针对多类型肺结节检测任务,模型的改进较为有效,可以准确检测不同类型的肺结节。
-
- 基于改进YOLOv8算法的鱼眼图像下行人检测
- 朱玉敏, 孙光灵, 缪飞
- 针对现有目标检测算法在鱼眼图像下行人检测中存在定位不准确、检测精度不足等问题,提出了一种面向鱼眼图像检测的YOLOv8改进算法。该方法通过加入角度参数,设计了ProbIoU-r算法,利用缩放因子调整角度差异对损失的影响,增强模型在梯度计算中对边界框角度偏移的关注,解决了原始IoU在旋转目标检测定位不精确、边界框拟合效果差等问题,使YOLOv8网络模型具有更好感知旋转目标的能力。为提高模型对鱼眼图像失真目标的特征提取能力同时提升检测精度,提出以多尺度卷积和注意力机制为分支的Parnet-gcs模块,通过不同卷积核的DWConv提取不同尺度的特征信息,并结合CA和SA模块以增强模型特征表达能力。实验采用公开的鱼眼图像数据集WEPDTOF,改进后算法相比原始YOLOv8s检测精度mAP0.50:0.95增加了2.3个百分点;相比YOLOv8m算法参数量减少了38.8%,同时精度mAP0.50:0.95也高出0.5个百分点,说明基于YOLOv8s改进后的算法能够更好适用于鱼眼图像下行人检测任务。
-
- 局部-全局特征相互补偿的伪装目标检测方法
- 何文昊, 葛海波
- 在伪装目标检测(COD)领域中,最新提出的方法主要利用伪装目标的局部特征完成COD任务,输出的预测图存在目标轮廓粗糙和对象不完整的问题。针对上述问题,提出了基于局部-全局特征相互补偿的伪装目标检测方法,利用局部特征与全局特征相互补偿进行伪装目标的检测。设计一个非局部特征增强模块(N-LFEM),使用非局部机制来交互相邻局部区域,增强局部特征表达。构建一个局部-全局特征交互模块(L-GFIM),平均局部特征得到全局特征,执行局部特征与全局特征的相互补偿。设计一个局部-全局特征交叉协方差模块(L-GFCCM),通过语义对齐和交叉协方差获取空间指标定位伪装目标所在区域,选取相似性最高的特征图输出。在3个公开数据集上的实验表明,该算法优于其他8个最新模型。在COD10K数据集上,平均绝对误差(MAE)达到了0.028。
-
- 融合子图选择和邻域过滤的信贷欺诈审核方法
- 唐小勇, 王浩东
- 信贷欺诈审核是金融欺诈检测领域的研究热点与难点,尤其是大规模金融信贷交易场景下的欺诈检测问题。然而,信贷欺诈审核过程中的欺诈者类节点数量分布极不平衡和欺诈者节点伪装自身问题一直是其所面临的重要挑战。基于此,面向大规模互联网金融信贷动态图提出融合重构子图选择和强化邻域过滤的图神经网络(RSRF-GNN)模型,以提高信贷欺诈审核的有效性。该方法从数据角度定义欺诈者数量分布不平衡和欺诈伪装问题。依据节点类别和出入度信息设计重构平衡子图选择模块以解决欺诈者数量分布不平衡问题。针对欺诈伪装问题,设计动态过滤邻域节点嵌入的邻域过滤模块。设计了边聚合模块聚合中心节点的邻域边嵌入,进一步提高中心节点邻域嵌入信息表达效果。为验证RSRF-GNN模型的有效性,在真实数据集DGraph-Fin上进行实验,结果表明RSRF-GNN模型在有效性方面比现有模型有较大提升。RSRF-GNN模型在AUC上提高了5~8个百分点,AP分数表现提高了18~29个百分点,模型性能优势显著。
-
- 利用GRU双分支信息协同增强的长尾推荐模型
- 钱忠胜, 肖双龙, 朱辉, 王晓闻, 刘金平
- 长尾现象在序列推荐系统中长期存在,包括长尾用户和长尾项目两个方面。虽然现有许多研究缓解了序列推荐系统中的长尾问题,但大部分只是单方面地关注长尾用户或长尾项目。然而,长尾用户和长尾项目问题常常同时存在,只考虑其中一方会导致另一方性能不佳,且未关注到长尾用户、长尾项目各自的信息匮乏问题。提出一种利用 GRU双分支信息协同增强的长尾推荐模型(long-tail recommendation model utilizing gated recurrent unit dual-branch information collaboration enhancement, LT-GRU),从用户与项目两个方面共同缓解长尾问题,并通过协同增强的方式丰富长尾信息。该模型由长尾用户和长尾项目双分支组成,每个分支分别负责各自的信息处理,并相互训练以充实另一方的信息。同时,引入一种偏好机制,通过演算用户与项目的影响因子,以动态调整用户偏好与项目热度,进一步缓解长尾推荐中信息不足问题。在Amazon系列的6个真实数据集上与6种经典模型进行实验对比,相较于长尾推荐模型中最优的结果,所提模型LT-GRU在HR与NDCG两个指标上分别平均提高2.49%、3.80%。这表明,在不牺牲头部用户和热门项目推荐性能的情况下,有效地缓解了长尾用户和长尾项目问题。
-
- 基于原型解耦的虚假人脸检测和生成方法溯源
- 钱菲, 李威, 陈鹏, 陈浩然, 谢礼鹏, 刘荔园
- 虚假人脸检测和生成方法溯源旨在判断图像或视频中人脸是否经过深度伪造技术篡改或合成,并进一步分析虚假人脸背后所使用的深度伪造方法。然而,现有工作多将这两个任务作为独立的研究方向进行探索,或者采用串行的方法先检测再溯源,难以满足实际的业务需求。针对这一问题,提出了一种基于原型解耦的虚假人脸检测和生成方法溯源框架,旨在使用单一模型同时进行虚假人脸真假二分类和深度伪造生成方法溯源任务。该框架由一个特征编码器、一组可学习的原型集合、一个原型更新模块以及一个检测和溯源模块组成。通过原型更新模块解耦并学习原型集合中的真实原型、伪造独有原型和伪造共享原型。由检测和溯源模块计算样本特征与所有原型的相似度,再同步进行虚假人脸检测和深度伪造生成方法溯源任务。在FaceForensics++和ForgeryNet数据集上的实验结果表明,相比现有的虚假人脸检测与生成方法溯源工作,所提出的模型实现了更优的性能。
-
- 结合图同构和混合阶残差门控图神经网络的会话推荐
- 王永贵, 于琦
- 基于会话推荐的目的是依据当前会话的先前动作来预测用户的下一个动作。针对现有基于图神经网络的会话推荐模型存在的不足之处,提出一种结合图同构和混合阶残差门控图神经网络的会话推荐模型(GIHR-GNN)。使用图同构网络聚合相邻项目的特征向量,有效融合全局和局部信息,解决图神经网络善于捕获节点之间的局部连接而忽略全局信息的问题,并通过门控融合函数聚合用户的长短期兴趣以更好地捕捉用户兴趣的动态变化。使用混合阶门控图神经网络对位置嵌入向量进行处理以捕获用户长时间后重新交互所反映出的用户意图,并在此基础之上添加残差模块,解决深层网络的退化问题。将未去噪和去噪后的用户长期兴趣表示进行对比学习,缓解了数据稀疏和噪声干扰的问题。在Tmall和RetailRocket两个数据集上进行多次实验,并与先进基线模型进行比较,结果表明该模型在Tmall数据集上P@20指标和MRR@20指标至少提升了3.26%和10.33%,在RetailRocket数据集上P@20指标和MRR@20指标至少提升了0.55%和2.57%,证明了GIHR-GNN模型的有效性。
-
- 面向CPS时空规则验证制导的安全强化学习
- 印婵, 祝义, 王金永, 陈小颖, 郝国生
- 深度强化学习是目前信息物理融合系统(CPS)决策中常用的一种方法。然而,当面对未知环境和复杂任务时,基于黑盒的深度强化学习方法在系统的安全性和奖励函数设置的可解释性方面存在不足。针对上述问题,提出了一种形式化时空规则验证制导的安全强化学习方法。提出了时空规则通信顺序进程(CSR-TCSP)对系统进行建模,并结合时空规约语言(STSL)和模型检测工具FDR对进程代数模型进行验证。利用系统环境模型形式化奖励状态机的结构,提出了时空规则奖励状态机(STR-RM)以指导强化学习中奖励函数的设置。此外,为了监测系统的运行并确保输出决策的安全性,设计了一个监控器及安全动作决策算法以获得更安全的状态行为策略。通过一个自动驾驶系统中的避障与变道超车实例,证明所提方法的有效性。
-
- 高精度可扩展的密态隐私保护语音分类
- 王雷蕾, 宋考, 张媛媛, 毕仁万, 熊金波
- 为解决现有全同态加密技术在语音分类任务中计算效率和分类准确率均较低的挑战,提出一种高精度可扩展的密态隐私保护语音分类PPSC方案。设计基于CKKS全同态加密技术两方服务器协同的安全乘法协议,因避免使用昂贵的自举操作,可有效提升深层次密文乘法的计算效率,从而使得方案可扩展到更深层次的神经网络;基于上述架构设计安全指数、安全倒数以及安全比较等安全非多项式协议,相较于多项式近似拟合非多项式运算的方法,在提高计算精度的同时,降低了计算开销。安全实现卷积层、ReLU层、平均池化层、全连接层、Softmax层等PPSC方案的基本模块,确保语音数据、语音模型和中间计算结果的隐私性。从有效性和安全性等维度对PPSC方案进行了详尽的理论分析,证明安全乘法协议在更深层次的乘法运算中具有更高的运算效率。在Speech Command Database语音数据集上的实验结果表明,PPSC方案可以在保护数据和模型参数隐私的情况下实现有效的语音分类,其准确率相比于HEKWS方案提高3.57个百分点。
