计算机科学与探索杂志2023年第1期
-
- 人脸视频深度伪造检测方法综述
- 张璐, 芦天亮, 杜彦辉
- 深度伪造(deepfake)技术的非法应用会对社会稳定、个人名誉甚至国家安全造成恶劣影响,因此针对人脸视频的深度伪造检测成为计算机视觉领域中的难点与研究热点。目前该领域的研究建立在传统人脸识别与图像分类技术基础上,通过搭建深度学习网络判别真伪,但存在数据集质量不一、多模态特征如何有效结合、模型泛化能力较差等问题。为进一步促进深度伪造检测技术的发展,对当前各类人脸视频深度伪造算法进行了全面总结,并对已有算法进行了归类、分析、比较。首先,主要介绍人脸视频深度伪造检测数据集;其次,对近三年主要的伪造视频检测方法进行总结,以特征选择为切入点,从空间特征、时空融合特征、生物特征的角度对各项检测技术进行分类整理,并对基于水印与区块链等非主流检测方法进行介绍;然后,从特征选择、迁移学习、模型设计与训练思路等方面介绍了各类检测方法所呈现出的主流趋势;最后,对全文进行总结并对未来技术发展进行展望。
-
- 图神经网络应用于知识图谱推理的研究综述
- 孙水发, 李小龙, 李伟生, 雷大江, 李思慧, 杨柳, 吴义熔
- 知识推理(KR)作为知识图谱构建的一个重要环节,一直是该领域研究的焦点问题。随着知识图谱应用研究的不断深入和范围的不断扩大,将图神经网络(GNN)应用于知识推理的方法能够在获取知识图谱中实体、关系等语义信息的同时,充分考虑知识图谱的结构信息,使其具备更好的可解释性和更强的推理能力,因此近年来受到广泛关注。首先梳理了知识图谱和知识推理的基本知识及研究现状,简要介绍了基于逻辑规则、基于表示学习、基于神经网络和基于图神经网络的知识推理的优势与不足;其次全面总结了基于图神经网络的知识推理最新进展,将基于图神经网络的知识推理按照基于递归图神经网络(RecGNN)、卷积图神经网络(ConvGNN)、图自编码网络(GAE)和时空图神经网络(STGNN)的知识推理进行分类,对各类典型网络模型进行了介绍和对比分析;然后介绍了基于图神经网络的知识推理在医学、智能制造、军事、交通等领域的应用;最后提出了基于图神经网络的知识推理的未来研究方向,并对这个快速增长领域中的各方向研究进行了展望。
-
- 小样本目标检测研究综述
- 刘春磊, 陈天恩, 王聪, 姜舒文, 陈栋
- 目标检测是计算机视觉方向的热点领域,其通常需要大量的标注图像用于模型训练,这将花费大量的人力和物力来实现。同时,由于真实世界中的数据存在固有的长尾分布,大部分对象的样本数量都比较稀少,比如众多非常见疾病等,很难获得大量的标注图像。小样本目标检测只需要提供少量的标注信息,就能够检测出感兴趣的对象,对小样本目标检测方法做了详细综述。首先回顾了通用目标检测的发展及其存在的问题,从而引出小样本目标检测的概念,对同小样本目标检测相关的其他任务做了区分阐述。之后介绍了现有小样本目标检测基于迁移学习和基于元学习的两种经典范式。根据不同方法的改进策略,将小样本目标检测分为基于注意力机制、图卷积神经网络、度量学习和数据增强四种类型,对这些方法中使用到的公开数据集和评估指标进行了说明,对比分析了不同方法的优缺点、适用场景以及在不同数据集上的性能表现。最后讨论了小样本目标检测的实际应用领域和未来的研究趋势。
-
- 深度学习的三维人体姿态估计综述
- 王仕宸, 黄凯, 陈志刚, 张文东
- 三维人体姿态估计的目的是预测出人体关节点的三维坐标位置和角度等信息,构建人体表示(如人体骨骼),以便进一步分析人体姿态。随着深度学习方法的不断推进,越来越多的基于深度学习的高性能三维人体姿态估计方法被提出。然而由于图片的人体遮挡、训练规模需求较大等原因,三维人体姿态估计仍然存在挑战。该研究目的是通过对近年来的多篇研究论文进行回顾,分析和比较这些方法的推理过程和核心要素,从不同输入的角度入手,全面阐述近年来基于深度学习的三维人体姿态估计方法。此外,还介绍了相关数据集和评价指标,在Human3.6M、Campus和Shelf数据集上对部分模型进行实验数据比对,分析对比实验结果。最后,根据本次调查的结果,讨论目前三维人体姿态估计所面临的困难和挑战,对三维人体姿态估计的未来发展进行了探讨。
-
- 面向算法选择的元学习研究综述
- 李庚松, 刘艺, 秦伟, 李红梅, 郑奇斌, 宋明武, 任小广
- 随着人工智能的快速发展,从可行的算法中选择满足应用需求的算法已经成为各领域亟待解决的关键问题,即算法选择问题。基于元学习的方法是解决算法选择问题的重要途径,被广泛应用于算法选择研究并取得了良好成果。方法通过构建问题特征到候选算法性能的映射模型来选择合适的算法,主要包括提取元特征、计算候选算法性能、构建元数据集以及训练元模型等步骤。首先,阐述基于元学习的算法选择概念和框架,回顾简述相关综述工作;其次,从元特征、元算法和元模型性能指标三方面总结研究进展,对其中典型的方法进行介绍并比较不同类型方法的优缺点和适用范围;然后,概述基于元学习的算法选择在不同学习任务中的应用情况;继而,使用140个分类数据集、9种候选分类算法和5种性能指标开展算法选择实验,对比不同算法选择方法的性能;最后,分析目前存在的挑战和问题,探讨未来的发展方向。
-
- 面向单调特征选择的改进模糊排序互信息
- 皮洪, 罗川, 李天瑞, 陈红梅
- 缺失值、异常值等低质信息的大量存在使得实际应用中单调分类任务通常不满足一致性单调约束。然而,现有的面向单调分类的特征选择算法中用于评估特征相关性的互信息度量准则在处理不一致单调分类任务时不满足特征集合与度量准则之间的单调性限制关系。针对此问题,首先对经典的模糊排序信息熵进行了改进,使之满足单调性限制关系。进一步定义了模糊排序互信息(nFRMI)用于评估特征之间的单调一致性,并证明了该度量准则在一致性和不一致性单调分类任务中均满足单调性约束,此外结合最大相关最小冗余(mRMR)准则提出了两阶段的特征选择算法。算法第一阶段利用nFRMI计算每个特征的特征重要度,然后根据特征重要度得到特征排序;第二阶段采用Wrapper方法选出具有最优分类性能的特征子集。仿真实验从UCI挑选了四个单调分类数据集,并从分类精度指标对所提出的特征选择算法的有效性进行了验证。
-
- 面向动态路网的最优路径GCN深度搜索方法
- 费珂, 秦小麟, 迟贺宇, 李瑭
- 路网中的最优路径搜索与规划作为位置服务中重要部分受到广泛关注,射频识别技术(RFID)等技术带来的大量交通数据成为了研究的基础与挑战。城市中出行场景对路网动态变化非常敏感,同时城市复杂多变的交通情况、真实路网与移动对象轨迹丰富的时空语义信息,都是动态路网中的最优路径搜索面临的难题。针对这些挑战,在分析现有算法不足的基础上,参考A*算法启发式思想,提出一种基于图卷积网络进行深度搜索的机器学习模型GCN-Search。模型首先通过时空图卷积网络,聚合相邻区域与过往时段的时空信息,对城市出行所依赖的路网近期动态变化进行建模;其次扩展路径搜索的深度,定义节点的深度估价值,并使用神经网络替代人工设计的估价函数,搜索利于路径整体最优的节点,直到生成最终路径。在某交管局提供的RFID数据集上进行的对比实验表明,GCN-Search算法可以有效利用RFID数据中的时空语义信息,提升动态路网出行的最优路径搜索的准确率。
-
- 面向深度学习算子的循环不变式外提算法
- 梁佳利, 华保健, 吕雅帅, 苏振宇
- TVM是一个深度学习编译器,支持将TVM的领域专用语言即张量表达式定义的算子编译生成目标平台的代码,并在高级中间表示TVM IR上进行一系列优化。张量表达式对算子执行循环变换,产生与循环迭代变量相关的复杂表达式的计算,在多层嵌套循环内这些计算包含了大量的循环不变式。然而,传统的循环不变量外提技术不能判断不变量外提是否能带来额外收益,无法发现操作数顺序不同的循环不变表达式,不能处理嵌套的条件表达式,并且与目标平台编译器优化存在冲突等。由于这些挑战,传统的循环不变量外提算法无法直接用于深度学习编译器的优化,提出了一种融合深度学习代价函数和启发式策略的循环不变量外提算法。该算法基于深度学习编译器的高层中间表示,通过调整操作数顺序和简化嵌套条件表达式等方法规范化表达式。为了衡量优化的收益,在结合TVM IR和目标平台的特点的基础上,提出了一个新的面向深度学习的不变式外提代价指标函数。在开源编译器TVM 0.7版本上,通过新增优化遍的形式,具体实现了所介绍的算法以及代价函数。为评测算法的有效性,在Tesla P4的图形处理器(GPU)平台上对TVM TOPI的测试算子集中27个典型算子不同输入规模的511个测例进行了测试。实验结果表明47.6%的算子性能得到提升,最大加速比大于40.0%。
-
- 高级语义修复策略的跨模态融合RGB-D显著性检测
- 石玉诚, 吴云, 龙慧云
- 针对显著区域定位不完整以及边缘模糊问题,提出一种RGB-D显著性目标检测方法。该方法首先设计了一个跨模态特征融合模块来逐层融合RGB和Depth信息,并得到六个模态融合特征输出。该模块降低了RGB和Depth信息之间存在的差异性,为后续的高级语义修复提供更具共性和互补性的深层特征;基于上述模块获得的多层次信息,利用后三层特征,联合提取更丰富的高级语义信息,并得到初始显著图。之后,采用U-Net的网络结构,从网络的顶层向下融合,每一层经过上采样之后与下一层进行通道维度上的融合,前三层底层特征在融合前后采用高级语义特征进行指导,以完成对底层特征的修复。最后,得到最终的显著图。提出的跨模态特征融合模块能够自适应地融合多模态特征,突出融合特征的共性和互补性,降低融合的模糊度。提出的高级语义修复策略有助于准确检测出显著区域并提高边缘清晰度。实验结果表明,该算法在NJU2K、NLPR、STERE、DES、SIP五个数据集上均超过大部分优秀的方法,达到了较为先进的性能。
-
- 坐标注意力特征金字塔的显著性目标检测算法
- 王剑哲, 吴秦
- 显著性目标检测旨在获取图像中的视觉显著目标,是计算机视觉领域的重要研究内容。相比传统手工提取特征的方法,基于全卷积神经网络的方法已在这一领域展现出强大优势。然而,显著性目标检测仍然存在一些问题。复杂场景下,背景中可能存在一些易被误判为显著目标的噪声,导致检测性能下降。另外,当显著目标轮廓较为复杂时,边界像素点的检测也变得较为困难。为了解决这些问题,提出一种坐标注意力特征金字塔的显著性目标检测算法。采用基于特征金字塔的网络结构,提取显著目标中不同层次的特征,并设计特征细化模块以实现不同层次特征的有效融合。为解决背景误判问题,采用坐标注意力模块,增大显著性区域权重的同时,抑制背景噪声。对于边界复杂问题,设计边界感知损失函数并结合多层次监督方法,帮助网络更加关注边界像素点,生成边界清晰的高质量显著图。在五个常用显著性目标检测数据集上的实验结果表明,该算法在五种评价指标上均取得较优的检测结果。
-
- 面向图像检索的热力特征描述子构造与匹配
- 刘天宇, 贾迪, 骆顺利, 王凯
- 基于深度学习的图像匹配技术已成为图像检索任务的研究热点,受不同局部区域高相似性描述子影响,误匹配问题降低了现有方法的检索精度,为此提出一种面向图像检索的热力特征描述子构造与匹配方法。首先,通过语义分割网络获得每个卷积层的可视化特征图,针对最后一个卷积层具有更强空间信息和语义信息的特点,利用梯度得分获得特征图中每个通道的权重,通过线性融合的方式,在通道维度上加权求和并归一化,利用双线性插值获得最终的热力图。其次,采用深度学习方法(DELF)获得图像深度特征描述子,利用语义分割网络所获得的类别信息和热力值信息构造多维度复合热力特征描述子,给出针对这类特征描述子的KD树结构。最后,基于该结构结合BBF和随机抽样一致算法实现特征匹配。在Oxford5K和Paris6K数据集上进行实验,实验结果表明,与DELF和D2-Net算法相比,该方法在查准率及时间效率上都有所提高,与Fine-tuning CNN、DAME WEB等方法相比检索精度提高近2个百分点。该方法能够更好地提高图像检索效率和精度,实验结果验证了该方法的有效性。
-
- 融合结构和特征的图层次化池化模型
- 马涪元, 王英, 李丽娜, 汪洪吉
- 作为深度神经网络向非欧式数据上的扩展,图神经网络(GNN)已经在图节点分类任务、链接预测任务和图分类任务中取得了显著成就。在图分类任务上,当前方法一般通过层次化的池化过程同时考虑图的局部和全局结构信息以学习高层次的图表示。在对当前的图分类模型进行对比分析后,考虑当前方法的不足,结合不同方法的优势,提出结构和特征融合池化模型(SAFPool)。SAFPool模型在池化时使用了两个聚类分配矩阵生成模块,分别是基于结构的聚类学习和基于特征的聚类学习模块,基于结构的聚类学习根据图结构信息对结构相似的节点聚类,基于特征的聚类学习则根据图节点特征对特征相似的节点聚类。二者的聚类结果加权聚合后便能获取实现聚类策略的聚类分配矩阵以同时利用图结构和节点特征信息。最后,在多个图分类数据集上通过对比实验和可视化说明了同时显式地利用图节点特征信息和图结构信息实现聚类策略的有效性。
-
- 结合眼动信息和序列指纹的亚暴事件识别方法
- 韩怡园, 韩冰, 高新波
- 极光亚暴的发生过程、效应和模型的研究一直是近30年来日地物理学中最受重视的核心前沿课题之一。Polar卫星携带的紫外成像仪(UVI)每年采集到的紫外极光图像数量非常庞大,自动且精确地从海量的紫外极光图像中识别亚暴事件是该领域亟需解决的问题。目前已经有针对极光亚暴事件检测、识别等方面的研究,这些方法均有效利用了亚暴事件的物理特性,但都没有利用专家视觉认知信息作为先验。因此,以眼动信息作为专家知识的一种视觉直观表示,结合亚暴序列本身的物理特性,提出了结合眼动信息和序列指纹的亚暴事件识别方法。首先,利用眼动仪获取空间物理专家对极光亚暴序列认知的眼动信息;其次,根据亚暴事件的物理特征对其进行标记得到每个极光亚暴事件的序列指纹;最后,利用专家的眼动信息与序列指纹识别策略实现对亚暴事件的自动识别。同时,实验也表明了所提出的方法的有效性。
-
- 复合层次融合的多模态情感分析
- 王旭阳, 董帅, 石杰
- 针对传统情感分析方法无法解决短视频情感表达问题以及现有多模态情感分析方法准确率不高、不同模态信息之间交互性差等问题,通过对多模态情感分析方法进行研究,结合时域卷积网络(TCN)和软注意力机制建立了复合层次融合的多模态情感分析模型。该模型首先将视频中提取到的文本特征、视频面部特征和音频特征进行维度均衡,然后将得到的不同模态的信息特征进行复合式融合,即先将单模态信息进行融合得到双模态特征信息,再将得到的三个双模态信息进行融合,得到最终的三模态信息,最后将得到的三模态信息和每个单模态信息进行融合得到最终的多模态情感特征信息。每次融合的特征信息都经过TCN网络层进行序列特征的提取,将最终得到的多模态特征信息通过注意力机制进行筛选过滤后用于情感分类,从而得到预测结果。在数据集CMU-MOSI和CMU-MOSEI上的实验表明,该模型能够充分利用不同模态间的交互信息,有效提升多模态情感分析的准确率。
-
- 融合模体图神经网络和自编码器的链路预测
- 鲁富荣, 原之安, 钱宇华
- 链路预测是网络数据挖掘的一项基本任务,已有很多相关的研究成果。由于图神经网络研究的深入发展,使得相关的模型可以更加有效学习网络的重要特征,在链路预测等任务中取得了很好的预测效果。然而,不同于深度学习中CNN模型,已有的图神经网络模型中仅聚合了节点的一阶邻居信息,未充分考虑邻居节点之间的拓扑结构特性。在此基础上,提出了基于模体的图神经网络链路预测模型。该模型采用自编码器结构,在编码过程中,通过模体构建节点的邻接矩阵,进而得到节点的模体邻域,依照每一类模体的邻域聚合邻居信息,通过非线性变换得到节点的表示,最后拼接每一类模体下节点的表示。然而由于不同的模体结构在网络中重要度有所不同,利用注意力网络给出表达不同模体的注意力权重,连接注意力网络给出节点的向量表示。在解码过程中,通过计算节点间的相似性重构网络。在几个引文合作者网络上的实验结果表明,该方法在两个指标上优于大多数基准算法,有效地提高了网络链路预测的准确度。
-
- 融合相似度和预筛选模式的协同过滤算法
- 赵文涛, 田欢欢, 冯婷婷, 崔自恒
- 基于邻域的协同过滤算法中,用户(项目)相似度的计算对预测和推荐结果有重要影响。传统相似度基于共同评分项目,能快速计算出相似度结果,但在稀疏数据下,推荐准确性较低。目前大多数改进的协同过滤算法通过制定较复杂的相似度公式,提高推荐准确性,但往往忽略了模型的计算时间。为达到在降低时间成本的同时执行有效的推荐,提出融合相似度和预筛选模式的协同过滤算法。首先在相似度模型中定义相对评分差异,并列举应满足的定性条件得到优化的相似度,同时考虑基于信息熵改进的评分偏好和用户全局评分的数量信息作为权重因子,更好地区分用户间差异,缓解稀疏数据下相似度计算不准确的问题。其次通过分析相似度模型和评分预测公式的隐式约束,提出预筛选模式,过滤掉大量无效的用户及对应的评分数据,进一步提高计算效率。最终通过融合相似度和预筛选模式得到协同过滤算法。在基准数据集上的实验表明,与其余8种算法相比,提出的算法具有良好的推荐质量和较高的时间效率。
-
- 类不平衡数据的EM聚类过采样算法
- 谢子鹏, 包崇明, 周丽华, 王崇云, 孔兵
- 针对分类任务中的不平衡数据集造成的分类性能低下的问题,提出了类不平衡数据的EM聚类过采样算法,通过过采样提高少数类样本数量,从根本上解决数据不平衡问题。首先,算法采用聚类技术,通过欧式距离衡量样本间的相似度,选取每个聚类簇的中心点作为过采样点,一定程度解决了样本的重要程度不够的问题;其次,通过直接在少数类样本空间上进行采样,可较好解决SMOTE、Cluster-SMOTE等方法对聚类空间没有针对性的问题;同时,通过对少数类样本数量的30%进行过采样,有效解决基于Cluster聚类的欠采样盲目追求两类样本数量平衡和SMOTE等算法没有明确采样率的问题。在公开的24个类不平衡数据集上进行了实验,验证了方法的有效性。
-
- 融合社交关系和知识图谱的推荐算法
- 高仰, 刘渊
- 推荐系统可以帮助用户快速发现有用信息,有效提高用户的检索效率,然而推荐系统存在数据稀疏性、冷启动等问题,现有的融合了社交关系的推荐算法大多忽略了社交关系数据的稀疏性,且同时融合社交关系和物品属性数据的推荐算法较少。为解决这方面的问题,提出了一种融合社交关系和知识图谱的推荐算法(MSAKR)。首先,该算法通过图卷积神经网络提取用户的社交关系得到用户的特征向量,采用图中心性筛选邻居,采用word2vec模型思想生成虚拟邻居,从而缓解社交数据的稀疏性,采用注意力机制来聚集邻居;其次,采用多任务学习和基于语义的匹配模型来提取物品属性知识图谱信息得到物品的特征向量;最后,根据得到的用户和物品特征向量向用户综合推荐。为验证提出算法的性能,在真实数据集豆瓣和Yelp上进行实验验证,分别使用点击率预测和[Top-K]推荐来评估模型性能,实验结果表明,提出的模型优于其他的基准模型。
-
- 融合人格特征的概率推荐模型
- 沈铁孙龙, 付晓东, 岳昆, 刘骊, 刘利军
- 以模型为基础的协同过滤推荐算法需分析提取“用户-项目”特征矩阵以进行用户推荐。用户特征不同直接导致用户偏好不同,但以模型为基础的协同过滤推荐算法仅考虑分析提取影响项目特征的关键因素而未考虑分析提取影响用户特征的重要因素,这类传统模型往往将用户潜在特征向量随机初始化,并赋予一个假定的正态分布,导致这些推荐系统模型中没有任何一项数据变化可以对用户潜在特征建模结果产生直接影响。另外基于用户的推荐系统模型往往将用户的评论、评分的信息直接近似作为用户特征,传统推荐系统中这些数据引用方式和这些数据本身不足以支撑获取用户的本质特征。这些特征的近似也不能满足个性化推荐的需求。针对现有推荐算法所面临的没有分析提取用户本质特征以及项目本质特征提取不充分进而推荐结果难以体现用户个性的问题,提出一种融合人格特征的推荐模型。首先根据推荐平台中用户的非结构化评论文本信息,将人格特征作为用户特征的直接影响因素,设计一个神经网络模型计算评论用户的BIG FIVE人格得分,并将人格得分向量化作为用户特征;然后通过项目的评论文本信息获得项目特征;设计人格感知的协同学习框架,定义损失函数获取用户、项目的特征向量;最后根据用户、项目表征结果对目标用户进行推荐。在3个数据集上进行了全面的实验验证,结果表明算法在预测准确率、F1值、AUC指标等方面表现优于对比算法,通过人格建模,能够为用户推荐更符合其偏好的项目。
