计算机科学与探索杂志2024年第5期
-
- 基于流行的推荐研究综述
- 雷钦岚, 田萱
- 目前,基于流行的推荐系统成为研究热点。流行度使得推荐效果得到显著提升,而流行偏差带来的马太效应也引发了研究者的广泛关注,同时一些研究者考虑将二者结合作为混合式流行来实现推荐。采用流行这一概念,对流行度、流行偏差和混合式流行进行统一表示。首先介绍流行在推荐领域的应用背景,然后根据不同视角,分别对流行度增强推荐方法、去流行偏差推荐方法和混合式流行推荐方法进行综述。在每类方法中,根据建模的具体子任务或具体策略进行进一步划分,对代表性方法进行分析介绍,评价其优点和局限性等,并详细总结每类方法的方法机制和适用场景,从多方面对不同方法间的联系与区别进行讨论。还介绍了该领域中常用数据集、评价指标和基线算法,并对其中代表性方法进行性能对比分析。最后针对基于流行的推荐研究发展趋势提出一些看法,从多角度对该技术未来的发展难点与热点进行总结与展望。
-
- SMOTE类算法研究综述
- 王晓霞, 李雷孝, 林浩
- 合成少数类过采样技术(SMOTE)因能有效处理少数类样本已成为处理不平衡数据的主流方法之一,而且许多SMOTE改进算法已被提出,但目前已有的调研极少考虑到流行的算法级改进方法。因此对现有SMOTE类算法进行更全面的分析与总结。首先详细阐述了SMOTE方法的基本原理,然后主要从数据级、算法级两个层面系统性地梳理分析SMOTE类算法,并介绍数据级和算法级混合改进的新思路。数据级改进是在预处理时通过不同操作删除或添加数据来平衡数据分布;算法级改进不会改变数据分布,主要通过修改或创建算法来加强对少数类样本的关注度。二者相比,数据级方法应用受限更少,算法级改进的算法鲁棒性普遍更高。为了更全面地提供SMOTE类算法的基础研究材料,最后列出常用数据集、评价指标,给出未来可能尝试进行的研究思路,以更好地应对不平衡数据问题。
-
- 深度学习的自然场景文本识别方法综述
- 曾凡智, 冯文婕, 周燕
- 自然场景文本识别在学术研究和实际应用中具有重要价值,已经成为计算机视觉领域的研究热点之一。然而,识别过程存在文本风格多样、背景环境复杂等挑战,导致识别效率和准确率不佳。传统的基于手工设计特征文本识别方法由于其有限的表示能力,不足以有效地应对复杂的自然场景文本识别任务。近年来,采用深度学习方法在自然场景文本识别中取得了重大进展,系统地梳理了近年来相关研究工作。首先,根据是否需要对单字符进行分割,将自然场景文本识别方法分为基于分割与无需分割的方法,再根据其技术实现特点将无需分割的方法进行细分,并对各类最具有代表性的方法工作原理进行了阐述。然后,介绍了当前常用数据集以及评价指标,并在数据集上对各类方法进行了性能对比,从多个方面讨论了各类方法的优势与局限性。最后,指出基于深度学习的自然场景文本识别研究存在的不足和难点,对其未来的发展趋势进行了展望。
-
- 基于Transformer的单幅图像去雾算法综述
- 张凯丽, 王安志, 熊娅维, 刘运
- 图像去雾是一种低级的计算机视觉任务,旨在对雾天降质图像进行预处理,通过恢复其颜色对比度、细节纹理等信息,提高图像的可视性和质量,还原清晰的无雾图像,为后续高级视觉任务(如目标检测、目标追踪、目标分割等)的执行奠定基础。近年来,基于神经网络的去雾算法取得了不错的去雾效果,诸多基于Transformer的图像去雾算法逐渐被提出。但目前缺少对基于Transformer的图像去雾算法进行全面分析和总结的综述。为了弥补这一空缺,对基于Transformer的日间图像、夜间图像和遥感图像去雾算法进行了全面的梳理和综述,其中不仅涵盖了各类去雾算法的基本原理,还探讨了这些算法在不同场景下的适用性和性能表现。此外,介绍了图像去雾任务中常用的数据集和评价指标。在此基础上,对现有的代表性图像去雾算法的性能从定量和定性两个角度进行了分析和评估,对比了典型去雾算法在去雾效果、运行速度、资源消耗等方面的表现。最后,总结了图像去雾技术的应用场景,对图像去雾领域仍然存在的挑战以及未来的发展方向进行了分析和展望。
-
- 推荐系统冷启动问题解决方法研究综述
- 毛骞, 谢维成, 乔逸天, 黄小龙, 董刚
- 推荐系统在处理数据超载、提供个性化咨询服务、帮助客户投资决策等领域提供了重要功能。但推荐系统中存在的冷启动问题一直亟需解决和优化。基于此,对解决冷启动问题的传统方法和前沿方法进行分类,将近几年的研究进展和优秀的方法进行阐述。首先,归纳了冷启动问题的传统三大解决方案:基于内容过滤的推荐、基于协同过滤的推荐和混合推荐。其次,归纳了目前较为前沿的解决冷启动的推荐算法,并依据其解决冷启动问题的策略点将其分类为数据驱动的策略和方法驱动的策略,再将方法驱动的策略分为基于元学习的算法、基于上下文信息和会话策略的算法、基于随机游走的算法、基于异质图信息和属性图的算法和基于对抗性机制的算法,其中根据处理冷启动问题的种类将算法分为解决新用户和新项目两类。再根据推荐领域的特殊性,将多媒体信息领域推荐和在线电商平台领域推荐的冷启动问题进行阐述。最后,总结并提出了未来解决冷启动问题可能的研究方向。
-
- 满足强连通性的有向团枚举算法研究
- 陈久健, 代强强, 李荣华, 王国仁
- 有向图的有向边可以表示关系的指向或者数据的传递,在稠密子图的挖掘中引入连通性的约束可以增加顶点之间的联系。为此,结合极大团与强连通分量的定义,底图是完全子图且顶点之间满足强连通性的子图结构被称为有向团。已有工作给出了枚举极大有向团的输出敏感算法,然而其存在大量重复枚举和判重操作复杂等不足之处。为了解决这些问题,基于深度优先搜索的思想和有向团的扩展性质,提出一种新颖的递归枚举算法。算法对于出边邻居和入边邻居分别划分候选集与排除集,维护完全子图结构的同时,不断尝试扩展有向团并保证满足强连通性,并且引入基于共同邻居的支撑点剪枝策略,在稠密图上获得上千倍的效率优化。算法还针对搜索空间给出两种优化设计:一是添加了分割子图的预处理,限制递归调用的搜索范围;二是基于位向量压缩表示顶点集合,提高集合运算的效率。在真实图数据上的实验结果表明,相比现有工作中的输出敏感算法,提出的算法具有50倍以上的加速比。
-
- 带有惩罚措施的自竞争事后经验重播算法
- 王子豪, 钱雪忠, 宋威
- 自竞争事后经验重播(SCHER)是在事后经验重播(HER)算法的基础上提出的一种改进策略。HER算法在面对环境奖励稀疏的情况下,通过回放经验生成虚拟有标签数据来优化模型。但HER算法存在两个问题:一是无法处理智能体由于奖励稀疏所产生的大量重复数据,这些无效数据会对经验池造成污染;二是虚拟目标可能会随机选择到一些对完成任务没有帮助的中间状态,导致学习偏差。针对这些问题,SCHER算法提出了两个改进策略:一是增加自适应的奖励信号,对智能体做出的无意义动作进行惩罚,使其快速规避此类操作;二是使用自竞争策略,通过竞争产生针对同一任务下的两组不同数据,对比分析后找到使智能体在不同环境中成功的关键步骤,提高生成虚拟目标的准确程度。实验结果表明,SCHER算法可以更好地利用经验回放技术,将平均任务成功率提高5.7个百分点,拥有更高的准确率和泛化能力。
-
- 不完备异构冲突信息系统中的极大一致联盟区间集族
- 罗珺方, 张硕, 胡梦君
- 作为处理不确定性问题的有效工具,三支决策已被广泛应用于冲突分析研究中。然而,现有的三支冲突分析模型大多基于单一类型的冲突信息系统,难以应对实际应用中代理对议题具有多类型评价值和缺失值的情况。同时,已有联盟集的定义通常基于给定代理,即联盟集中的代理与给定代理具有联盟关系,但不一定两两联盟。为了解决这些问题,构建了基于不完备异构冲突信息系统的三支冲突分析模型,并提出了代理两两相关的极大一致联盟区间集族的定义及其构造算法。首先,通过定义代理不同类型评价值的支持度和反对度,将对单个议题单维度多类型评价值的不完备异构冲突信息系统转化为双维度同类型评价值的二维模糊不完备冲突信息系统。其次,通过定义代理之间的乐观与悲观距离函数,构造了基于代理的联盟、冲突、中立区间集。最后,定义了极大一致联盟区间集族,并利用极大团的枚举算法获取极大一致联盟区间集族。
-
- 紧凑性约束下的形状提取多元时序聚类
- 张弛, 陈梅, 张锦宏
- 针对多元时序数据(MTS)的自然性和结构复杂性以及现有算法无法准确识别高维时序数据簇的问题,提出了紧凑性约束下的形状提取多元时间序列聚类算法C-Shape。该算法首先对繁杂的多元时序数据进行最大三角形三段降采样处理,达到使用较少数据而保持原有时序形状不变的目的。然后计算原始时序数据和处理后的时序数据之间的时间序列紧凑性,来评估所定的低维空间维度是否合理。接着在有效保证数据形状完整的基础上使用形状特征提取以确定新的簇中心,最后迭代形成最终簇。C-Shape充分考虑到处理后的数据与原数据形状之间的相似性,解决了传统降采样算法难以确定低维空间维度的难题。为验证算法性能,C-Shape与两个经典算法和七个近年提出的优秀时序聚类算法分别在八个常规和四个不平衡且维数从数十到数千不等的多元时序数据集上进行比较。实验结果显示,C-Shape聚类能力均优于九种对比算法,RI平均提高了16.33%,时间性能平均提高了69.71%。因此,C-Shape是一种精确且高效的多元时间序列聚类算法。
-
- 基于反向瓶颈和LCBAM设计的X光违禁品检测
- 董乙杉, 郭靖圆, 李明泽, 孙嘉傲, 卢树华
- 针对X光违禁品图像姿态与角度变化易漏检误检及困难样本检测准确率低等问题,以YOLOv5网络为基线模型,提出一种融合了反向瓶颈结构和轻量化卷积块注意力模块设计的违禁品检测模型。在主干网络采用反向瓶颈结构设计注重细节特征信息,改进网络应对检测目标大角度变化问题;采用轻量化卷积块注意力机制抑制复杂背景干扰,降低模型参数量;此外,采用高斯误差线性单元激活函数和改进的置信度损失函数增强模型的非线性表达能力,加大对置信度预测的惩罚力度,优化网络对困难样本的检测性能。所提模型在三个大型公开数据集OPIXray、SIXray、HiXray上进行训练和测试,mAP分别达到了91.9%、93.4%和82.2%。结果表明,所提模型能够有效解决基线模型应对X光违禁品角度变化问题,具有较高的检测准确性和稳健性。
-
- 融合双分支语义增强感知的遥感图像超分辨率重建算法
- 王超学, 代宁
- 针对遥感图像中地物目标的特征信息模糊以及背景噪声影响导致遥感图像重建效果差的问题,提出一种融合双分支语义增强感知的遥感图像超分辨率重建算法。首先,设计了一种全局-局部空间注意力模块,该模块用于增强特征在空间全局-局部不同尺度下的语义表征能力,同时强化网络对有效特征组的分辨能力;其次,提出一种通道分组-聚合注意力模块,通过设计特征分组-聚合以及通道注意力模块,增强模型对地物目标特征的区分,强化对有效特征通道的关注能力。实验表明,所提算法在UC Merced数据集上,峰值信噪比在×2/×3/×4倍率下分别达到了34.397 dB、29.920 dB和28.128 dB,结构相似度在×2/×3/×4倍率下达到了0.931、0.834和0.791。在AID数据集上,峰值信噪比在×2/×3/×4倍率下分别达到了32.524 dB、29.317 dB和27.522 dB,结构相似度在×2/×3/×4倍率下达到了0.895、0.829和0.721。两个指标相较于等主流算法均有所提升,重建后图像的边缘与区域细节效果更优,有效克服了地物目标的特征信息模糊及背景噪声影响导致遥感图像重建效果差的问题。
-
- 滑窗注意力多尺度均衡的密集行人检测算法
- 于范, 张菁
- 由于现实场景下的行人目标在形态、尺度等方面存在巨大差异,相比于传统方法对多尺度行人检测平均精准率较低的情况,基于Transformer注意力机制的网络在行人检测领域已经展现出强大的性能。然而,密集场景下的多尺度检测仍存在一些难点。在密集场景中,通常会包含大量的被遮挡或小规模的行人目标,导致模型产生大量的误检和漏检,同时耗费大量的计算资源。此外,当行人目标重叠较为严重时,准确地检出所有目标也会变得极为困难。为了解决上述问题,提出了一种基于滑窗注意力的密集场景多尺度行人检测算法。在Backbone中使用改进Swin block使得网络能够提取到更多的细节特征,同时减少注意力机制带来的繁重计算量。为有效解决特征融合问题,在Neck部分使用DyHead block来统一多个注意力运算,以此提高特征融合效率。针对特征均衡问题,设计了一种基于全连接的特征尺度均衡模块,通过在特征金字塔的各层级之间构造不同的残差结构来进行特征平衡,辅助模型生成更高质量的特征图。在WiderPerson数据集上的实验结果表明,该算法在AP值上提升了1.1个百分点,在最值得关注的小目标和中目标上也分别有1.0和0.7个百分点的提升。
-
- 三维多层次特征协同的无人机遥感目标检测算法
- 吕伏, 傅宇恒, 贺丽娜, 杨冬鹏
- 针对无人机航拍图像小目标占比大和背景复杂的特点,当前目标检测模型存在精度低和小目标漏检等问题。基于YOLOv8s模型,提出了三维多层次特征协同的无人机遥感目标检测算法。首先,在坐标注意力的基础上提出了三维多分支坐标注意力(MBCA),通过增加通道维度的信息交互和扩展分支的拆分融合,减少空间维度的计算量,提高了模型全局特征提取能力。其次,采用SPD-Conv替换部分标准卷积,在下采样时有效保留更多特征信息并加快推理速度。然后,在C2f模块中采用了更高效的FastDBB_Bottleneck模块,结合PConv与DBB结构重参数化叠加,以进一步降低模型计算量。最终,通过引入PG-Detect检测头,显著减少计算量并有效降低小目标的漏检率。在VisDrone2019数据集上的实验结果显示,该方法的mAP50值达到了44.5%,较YOLOv8s基线模型提升了5.7个百分点。同时,在自建水坝裂缝数据集上,进行裂缝检测验证实验,改进方法的mAP50值相比YOLOv8s提升了3.3个百分点,FPS达到289帧。实验结果表明在复杂场景目标检测中,所提方法提升了检测模型的精度和实时性,具有良好的适应性和鲁棒性。
-
- 基于复合跨模态交互网络的时序多模态情感分析
- 杨力, 钟俊弘, 张赟, 宋欣渝
- 针对多模态情感分析中存在的不同模态间语义特征差异性导致模态融合不充分、交互性弱等问题,通过研究分析不同模态之间存在的潜在关联性,搭建一种基于复合跨模态交互网络的时序多模态情感分析(CCIN-SA)模型。该模型首先使用双向门控循环单元和多头注意力机制提取具有上下文语义信息的文本、视觉和语音模态时序特征;然后,设计跨模态注意力交互层,利用辅助模态的低阶信号不断强化目标模态,使得目标模态学习到辅助模态的信息,捕获模态间的潜在适应性;再将增强后的特征输入到复合特征融合层,通过条件向量进一步捕获不同模态间的相似性,增强重要特征的关联程度,挖掘模态间更深层次的交互性;最后,利用多头注意力机制将复合跨模态强化后的特征与低阶信号做拼接融合,提高模态内部重要特征的权重,保留初始模态独有的特征信息,将得到的多模态融合特征进行最终的情感分类任务。在CMU-MOSI和CMU-MOSEI数据集上进行模型评估,结果表明,CCIN-SA模型相比其他现有模型在准确率和F1指标上均有提高,能够有效挖掘不同模态间的关联性,做出更加准确的情感判断。
-
- 融合动态梯度和多视图协同注意力的情感分析
- 王香, 毛力, 陈祺东, 孙俊
- 针对多模态情感分析中模态间优化不平衡和多模态特征融合不充分的问题,提出一种融合动态梯度机制和多视图协同注意力机制的多模态情感分析模型(DG-MCM),能够有效挖掘单模态特征并充分融合多模态信息。首先,模型使用预训练模型BERT和堆叠式长短期记忆神经网络(SLSTM)学习文本、音频和视频的特征,并提出动态梯度机制,通过监测各模态对学习目标的贡献差异和学习速度辅助各模态的特征学习。其次,将得到的不同模态的特征使用多视图协同注意力机制进行特征融合,通过将每两个模态投影到多个空间执行交互获得更加充分的融合特征。最后,拼接融合特征和单模态特征进行情感预测。在CMU-MOSI和CMU-MOSEI数据集的实验结果表明,该模型能够充分学习单模态和不同模态之间的信息,有效提升多模态情感分析的准确率。
-
- 情感强度回复生成模型
- 马志强, 周钰童, 贾文超, 许璧麒, 王春喻
- 情感对话生成模型在回复生成中未考虑情感强度因素,导致生成回复的情感表达存在波动不恰当性,降低用户交互体验。受情绪心理学中情感强度工作的启发,提出一种情感强度回复生成模型(EIRGM)。模型包括情感强度预测单元、语境编码模块和情感强度回复生成单元,其中情感强度预测单元为回复语句提供情感类别和情感强度,语境编码模块单元为回复语句提供内容基础,情感强度回复生成单元构成用于回复语句中情感和强度的表达。实验以NLPCC2018开放域对话数据集为基础,开展了情感恰当性、情感强度恰当性、内容关联性以及对话持续性等实验。实验结果表明,EIRGM在情感恰当性方面与最优模型相差不大,在情感强度恰当性和对话持续性方面与最优模型相比分别提升4.1个百分点和0.8个百分点,表明了EIRGM模型在提升情感强度表达恰当性同时也提高了用户交互意愿。
-
- 基于可逆图扩散的网络传播溯源方法研究
- 翟文硕, 赵翔, 陈东
- 随着社会的发展,各种类型网络的安全问题日益突出,尤其是网络传播问题。对网络传播的扩散源点进行准确的定位是实现控制网络传播的重要手段。对于网络传播溯源问题的研究还面临着网络结构多样、传播机制复杂等问题,因此基于图神经网络研究了网络传播溯源问题,提出了一个基于图卷积神经网络的可逆图扩散模型(GCNIGD)。在节点易感性估计阶段,考虑到网络节点之间的连接关系,结合图卷积神经网络充分利用了网络的结构信息;在节点特征构造阶段,结合了图扩展卷积对网络中信息传递进行空间局部化拓展,从而可以从多跳信息中学习来增强基于图的模型;在进行溯源阶段,将图溯源问题转化为图扩散的逆问题,构造了可逆的图网络对源节点进行准确估计,解决了网络溯源中的不适定问题。最后,在六个真实世界数据集中进行了大量的实验,实验结果表明提出的方法超越了目前已知的最先进方法。该研究对于网络中虚假信息溯源、网络攻击溯源等网络安全领域问题具有重要的指导意义。
-
- 附块和离散令牌协商的容迟网络区块链交易
- 訾玲玲, 丛鑫
- 区块链的本质是节点矿权竞争,网络的实时连通性是前提和保障,但尚存在具有数据传输时延的容迟网络,使得其中的节点在区块链活动中完全处于劣势。为了解决容迟网络难以部署区块链系统的问题,构建了基于附块和离散令牌协商的区块链交易架构,为非持续连通网络中的节点参与区块链活动提供服务支撑。首先构造了命名为附块的辅助区块,用以作为区分联网和断网时生成的新区块的依据。其次以矿工身份标识和若干随机数为参数,生成具有唯一性和可验证性的离散令牌,用于获取挖矿资质。在此基础上,设计了基于离散令牌的挖矿资质归属算法和分支处理算法,前者避免了PoS(proof of stake)和DPoS(delegated proof of stake)首富作恶问题,后者保证了断网时生成的附链以均等概率追加到主链上。最后设计了附链二次共识方案,解决了断网时生成区块内可能存在的虚假和重复交易问题。理论证明和实验分析表明,提出的架构在可靠性、接受性、交易吞吐量、交易确认时间和分支率等指标上具有一定的优势。
-
- 结合用户共同意图及社交关系的群组推荐方法
- 钱忠胜, 张丁, 李端明, 王亚惠, 姚昌森, 俞情媛
- 已有的群组推荐模型,在求解用户表示时大多比较单调且仅简单利用用户间的社交关系,使得用户表示不够准确,并且大都未考虑用户共同意图以及社交关系对群组偏好的影响,导致推荐的项目很难符合用户的需求。基于此,提出一种结合用户共同意图及社交关系的群组推荐模型(GR-UCISI)。首先构造用户-项目交互历史与社交关系相结合的用户意图分离模型,利用图神经网络采集每个用户的用户-项目交互以及社交关系信息,求解用户意图和项目表示;其次利用网络游走算法与[K-means]聚类算法将用户分组,结合用户群组、用户意图以及群组意图聚合过程获取群组共同意图表示;最后根据群组共同意图表示与项目表示得出群组推荐项目列表。该方法充分考虑到用户的个性以及群组成员间的共性对群组偏好的影响,同时结合社交关系缓解数据稀疏性问题,提升模型性能。实验结果表明,与9个对比模型中推荐效果最好的模型相比,在Gowalla数据集上,GR-UCISI的Precision和NDCG指标值分别提高3.01%和5.26%;在Yelp-2018数据集上,GR-UCISI的Precision和NDCG指标值分别提高2.96%和1.12%。
