计算机科学与探索杂志2021年第3期
-
- 医疗健康大数据隐私保护综述
- 郭子菁, 罗玉川, 蔡志平, 郑腾飞
- 随着智能移动设备普及化、医疗设备数字化及电子病历结构化的推进,医疗数据呈现爆发增长的特点。在深入研究探讨医疗大数据发展规律,提高对医疗大数据真实价值的认识的同时,如何有效保护数据的隐私安全现已成为广受关注的重要议题。医疗大数据自身特点以及存储环境等都为隐私保护带来了不小的挑战。首先,介绍了医疗大数据的相关概念以及特点。然后,围绕医疗大数据生命周期的四个阶段数据的采集、存储、共享以及分析,分别介绍面临的风险挑战以及相应的隐私保护技术,并对不同技术的优缺点、适用范围等进行分析。在数据采集时,匿名技术、差分隐私可以抵御数据集成融合带来的基于背景知识的攻击。在存储阶段,医疗大数据多存储于云平台,为了数据的机密性和完整性,常使用加密、审计的方法。在数据共享阶段,主要使用访问控制方法来控制获取数据的对象。在数据分析阶段,在机器学习框架下对医疗健康大数据进行隐私保护。最后,针对贯穿医疗大数据生命周期的普遍隐私保护挑战,从管理的层面提出合理的建议。
-
- 教育大数据可视化研究综述
- 郑娅峰, 赵亚宁, 白雪, 傅骞
- 教育大数据可视化分析对于复杂教育规律的理解与挖掘具有重要作用,已成为当前教育信息科学研究领域的重要课题。首先归纳了教育大数据的典型特征,从促进学生元认知发展、辅助教师监督学习过程及提升管理者科学决策水平三个角度介绍了教育大数据应用的最新研究成果,并简述了利用教育大数据实施可视化分析的基本流程。然后重点对文本数据可视化、多维数据可视化、网络数据可视化、时间序列数据可视化以及地理空间数据可视化等五种主流的教育大数据可视化呈现方法进行特征描述,并给出具体的应用场景。随后介绍了动态查询与过滤技术、可缩放/变形界面技术和多视图联动技术三个实施教育大数据可视化的关键交互技术方法。最后依据最新研究动态,从多模态教育数据融合、人机交互、人机协同范式以及教育数据可视化设计的标准规范和评价体系四方面对教育大数据可视化未来研究方向进行了展望。
-
- 基于深度学习的视频质量评价研究综述
- 谭娅娅, 孔广黔
- 视频质量评价(VQA)是以人眼的主观质量评估结果为依据,使用算法模型对失真视频进行评估。传统的评估方法难以做到主观评价结果与客观评价结果相一致。基于深度学习的视频质量评价方法无需加入手工特征,通过模型自主学习即可进行评估,对视频质量的监控和评价有重要意义,已成为计算机视觉领域的研究热点之一。首先对视频质量评价的研究背景和主要研究方法进行介绍;其次从全参考型和无参考型两方面介绍基于深度学习的客观质量评价方法,并且从所用的卷积神经网络模型对无参考型评价方法进行了分类比较;接着介绍视频质量评价算法的相关数据库和评价算法性能指标,并对算法性能进行比较;最后对目前视频质量评价研究存在的问题进行总结,并展望了该领域面临的挑战和未来发展方向。
-
- 基于深度学习的人体动作识别综述
- 钱慧芳, 易剑平, 付云虎
- 人体动作识别是视频理解领域的重要课题之一,在视频监控、人机交互、运动分析、视频信息检索等方面有着广泛的应用。根据骨干网络的特点,从2D卷积神经网络、3D卷积神经网络、时空分解网络三个角度介绍了动作识别领域的最新研究成果,并对三类方法的优缺点进行了定性的分析和比较。然后,从场景相关和时间相关两方面,全面归纳了常用的动作视频数据集,并着重探讨了不同数据集的特点及用法。随后,介绍了动作识别任务中常见的预训练策略,并着重分析了预训练技术对动作识别模型性能的影响。最后,从最新的研究动态出发,从细粒度动作识别、更精简的模型、小样本学习、无监督学习、自适应网络和视频超分辨动作识别六个角度一致探讨了动作识别未来发展的方向。
-
- 代码特征自动提取方法
- 史志成, 周宇
- 神经网络在软件工程中的应用极大程度上缓解了传统的人工提取代码特征的压力。已有的研究往往将代码简化为自然语言或者依赖专家的领域知识来提取代码特征,简化为自然语言的处理方法过于简单,容易造成信息丢失,而引入专家制定启发式规则的模型往往过于复杂,可拓展性以及普适性不强。鉴于以上问题,提出了一种基于卷积和循环神经网络的自动代码特征提取模型,该模型借助代码的抽象语法树(AST)来提取代码特征。为了缓解因AST过于庞大而带来的梯度消失问题,对AST进行切割,转换成一个AST序列再作为模型的输入。该模型利用卷积网络提取代码中的结构信息,利用双向循环神经网络提取代码中的序列信息。整个流程不需要专家的领域知识来指导模型的训练,只需要将标注类别的代码作为模型的输入就可以让模型自动地学习如何提取代码特征。应用训练好的分类编码器,在相似代码搜索任务上进行测试,Top1、NDCG、MRR的值分别能达到0.560、0.679和0.638,对比当下前沿的用于代码特征提取的深度学习模型以及业界常用的代码相似检测工具有显著的优势。
-
- 面向时间序列事件的动态矩阵聚类方法
- 马瑞强, 宋宝燕, 丁琳琳, 王俊陆
- 时间序列事件聚类是研究事件分类及挖掘分析的基础。现有聚类方法多直接针对具有时间属性且结构复杂的持续事件聚类,未考虑聚类对象的转化,聚类准确性低且效率差。针对这些问题,提出一种面向时间序列事件的动态矩阵聚类方法RDMC。首先,构建事件近邻评价体系,根据评价值优劣衡量事件的代表性,通过近邻评分的后向差分计算策略构建RDS候选集;其次,提出基于组合优化的RDS选取方法,从候选集上快速得到RDS最优解;最后,动态构建RDS与数据集的距离矩阵,提出基于K-means的矩阵聚类方法,实现时间序列事件所属类别的有效划分。实验表明,相比现有方法,所提方法在聚类准确率、聚类可靠性、聚类效率等方面具有明显优势。
-
- 用户评论方面级情感分析研究
- 陈虹, 杨燕, 杜圣东
- 方面级情感分析是自然语言处理的热门研究方向之一,相比于传统的情感分析技术,基于方面的情感分析是细粒度的,能够判断句子中多个目标的情感倾向,能更加准确地挖掘用户对目标的情感极性。针对以往研究忽略目标单独建模的问题,提出了一种基于双向长短期记忆神经网络(BiLSTM)的交互注意力神经网络模型(Bi-IAN)。该模型通过BiLSTM对目标和上下文分别进行建模,获得目标和上下文的隐藏表示,提取其中的语义信息。接下来利用交互注意模块学习上下文和目标之间的注意力,分别生成目标和上下文的表示,捕捉目标和上下文之内和之间的相关性,并重构评价对象和上下文的表示,最终通过非线性层得到分类结果。在数据集SemEval 2014任务4和Chinese review datasets上的实验训练显示,在正确率和F1-score上,比现有的基准情感分析模型有更好的效果。
-
- 时序行为提名的上下文信息融合方法
- 王新文, 谢林柏, 彭力
- 在针对视频的人体活动定位和识别领域中,现有的时序行为提名方法无法很好地解决行为特征长期依赖性而导致提名召回率较低。针对此问题,提出了一种上下文信息融合的时序行为提名方法。该方法首先采用三维卷积网络提取视频单元的时空特征,然后采用双向门控循环网络构建上下文关系预测出时序行为区间。针对门控循环单元(GRU)存在参数较多和梯度消失的问题,通过输入特征控制门结构增强并行计算能力,通过引入加权平均增强历史和当前时刻信息融合能力,提出了一个简化的门控循环单元(S-GRU)。最后在数据集Thumos14上进行实验验证和比较,结果表明基于双向S-GRU循环网络的时序行为提名方法提高了提名召回率。
-
- 结合属性信息的二分网络表示学习
- 赵雪莉, 卢光跃, 吕少卿, 张潘
- 现有的网络表示学习算法主要是针对同质网络或异质网络设计的,而忽略了在推荐系统、搜索引擎和问答系统等领域出现的二分网络的特殊特征以及这类网络所携带着的非常丰富的属性信息。为了解决上述问题,提出了一种结合属性信息的二分网络表示学习方法(ABNE)。该方法首先将连边分解成邻居节点间的间接关系集,嵌入显式关系,接着通过余弦相似性引入并定义节点的属性相似度矩阵,并将其作为权重矩阵的一部分指导有偏随机游走,从而嵌入隐式关系和属性信息。最后通过一个联合优化框架得到同时携带网络结构信息和属性信息的节点表示向量。在四个真实公开数据集上进行了推荐任务,并与其他现有方法进行比较,实验结果表明该算法的优越性和合理性。
-
- 利用类别信息和列表排序的跨模态检索
- 刘雨萍, 葛红, 曾奕斌
- 随着越来越多多模态数据的出现,跨模态检索引起了广泛的关注。跨模态检索面临一大挑战为模态鸿沟,为了解决数据的异构性问题,公共子空间学习的方法被提出。然而,大部分方法仅仅是单独考虑了样本之间的相关联信息或不相关信息,而没有同时考虑样本间的相关信息和不相关信息。除此之外,大部分方法对于样本之间相似度的比较,使用的是基于文档对的排序比较,其没有充分考虑样本之间的类内依赖性和类间样本的结构差异性。基于此,提出了一种同时而不是单独考虑样本间的类内关系和类间关系的基于列表排序的跨模态检索方法,其通过列表排序最大化锚点与正样本之间的相似性,同时最小化锚点和负样本间的相似性。实验结果验证了该算法在跨模态检索中的有效性。
-
- 面向开放集图像分类的模糊域自适应方法
- 刘晓龙, 王士同
- 目前大多的域自适应算法在源域与目标域具有相同类别的场景下,利用标签丰富的源域信息对标签稀少且分布相似的目标域数据进行迁移学习,取得了很多成果。然而,由于现实场景的复杂性和开放性,源域和目标域在类别空间上不尽相同,往往会各自包含一些类别未知且超出现有类别设定的样本。对于这样具有挑战性的开放集场景,传统的域自适应算法将无能为力。为了有效解决上述问题,提出一种面向开放集的模糊域自适应算法。该算法引用了不确定性的模糊化,计算目标域样本的模糊隶属度来学习源域特征到目标域特征空间的线性映射,通过迭代逐步将源域与目标域转化在同一特征空间下。通过对无监督和半监督的图像迁移任务的大量实验,验证了该算法对于开放集场景下图像分类的有效性。
-
- 基于人脸图像的二阶段性别分类算法
- 杨晨旭, 蔡克参, 张红云, 苗夺谦
- 许多现实场景要求准确的脸部性别识别。深度卷积神经网络在正常状况下取得好的准确率,适用于大规模分类任务,但存在模型可解释性差、易丢失细节信息等问题,并且光照、姿势、表情等因素带来的不确定性会导致分类准确率较低。提出一种基于阴影集的二级分类模型。采用深度卷积神经网络对大规模图像集进行一阶段分类;结合阴影集理论,将图像分类结果划分为接收域、拒绝域和不确定域,得到不确定的脸部图像集,用传统方法进行二阶段分类。在LFW数据集和Adience数据集下,与现有先进算法相比,所提方法能有效地提高总体分类的准确率。
-
- 结合重检测机制的多卷积层特征响应跟踪算法
- 张晶, 黄浩淼
- 针对基于深度特征的目标跟踪算法在目标快速运动、长时间遮挡容易导致跟踪漂移的问题,提出了一种结合重检测机制的多卷积层特征响应跟踪算法。首先基于图像分块的混合高斯模型检测出目标区域,其次多卷积层根据加权梯度的类激活映射提取目标深度特征图,并训练出相互独立的相关滤波器,然后融合底层空间特征和高层语义特征的卷积层滤波器得到目标响应位置,再由重检测机制约束项平滑输出响应值,从而构建出强跟踪器,最后自适应地更新模型参数和权重系数,避免模型中参数过拟合,达到实时跟踪效果。实验结果表明,该算法在目标严重形变、快速运动、长时期遮挡等复杂情景下,跟踪结果具有很高的精确度和成功率。
-
- Norm-DP模型行人检测优化算法
- 柴恩惠, 马占飞, 智敏
- 传统深度金字塔模型作为一种有效的行人检测算法备受关注,融合可变形部件模型和卷积神经网络模型,但特征提取部分使用的算法像素区域的大小不同,导致模型之间不能完全融合,在行人数量多、姿势复杂和有遮挡情况时的检测效果不理想。因此,提出一种基于规范化函数的深度金字塔模型(Norm-DP)算法,使用规范化函数融合可变形部件模型和卷积神经网络模型,直接从金字塔特征中提取正负样本,使用隐变量支持向量机进行模型训练,结合柔性非最大抑制(soft-NMS)算法和边界框回归(BBR)算法对定位框进行优化。分别使用INRIA和MS COCO数据集进行实验验证,在行人数量多、姿势复杂和有遮挡情况时,检测精度高于最优的可变形部件模型算法、卷积神经网络算法、深度金字塔模型算法和结合区域选择的卷积神经网络算法。
-
- 增量式约简最小二乘孪生支持向量回归机
- 曹杰, 顾斌杰, 熊伟丽, 潘丰
- 为了解决增量式最小二乘孪生支持向量回归机存在构成的核矩阵无法很好地逼近原核矩阵的问题,提出了一种增量式约简最小二乘孪生支持向量回归机(IRLSTSVR)算法。该算法首先利用约简方法,判定核矩阵列向量之间的相关性,筛选出用于构成核矩阵列向量的样本作为支持向量以降低核矩阵中列向量的相关性,使得构成的核矩阵能够更好地逼近原核矩阵,保证解的稀疏性。然后通过分块矩阵求逆引理高效增量更新逆矩阵,进一步缩短了算法的训练时间。最后在基准测试数据集上验证算法的可行性和有效性。实验结果表明,与现有的代表性算法相比,IRLSTSVR算法能够获得稀疏解和更接近离线算法的泛化性能。
-
- 融合递减策略与Fuch混沌机制的改进YSGA算法
- 高雷阜, 荣雪娇
- 为增强绯鲵鲣算法搜索的覆盖性及寻优的精准性以优化全局探索能力和局部开采能力,提出一种融合步长因子递减策略与混沌局部增强机制的改进绯鲵鲣优化算法(IYSGA)。首先,该改进算法在标准YSGA算法基础上,设计了一种动态的步长因子递变模式以实现绯鲵鲣算法高效全面的搜索,此策略有利于提高算法的搜索效率并扩大寻优范围;其次,混沌搜索机制则是借鉴Fuch映射理论优越的混沌特性与较好的局部收敛性能而构造的一种当前最优解的局部再开采方式,以完成对YSGA算法的局部搜索性能的改善。该耦合方法对YSGA的改进,有利于实现IYSGA算法全局探索与局部搜索能力间的多轮动态迭代平衡。最后,通过数值实验验证了IYSGA算法优越的并行迭代寻优性能与稳健性。
-
- 以最大slice态为信道的受控量子远程控制
- 彭家寅
- 利用三量子最大slice态作为量子信道,提出了单量子酉算子的受控远程执行的两个协议。首先,利用双向量子隐形传态(BQST),给出了一个任意单量子酉算子的受控隐形传输方案。结果表明,通过非最大纠缠信道,发送者能够在遥远的接受者的量子系统上远程地执行一个任意单量子酉算子。如果发送者和控制者对各自量子执行恰当的投影测量,那么量子算子的受控远程执行的成功概率就能达到1。其次,提出了一种不使用BQST方法的部分未知算子的受控远程控制协议。此协议因部分未知算子取自于两个限制集,减少了量子纠缠和经典通信耗费。在这些方案中,当且仅当控制者愿意帮助接受者远程操作,量子算子的受控远程执行才能完成。
