国内刊号:11-5602/TP
国际刊号:1673-9418
发布日期:
作者:郭佳霖, 智敏, 殷雁君, 葛湘巍
单位:内蒙古师范大学 计算机科学技术学院,呼和浩特 010022
关键词:卷积神经网络(CNN),视觉Transformer,混合模型,图像处理,深度学习
基金:内蒙古自然科学基金(2023MS06009);内蒙古高等学校科学研究重点项目(NJZZ21004)。
卷积神经网络(CNN)与视觉Transformer是目前图像处理领域中两大重要的深度学习模型,两者经过多年来不断的研究与进步,已在该领域取得了非凡的成就。近些年来,CNN与视觉Transformer的混合模型正在逐步兴起,广泛的研究不断克服两种模型存在的弱项,高效地发挥出各自的亮点,在图像处理任务中表现出优异的效果。基于CNN与视觉Transformer混合模型进行深入阐述。总体概述了CNN与Vision Transformer模型的架构和优缺点,并总结混合模型的概念及优势。围绕串行结构融合方式、并行结构融合方式、层级交叉结构融合方式以及其他融合方式等四个方面全面回顾梳理了混合模型的研究现状和实际进展,并针对各种融合方式的主要代表模型进行总结与剖析,从多方面对典型混合模型进行评价对比。多角度叙述了混合模型在图像识别、图像分类、目标检测和图像分割等实际图像处理特定领域中应用研究,展现出混合模型在具体实践中的适用性和高效性。深入分析混合模型未来研究方向,并为后续该模型在图像处理中的研究与应用提出展望。
来源:2025年第1期
《计算机科学与探索》期刊编辑部