国内刊号:11-5602/TP
国际刊号:1673-9418
发布日期:
作者:翟海琳, 刘立群
单位:甘肃农业大学 信息科学技术学院,兰州 730070
关键词:异源图像,图像融合,并行双分支结构,通道-正余弦位置编码视觉转换器,苹果目标检测
基金:国家自然科学基金(32460440);甘肃省高校教师创新基金项目(2023A-051)。
异源图像融合旨在将不同模态图像中的互补信息融合到一张图像上,生成包含丰富纹理细节和显著目标的融合图像。针对传统的卷积神经网络(CNN)方法无法有效提取图像中的全局上下文信息,且基于Transformer的图像融合方法无法建立不同模态图像之间的完整全局依赖关系,提出一种基于CNN和通道-正余弦位置编码视觉转换器的并行双分支异源图像融合方法,并将其应用于苹果目标检测,实现在果园复杂场景下准确识别果实和精准定位目标。该方法采用编码器-解码器结构,其中,编码器并行采用CNN和通道-正余弦位置编码视觉转换器(Channel Transformer-SPEViT)两个分支,同时提取图像的局部和全局信息;设计一种结合最大值的平均策略融合来自不同模态图像的特征。实验结果表明,所提方法在多个客观评价指标上优于现有图像融合方法,得到的融合图像细节纹理丰富,具有较好的视觉效果,其中,在TNO数据集上,所提方法在EN、MI、VIF、Qabf指标上较次优方法分别提升0.10%、25.32%、16.97%、2.50%;在MSRS数据集上,所提方法在EN、MI、VIF、Qabf指标上较次优方法分别提升0.30%、15.85%、7.72%、3.07%;在RoadScene数据集上,所提方法在EN、MI、SD、VIF、Qabf指标上较次优方法分别提升0.86%、13.41%、3.41%、11.29%、3.19%。将所提方法应用于苹果目标检测,检测模型平均精度(mAP50)由可见光图像的65.4%提升到79.3%。
来源:2026年第3期
《计算机科学与探索》期刊编辑部