国内刊号:11-5602/TP
国际刊号:1673-9418
发布日期:
作者:张雨萌, 张欣, 高谋, 赵虎林
单位:1. 对外经济贸易大学 外国语学院,北京 1001052. 中国人民解放军总医院研究生院 统计学与流行病学教研室,北京 1008533. 中国人民解放军总医院第一医学中心 神经外科医学部,北京 100853
关键词:语音情感识别,梅尔频谱图,多层感知机,动态卷积,注意力机制
基金:国家自然科学基金(82271397);国家自然科学基金青年基金(82001293)。
语音情感识别技术通过分析语音信号推断说话者情绪,增强人机交互的自然性和智能性。然而,现有模型往往忽视时频语义信息,影响识别准确性。为此,提出了一种融合动态卷积与注意力机制的多层感知机模型,显著提高了情感识别的准确度及信息利用效率。将输入的语音信号转化为梅尔频谱图,捕捉信号细节变化,更贴切地反映人类对声音的感知,为后续特征提取奠定了基础。通过词元化处理将梅尔频谱图转化为词元,降低了数据的复杂性。借助动态卷积与分离注意力机制高效提取关键的时频特征。一方面,动态卷积能够适应不同时间和频率上的尺度变化,优化了特征捕捉效率;另一方面,分离注意力机制增强了模型对关键信息的聚焦能力,有效提升了模型对特征的表达能力。结合动态卷积与分离注意力机制的优势,该模型能够更加充分地提取关键声学特征,从而实现了更高效、更精准的情感识别。在RAVDESS、EmoDB和CASIA三个语音情感数据库上的测试显示,模型识别准确率显著优于现有技术,达到86.11%、95.33%和82.92%。这验证了模型在复杂情感识别任务的高效性和准确性,以及动态卷积和注意力机制的有效性。
来源:2025年第4期
《计算机科学与探索》期刊编辑部