国内刊号:11-2422/TN
国际刊号:1001-506X
发布日期:
作者:韦娟, 丁智恺, 宁方立
单位:1. 西安电子科技大学通信工程学院, 陕西 西安 710071;2. 西北工业大学机电学院, 陕西 西安 710072
关键词:声场景分类,深度卷积神经网络,声谱图提取神经网络,梅尔频谱
基金:国家自然科学基金(52075441);陕西省重点研发计划项目(2018GY-181);陕西省重点研发计划项目(2020ZDLGY06-09)
在复杂环境声场景识别任务中, 梅尔频谱作为输入的深度卷积神经网络有良好的识别能力, 然而梅尔滤波器组依据人耳生理特征设计, 对于声场景识别并非最优滤波器组。针对此问题提出声谱图提取神经网络取代传统梅尔频谱提取过程, 通过训练该网络使声谱图自动适应声场景数据集。声谱图提取神经网络连接ResNet50作为声场景识别架构, 在DCASE2019声场景数据集上进行训练与测试, 实验结果表明该架构比传统模型有更高的识别率, 能够有效调整频率曲线、滤波器幅值以及滤波器形状。
来源:2021年第12期
《系统工程与电子技术》期刊编辑部