面向会议设备、录音设备及智能硬件中的多麦克风语音拾音场景,不同方向、距离的说话人和环境噪声会同时进入麦克风阵列,传统单通道降噪难以实现精确的空间选择。
本项目基于多通道麦克风阵列构建语音分区模型,利用不同麦克风之间的能量差、相位差和空间特征,对目标方向、目标距离范围内的语音进行保留,同时抑制侧向干扰、远距离人声及环境噪声。
模型支持不同拾音区域配置,可用于近距离定向拾音、远场空间分区及目标说话人增强等场景。
点击空白处退出提示
面向会议设备、录音设备及智能硬件中的多麦克风语音拾音场景,不同方向、距离的说话人和环境噪声会同时进入麦克风阵列,传统单通道降噪难以实现精确的空间选择。
本项目基于多通道麦克风阵列构建语音分区模型,利用不同麦克风之间的能量差、相位差和空间特征,对目标方向、目标距离范围内的语音进行保留,同时抑制侧向干扰、远距离人声及环境噪声。
模型支持不同拾音区域配置,可用于近距离定向拾音、远场空间分区及目标说话人增强等场景。
系统支持多通道 PCM/WAV 音频输入,并根据预设空间区域进行目标语音增强。
主要功能包括:
多通道音频同步读取与预处理;
STFT 时频分析;
LPS、IPD、ILD 等多通道空间特征提取;
多特征融合与深度学习模型推理;
目标区域时频 Mask 预测;
目标语音增强及干扰语音抑制;
支持不同角度和距离范围配置;
支持近场、远场及同方向干扰场景;
支持流式和离线模型推理;
提供 SNR、STOI、SDR 等效果评测及方向响应分析。
系统可用于会议录音、智能硬件、语音识别前端及定向拾音设备。
项目基于 Python + PyTorch 完成训练和算法验证,并通过 ONNX/C++ 完成工程化部署。
首先对多通道音频执行 STFT,将时域信号转换为时频表示,并提取参考通道 LPS 以及麦克风对之间的 IPD、ILD 等空间特征。
模型通过特征交互模块学习不同空间信息之间的关联,并结合时序网络对目标区域语音进行建模,最终预测时频 Mask,对参考麦克风频谱进行增强。
数据侧通过多种房间尺寸、混响时间、声源角度、距离、SNR 及干扰类型进行声学仿真,提高模型对不同环境的泛化能力。
工程侧完成 PyTorch 到 ONNX 的模型转换、离线/流式推理一致性验证,并支持在 Linux/ARM 等环境中进行部署和实时处理。



评论