当前家庭安防设备主要依赖摄像头和红外传感器,存在隐私敏感、夜间识别受限、无法感知声音异常等痛点。本项目旨在设计一款基于边缘计算的声音事件识别设备,通过麦克风采集环境音频,在设备端完成特征提取与CNN推理,识别婴儿哭声、玻璃破碎声、敲门声等异常事件,并通过MQTT协议推送报警至移动端。该方案无需联网传输原始音频,仅发送报警事件,兼顾隐私保护与实时响应,适用于家庭、酒店、独居老人监护等场景。
点击空白处退出提示
当前家庭安防设备主要依赖摄像头和红外传感器,存在隐私敏感、夜间识别受限、无法感知声音异常等痛点。本项目旨在设计一款基于边缘计算的声音事件识别设备,通过麦克风采集环境音频,在设备端完成特征提取与CNN推理,识别婴儿哭声、玻璃破碎声、敲门声等异常事件,并通过MQTT协议推送报警至移动端。该方案无需联网传输原始音频,仅发送报警事件,兼顾隐私保护与实时响应,适用于家庭、酒店、独居老人监护等场景。
本系统分为三个核心模块:
音频采集与预处理模块:以16kHz采样率采集环境声音,在ESP32-S3上实时完成预加重、分帧、加汉明窗等预处理流水线,并提取40维×32帧MFCC特征图;
轻量级CNN推理模块:自设计3层卷积神经网络(Conv2D+MaxPooling+GlobalAveragePooling),经数据增强后测试准确率达81.82%,模型经过INT8量化后可在ESP32上以约80ms完成单次推理;
报警推送模块:检测到异常事件后,通过MQTT协议接入OneNET云平台,并开发PWA(渐进式Web应用)实现移动端实时报警推送与历史事件记录查询。
本项目由我独立完成,负责从硬件选型、算法设计到云端对接的全链路开发。
技术栈:ESP32-S3、ESP-IDF开发框架、TensorFlow Lite Micro、Librosa(音频特征提取)、MQTT协议、OneNET云平台、PWA(Vue3)。
实现亮点:在资源受限的MCU上实现了完整的实时音频信号处理流水线和CNN推理;采用INT8量化将模型体积压缩至1/4(从约300KB降至75KB),推理速度达80ms/次,满足实时性要求;通过MQTT长连接+指数退避重连机制保障报警推送的可靠性与稳定性。
核心难点:嵌入式端MFCC实时计算的时序优化;量化后模型精度损失控制在1.5%以内;在满足实时性的前提下平衡算力与功耗。



评论