语音文档问答助手产品系统

我要开发同款
陈风帆 Billy2026年10月09日
2阅读

技术信息

语言技术
Python、HTML5、CSS、JavaScript、React
系统类型
Web
行业分类
人工智能
演示地址
https://github.com/FENGFANCHEN-012/Voice_ChatBot

作品详情

行业场景

行业:企业 IT 支持 / 内部知识库 / 客服。
- 背景:企业的 IT 故障排查手册和政策文件里全是错误代码、阈值和操作步骤,员工宁愿问人也不想翻文档。这个助手让员工直接用语音提问,几
秒内就能听到答案。

功能介绍

1. 文档上传:拖入 PDF 后自动解析、切块、生成向量、建索引,处理进度实时显示在界面上。
2. 语音或文字提问:可以录音也可以打字,答案逐字流式显示。
3. 边生成边朗读:前端把流式答案按句子切开,每句写完就马上合成语音,不用等整段答案生成完才开始播放。
4. 答案有出处:每个答案都标出引用的段落和页码,并且只根据文档内容回答。
5. 多会话管理:可以新建、重命名、删除对话,追问时会带上历史。
6. 能精准匹配专有名词:提问前先做查询规范化,展开缩写、提取错误码,像 ERR-SSO-4039 这样的精确字符串也能搜到。
7. CPU 和 GPU 自适应:自动检测 CUDA。有 GPU 时还会额外开启问题分类(事实型、推理型、比较型、摘要型、离题)和查询改写。

项目实现

前端 : React 18、TypeScript、Vite、Tailwind;录音用 MediaRecorder,播放用 Web Audio API
后端:FastAPI;答案流用 SSE,语音流用 WebSocket
文档处理:FastAPI;答案流用 SSE,语音流用 WebSocket
检索:BGE-M3 向量(ChromaDB)加 BM25 关键词,用 RRF 合并,再由 BGE-reranker-v2-m3 精排出 Top 15
生成: DeepSeek-V3 为主,Gemini 备用(遇到配额限制时自动切换模型);有查询缓存
语音: 识别用 faster-whisper;合成在 GPU 上用 Kokoro,在 CPU 上用 Edge TTS;音频有缓存
部署:本地用 Docker Compose;GPU 版跑在 Google Colab 上,通过 ngrok 对外开放

示例图片

声明:本文仅代表作者观点,不代表本站立场。如果侵犯到您的合法权益,请联系我们删除侵权资源!如果遇到资源链接失效,请您通过评论或工单的方式通知管理员。未经允许,不得转载,本站所有资源文章禁止商业使用运营!
下载安装【程序员客栈】APP
实时对接需求、及时收发消息、丰富的开放项目需求、随时随地查看项目状态

评论