行业:企业 IT 支持 / 内部知识库 / 客服。
- 背景:企业的 IT 故障排查手册和政策文件里全是错误代码、阈值和操作步骤,员工宁愿问人也不想翻文档。这个助手让员工直接用语音提问,几
秒内就能听到答案。
点击空白处退出提示
语言技术
Python、HTML5、CSS、JavaScript、React系统类型
Web行业分类
人工智能演示地址
https://github.com/FENGFANCHEN-012/Voice_ChatBot
行业:企业 IT 支持 / 内部知识库 / 客服。
- 背景:企业的 IT 故障排查手册和政策文件里全是错误代码、阈值和操作步骤,员工宁愿问人也不想翻文档。这个助手让员工直接用语音提问,几
秒内就能听到答案。
1. 文档上传:拖入 PDF 后自动解析、切块、生成向量、建索引,处理进度实时显示在界面上。
2. 语音或文字提问:可以录音也可以打字,答案逐字流式显示。
3. 边生成边朗读:前端把流式答案按句子切开,每句写完就马上合成语音,不用等整段答案生成完才开始播放。
4. 答案有出处:每个答案都标出引用的段落和页码,并且只根据文档内容回答。
5. 多会话管理:可以新建、重命名、删除对话,追问时会带上历史。
6. 能精准匹配专有名词:提问前先做查询规范化,展开缩写、提取错误码,像 ERR-SSO-4039 这样的精确字符串也能搜到。
7. CPU 和 GPU 自适应:自动检测 CUDA。有 GPU 时还会额外开启问题分类(事实型、推理型、比较型、摘要型、离题)和查询改写。
前端 : React 18、TypeScript、Vite、Tailwind;录音用 MediaRecorder,播放用 Web Audio API
后端:FastAPI;答案流用 SSE,语音流用 WebSocket
文档处理:FastAPI;答案流用 SSE,语音流用 WebSocket
检索:BGE-M3 向量(ChromaDB)加 BM25 关键词,用 RRF 合并,再由 BGE-reranker-v2-m3 精排出 Top 15
生成: DeepSeek-V3 为主,Gemini 备用(遇到配额限制时自动切换模型);有查询缓存
语音: 识别用 faster-whisper;合成在 GPU 上用 Kokoro,在 CPU 上用 Edge TTS;音频有缓存
部署:本地用 Docker Compose;GPU 版跑在 Google Colab 上,通过 ngrok 对外开放



评论