企业知识库 AI 助手(RAG 智能问答)产品系统

我要开发同款
彦辰2026年09月28日
7阅读

技术信息

语言技术
Python、Nginx、Docker、HTTP、NLP
系统类型
Web、算法模型
行业分类
人工智能、企业服务

作品详情

行业场景

企业内部制度、产品手册、FAQ 散落在 PDF 和 Word 里,员工找答案靠翻文件、问同事,新人上手慢,HR 和客服每天重复回答相同问题。本项目让员工用自然语言提问,系统从企业自己的文档中检索依据并生成回答,同时附上出处,适用于企业内部知识管理、客服知识库、医院/学校制度问答等场景。

功能介绍

1. 文档管理:支持上传 PDF、Word、Markdown,自动解析、清洗、分块并建立索引;启动时可批量导入。
2. 智能问答:自然语言提问,检索相关段落后由大模型生成回答,流式逐字输出,回答下方列出引用的原文片段和文件名,可追溯。
3. 部门权限:按账号所属部门过滤可检索的文档,销售部看不到人事部的薪酬文件,管理员可查看全部。
4. 模型可配置:兼容 OpenAI 协议的任意大模型服务(DeepSeek、通义千问、硅基流动等),可自动选择可用模型。
5. 部署:提供 Docker、docker-compose 和 Nginx 反向代理配置,一条命令即可部署。

项目实现

独立完成需求设计、后端、前端、部署全部工作。
技术栈:Python + FastAPI 后端,SSE 流式输出,前端原生 HTML/JS,Docker + Nginx 部署。
亮点与难点:
1. 中文检索采用 BM25(中文二元分词,无需词典),可选叠加向量检索,两路结果用 RRF 融合排序,兼顾关键词精确匹配和语义相似。
2. PDF 提取文字常出现康熙部首等"长得一样但编码不同"的字符导致检索不到,做了 NFKC 归一化和部首字修正表,并合并 PDF 断行。
3. 权限在检索阶段就过滤,避免越权内容进入大模型上下文。
4. Nginx 反代下关闭缓冲(X-Accel-Buffering),保证流式输出不卡顿。

示例图片

声明:本文仅代表作者观点,不代表本站立场。如果侵犯到您的合法权益,请联系我们删除侵权资源!如果遇到资源链接失效,请您通过评论或工单的方式通知管理员。未经允许,不得转载,本站所有资源文章禁止商业使用运营!
下载安装【程序员客栈】APP
实时对接需求、及时收发消息、丰富的开放项目需求、随时随地查看项目状态

评论