基于大语言模型的智能知识库问答系统产品系统

我要开发同款
冰仔2026年08月20日
5阅读

技术信息

语言技术
PythonSQLServer前端
系统类型
Web
行业分类
企业服务人工智能

作品详情

行业场景

面向企业内部知识管理、客服支持、教育培训等场景,解决传统文档"存了却找不到、找到了看不完"的痛点。团队/个人可将产品手册、培训资料、规章制度、技术文档等批量上传,系统自动构建可检索的知识库,员工或用户通过自然语言提问即可快速获取准确答案,无需再逐份翻找原始文档。相比传统关键词搜索,基于语义理解的检索能识别同义表达和上下文关联,命中率更高;相比直接依赖通用大模型问答,答案严格基于已上传文档内容生成并标注引用来源,避免"一本正经胡说八道"的幻觉问题,适合对答案准确性和可追溯性要求较高的企业内部场景。

功能介绍

① 用户体系:注册/登录,密码 bcrypt 加盐哈希存储,会话保持;② 文档管理:支持 PDF/Word/TXT 上传,自动解析、清洗、滑窗分块(500字块长+50字重叠),异步显示处理状态,支持删除并联动清理向量数据;③ 智能问答:接入 DeepSeek 大模型,采用检索增强生成(RAG)架构——先对用户问题进行拆解生成子问题,多路检索知识库后按向量相似度合并去重,再交由大模型生成答案;创新点在于设计了基于相似度阈值的智能路由机制,能自动判断问题是否与已上传文档相关:相关则基于文档内容作答并标注引用来源及相关度分值,不相关则自动切换为大模型通用回答并明确提示用户,避免检索到不相关内容却被强行用于回答的问题;④ 历史记录:问答记录可查询、关键词搜索、导出CSV;⑤ 部署:提供 Docker 容器化部署方案,支持一键在 Linux 服务器上运行。

项目实现

前端采用 Streamlit 快速构建交互界面,多页面路由实现登录、文档管理、问答、历史记录模块解耦;后端数据层使用 SQLAlchemy ORM + SQLite 管理用户、文档、文本块、问答记录四张核心表;向量检索层基于 ChromaDB 的 PersistentClient 实现本地持久化,文本向量化优先尝试 DeepSeek Embedding 接口,接口不可用时自动降级为本地 sentence-transformers 多语言模型,保证功能可用性不受外部接口限制;大模型调用层通过 OpenAI 兼容协议对接 DeepSeek API,实现问题拆解、多路检索、生成式回答的完整 RAG 流程。项目编写了完整的单元测试(覆盖认证、文档解析、分块、RAG主流程),并支持 Docker/Docker Compose 一键部署,具备工程化交付水准。

示例图片

声明:本文仅代表作者观点,不代表本站立场。如果侵犯到您的合法权益,请联系我们删除侵权资源!如果遇到资源链接失效,请您通过评论或工单的方式通知管理员。未经允许,不得转载,本站所有资源文章禁止商业使用运营!
下载安装【程序员客栈】APP
实时对接需求、及时收发消息、丰富的开放项目需求、随时随地查看项目状态

评论