企业内部的产品手册、规章制度、FAQ散落在几十上百个文档里,客服和员工遇到问题要翻半天文件,回复口径还不统一。本项目是一套开箱即用的企业知识库问答系统:上传文档自动解析分片、向量化入库,员工提问时先检索相关知识再交给大模型生成回答,回答附引用来源,让企业知识"一句话就能查到",适合中小团队快速搭建RAG问答能力。
点击空白处退出提示
企业内部的产品手册、规章制度、FAQ散落在几十上百个文档里,客服和员工遇到问题要翻半天文件,回复口径还不统一。本项目是一套开箱即用的企业知识库问答系统:上传文档自动解析分片、向量化入库,员工提问时先检索相关知识再交给大模型生成回答,回答附引用来源,让企业知识"一句话就能查到",适合中小团队快速搭建RAG问答能力。
知识库管理:支持上传PDF、Word、TXT、Markdown等格式文档,自动解析正文并分片(按段落和长度切分),文档列表展示解析进度、分片数和向量化状态,支持删除和重新索引。
智能问答:对话式交互,提问后先对问题做向量检索召回Top-K相关片段,再结合大模型生成带依据的回答,回答底部展示引用来源(文档名、页码、原文片段),点击可查看原文。
多轮对话:支持追问和上下文理解,历史消息自动带上文,对话记录按会话分组保存,可随时回看。
人机协同:回答可点赞/点踩反馈,反馈用于优化检索排序;未命中时自动收集问题,提示补充知识库文档。
知识统计:仪表盘展示文档总数、知识分片数、向量索引量、问答次数与命中率,按文档维度的被引用热度排行,帮助发现知识缺口。
权限管理:区分管理员、知识编辑、普通用户三种角色,管理员管理知识库和模型配置,普通用户只能问答。
技术栈:后端Python + FastAPI,文档解析用python-docx、PyPDF2,分片用递归字符切分,向量化接入Embedding模型接口,向量检索用pgvector(PostgreSQL扩展)做余弦相似度查询,大模型通过OpenAI兼容接口调用,Redis缓存高频问题和会话状态;前端Vue3 + Element Plus,问答页消息流式渲染。
主要负责:文档处理流水线(上传→解析→分片→清洗→向量化→入库,异步任务队列处理,进度实时上报,失败自动重试);向量检索模块(问题Embedding后与知识分片做余弦相似度检索,按阈值过滤弱相关结果,返回Top-K片段);问答接口(检索结果拼装Prompt模板,流式返回回答与引用来源元数据);引用溯源逻辑(回答标注引用序号,前端点击展开原文片段);会话管理(按会话聚合多轮消息,Redis缓存上下文);前端开发问答对话、知识库管理、上传进度、统计仪表盘等页面;权限控制(管理员/知识编辑/普通用户)。







评论