中小企业与事业单位的规章制度、合同、施工规范、操作手册等资料分散在硬盘、网盘和微信群里,员工查询一条规定要翻找很久,人事与行政每天还要重复回答同样的问题。本项目面向这类知识密集型场景,把散落的文档统一入库,让员工用自然语言提问即可获得答案,并标注原文出处,解决“资料找不到、答案不可信”的核心问题。
点击空白处退出提示
中小企业与事业单位的规章制度、合同、施工规范、操作手册等资料分散在硬盘、网盘和微信群里,员工查询一条规定要翻找很久,人事与行政每天还要重复回答同样的问题。本项目面向这类知识密集型场景,把散落的文档统一入库,让员工用自然语言提问即可获得答案,并标注原文出处,解决“资料找不到、答案不可信”的核心问题。
系统包含文档管理、知识库问答、引用溯源三个核心模块。文档管理支持上传 PDF、Word、TXT、Markdown 等格式,自动完成文本解析、切分与向量化入库;知识库问答采用语义检索与大模型生成结合的方式,员工输入自然语言问题后返回结构化答案;引用溯源为每条结论标注对应的文件名、段落与相似度,并展示原文片段供核对,避免大模型编造。系统同时支持知识库文档列表管理、内网私有化部署,以及访问口令、单 IP 次数限制、文件类型与大小校验等防滥用措施。
我独立负责该项目的全部开发工作:需求梳理、架构设计、后端接口、检索链路、前端页面与部署方案。技术栈为 Python + FastAPI 提供接口服务,ChromaDB 作为向量库,BAAI/bge-m3 生成文本向量,DeepSeek 大模型负责答案生成,前端使用原生 HTML/JavaScript,通过 Docker 部署交付。实现上的难点:一是把检索结果与大模型生成严格绑定,通过强制引用编号和“检索不到就明确说明”的提示词约束,显著降低编造内容的概率;二是做了向量模型签名校验,模型或维度变化时自动重建索引,避免不同向量空间混用导致检索错乱;三是在缺少密钥或外部接口异常时自动降级为离线摘录模式,保证演示与交付环境始终可用。



评论