面向个人知识工作者与技术研发人员的私有知识库管理场景。通用大模型问答虽然已经免费开放,但存在两个问题:
1. 无法基于用户自己的私有文档回答(论文、技术手册、个人笔记)
2. 文档散落在本地文件夹时检索利用率极低。本项目针对"基于私有文档的精准检索与智能问答"这一需求,将散落的 PDF/TXT 文档集中托管、自动分段向量化,并接入大模型实现"问自己文档里的事"的能力,适用于科研资料管理、技术文档沉淀、个人知识库建设等业务背景
点击空白处退出提示
面向个人知识工作者与技术研发人员的私有知识库管理场景。通用大模型问答虽然已经免费开放,但存在两个问题:
1. 无法基于用户自己的私有文档回答(论文、技术手册、个人笔记)
2. 文档散落在本地文件夹时检索利用率极低。本项目针对"基于私有文档的精准检索与智能问答"这一需求,将散落的 PDF/TXT 文档集中托管、自动分段向量化,并接入大模型实现"问自己文档里的事"的能力,适用于科研资料管理、技术文档沉淀、个人知识库建设等业务背景
1. 文档管理:支持 txt / pdf 上传,文档自动解析、分段、向量化索引,索引状态可视化(索引中/就绪),文件元信息完整记录
2. 版本控制:同一文档支持多次重新索引生成新版本,旧版本自动失效,支持一键回滚——索引策略调整可逆,不会因一次错误重建丢失历史状态
3. 智能搜索:基于向量相似度检索用户私有文档,结合大模型生成带依据的回答,中文场景下使用中文分词优化检索精度
4. 访问控制:登录鉴权,文档与知识库私有化访问
- 前端:React 实现“文档管理 / 智能搜索”双模块工作台,索引状态、版本流转(构建中 → 就绪 → 失效)、回滚操作均有完整交互反馈
- 后端:Java 实现文档解析、分段、向量化、检索与问答链路;PostgreSQL + pgvector 向量存储,集成中文分词插件
- 部署:Docker Compose 容器化(前端 / 后端 / 数据库三容器),反向代理统一入口
- 工程细节:索引全流程异步化,文档版本状态机完整(BUILDING → READY → INACTIVE),实测 341 个分段约 6.5 秒完成索引,可支撑持续迭代的索引策略实验





评论