企业和个人通常积累了大量项目文档、产品手册、技术规范和业务资料,但传统文件夹管理难以快速定位具体内容。将敏感资料直接上传至在线平台还可能带来隐私风险。本项目面向个人开发者和小团队,在本机完成文档导入、分块、索引、检索和历史管理,并可选择接入兼容OpenAI的模型服务,生成带原文引用的知识问答结果。
点击空白处退出提示
企业和个人通常积累了大量项目文档、产品手册、技术规范和业务资料,但传统文件夹管理难以快速定位具体内容。将敏感资料直接上传至在线平台还可能带来隐私风险。本项目面向个人开发者和小团队,在本机完成文档导入、分块、索引、检索和历史管理,并可选择接入兼容OpenAI的模型服务,生成带原文引用的知识问答结果。
系统支持TXT、Markdown、文本型PDF和DOCX文档导入,也可递归扫描整个资料文件夹。通过SHA-256文件指纹识别未变化文档,避免重复建立索引;使用重叠分块和SQLite FTS5建立本地全文检索,并为中文连续关键词提供匹配兜底。检索结果展示文件名、片段编号、完整路径及原文内容。系统提供本地摘要问答和OpenAI兼容模型问答,回答附带引用编号,模型连接失败时自动退回本地模式。同时支持问答历史、操作日志、知识库统计、文档移除、重新索引及结果导出。
本人独立完成文档解析、数据存储、全文检索、问答服务、桌面界面和安全设置设计。使用PySide6构建多标签桌面界面,使用SQLite保存文档元数据、索引、问答历史和操作日志;使用FTS5相关度排序并增加中文关键词查询兜底。通过SHA-256实现文档更新检测,使用带重叠的文本分块提高上下文连续性。设计OpenAI兼容接口,将相关片段和最近问答历史组装为模型上下文,并要求模型严格依据资料回答。API密钥仅保存在进程内存中,不写入配置文件;模型异常时显示真实错误并自动生成本地引用摘要。目前已预留PaddleOCR扫描PDF适配层。



评论