文档型资料(产品手册、内部制度、常见问题库)想做成可提问的问答服务,但有两个硬约束:答案必须标注来源出处以便人工核对,且不能依赖按次计费的云 API;涉密资料还要求完全不出内网。这类需求常见于文档沉淀量大、同时对数据外流敏感的团队与个人。
点击空白处退出提示
文档型资料(产品手册、内部制度、常见问题库)想做成可提问的问答服务,但有两个硬约束:答案必须标注来源出处以便人工核对,且不能依赖按次计费的云 API;涉密资料还要求完全不出内网。这类需求常见于文档沉淀量大、同时对数据外流敏感的团队与个人。
把静态文档目录变成可检索、可问答的私有知识库。功能模块:① 数据链路——扫描文档目录、按语义切片、本地生成向量、写入知识库集合,四步串联;② 异步构建——后台任务负责 embedding,通过状态轮询获取进度,避免长任务阻塞主流程;③ 连接隔离——每个任务使用独立数据连接,避免文件句柄耗尽导致进程挂掉;④ 目录过滤——排除低信噪比的历史归档目录,提升检索命中质量;⑤ 增量更新——向量支持按需重传,不需要每次重建全库。
我独立完成从数据链路到问答接口的全部设计与开发。技术栈:Python、本地 Embedding 模型、向量检索、Open WebUI 知识库接口、REST。实现亮点:一是异步 embedding 配合状态轮询,长任务不阻塞主流程;二是任务级独立连接,解决批量导入时的句柄耗尽问题;三是目录级过滤与切片策略调优,明显提升检索命中质量。结果:提问返回答案并标注来源出处,可逐条人工核对;整套系统可断网运行,无按次计费的 API 成本;资料不出内网。



评论