随着企业文档类型日益多样(PDF/DOCX/PPTX/XLSX/HTML/图片/音频),知识分散在多个业务系统,员工查找信息成本高、答案来源不可信、无法审计;同时长任务(索引 / 向量化 / 解析)与 Web 请求争抢同一进程,导致"前台被后台拖垮",5 类访问入口互拖后腿。企业亟需一个能从多源文件接入、可信知识生产、组织与检索,最终多端交付的完整闭环平台——既要知识可信、答案可追溯,也要生产架构扛得住并发。本项目正是面向这一复合痛点,提供 RAG Chat / REST API / MCP / Dify 多端智能问答能力,做到答案可追溯、命中可解释、运营可观测。
平台覆盖五大核心环节:①多源文档接入:支持 PDF/DOCX/PPTX/XLSX/HTML/图片/音频多源摄入,经解析分块入库;②可信知识生产:基于 Embedding + Milvus 构建向量库,结合 Wiki 实体页与关系图谱;③知识组织:实体 + 关系 + 来源分块,形成可治理的知识资产;④智能检索:7 步结构化查询理解(用户问 → LLM 意图理解 → 实体落地校准 → 分类路由 → 确定性查询 → 证据汇聚 → 生成回答),配合文档通道(向量召回 + BM25 + 混合检索 + Reranker)、Wiki 通道(页面 + 实体关系 + 来源分块)、精选问答通道(标准答案优先)三条取证通道,做到答案来源可追溯、命中可解释;⑤多端交付:RAG Chat / REST API / MCP / Dify 四端接入,配套 Token 范围授权与调用审计。生产架构上基于 PostgreSQL 持久化队列实现 Web 与重任务解耦(无需 Nginx / 消息队列),独立 Index/Wiki Worker + 4 核(1×2 索引 / 1×1 Wiki)/ 10 核+(2×2 索引 / 1×2 Wiki)弹性配置,做到"前台不再被后台拖垮"。底座采用 PostgreSQL + MinIO + Redis + 调度器,支持超管 / 所有者 / 读写协作者分级权限。
本人作为全栈研发 + 架构治理,主导端到端架构与五环节闭环落地,搭建"需求澄清 → 根因诊断 → 架构设计 → 全栈实现 → 真实测试 → 部署交付与复盘"6 步交付闭环,覆盖六类核心贡献:智能检索与知识可信、生产架构与任务可靠性、产品体验与知识管理、企业权限与外部集成、可观测性与故障诊断、质量保障与交付闭环。技术亮点:基于 PostgreSQL LISTEN/NOTIFY + 任务表实现持久化队列(零额外消息队列依赖)、7 步结构化查询理解与三通道证据汇聚、4/10 核弹性 Worker 编排。在 Vibe Coding 工作模式下,借助 Cursor + Claude Code 快速生成数据访问层、API 路由骨架、单元测试与文档模板,把精力集中到检索质量调优、并发与可靠性治理、知识库组织规范上,迭代效率显著提升。累计 325 次 Git 提交、56,471 行代码变更、34 个自动化测试脚本、419 个测试断言、218 个受版本管理文件。
声明:本文仅代表作者观点,不代表本站立场。如果侵犯到您的合法权益,请联系我们删除侵权资源!如果遇到资源链接失效,请您通过评论或工单的方式通知管理员。未经允许,不得转载,本站所有资源文章禁止商业使用运营!

下载安装【程序员客栈】APP
实时对接需求、及时收发消息、丰富的开放项目需求、随时随地查看项目状态
评论