是一个保险条款知识工程系统:把各家保司以 PDF 发布的、法律化、非结构化的保险条款,通过纯本地、零外部调用的方式自动转化为结构化数据,再基于向量检索 + RAG + 对比引擎,让普通用户和从业者能够快速读懂条款、精准查询、公平对比保险产品,同时用隐私优先和成本可控的架构支撑规模化。
点击空白处退出提示
是一个保险条款知识工程系统:把各家保司以 PDF 发布的、法律化、非结构化的保险条款,通过纯本地、零外部调用的方式自动转化为结构化数据,再基于向量检索 + RAG + 对比引擎,让普通用户和从业者能够快速读懂条款、精准查询、公平对比保险产品,同时用隐私优先和成本可控的架构支撑规模化。
1. 条款结构化提取:纯正则零外部API,自动解析平安/人保/太保/太平等40+款保险PDF,提取免赔额、赔付比例、等待期、免责、病种数、身故责任等5-9个维度,置信度最高98%。
2. 智能检索:三阶段混合检索——BM25关键词+分词、BGE语义向量、RRF融合+Cross-Encoder精排,支撑精确与语义双重查询。
3. RAG问答:语义分块+渐进压缩Prompt(零硬截断),支持DeepSeek/OpenAI/Anthropic/Ollama,SSE流式返回带来源引用,三层去重缓存命中不扣配额。
4. 产品对比:7类险种×核心维度,自动发现差异与独有字段,启发式判定"A更优",生成对比报告。
5. 自动更新:Agent管道检测6家保司条款变更,增量下载、重提取、重建索引并生成报告。
6. 多端交互:FastAPI后端20个端点+React前端,支持检索/问答/对比/统计/认证与对话管理。
由我从0-1全权负责:
提取层:PyMuPDF+pdfplumber解析PDF;ClauseSegmenter按标题分段;按险种工厂路由到正则提取器(医疗/重疾/年金/寿险/失能/家财),LLM缓存经manifest白名单+签名校验自动合并。
检索层:jieba+BM25关键词检索,BGE-large-zh向量化入Milvus Lite,结构化数值注入chunk区分产品;RRF(k=60)融合双集合,bge-reranker精排Top30→Top5。
问答层:Semantic Chunk语义去重+Self-Contained摘要头,倒金字塔分层,L0-L5渐进压缩零硬截断;tiktoken/字符双模估算token。
后端:FastAPI 20端点+SSE流式(search_stage/sources/delta/done五事件);PostgreSQL/JSON双后端。
前端:React18+TS+Vite+AntD,Zustand状态管理,SSE进度指示、对比视图、来源抽屉。
自动更新:公共基类整合6抓取器,Agent四层管道(变更检测→增量下载→提取索引→报告)。






评论