面向公司年度报告问答场景,搭建从 PDF 解析、文本分块、向量化入库到检索生成的完整 RAG Pipeline,支持按公司隔离知识库、LLM 重排序、结构化答案输出和页码级引用校验。
点击空白处退出提示
面向公司年度报告问答场景,搭建从 PDF 解析、文本分块、向量化入库到检索生成的完整 RAG Pipeline,支持按公司隔离知识库、LLM 重排序、结构化答案输出和页码级引用校验。
· 企业年报离线入库: 使用 MinerU 将年报 PDF 解析为 Markdown,结合 TextSplitter 按合适的 chunk 切分并保留 overlap 重叠,通过 subset.csv 补充公司名与 SHA1 元数据,生成公司级 chunk JSON 与 Faiss 向量索引。
· 公司级检索路由: 基于公司白名单从用户问题中提取公司名,先定位对应年报及 Faiss 索引,再在公司范围内进行语义检索,避免跨公司文档混检造成的答案污染。
· 两阶段召回与重排序: 采用“Faiss 初筛 + LLM 重排”的两阶段检索策略,默认先召回 30 个候选 chunk,再通过 LLM 判断问题与候选内容的相关性,最终保留 Top 10 结果构造 RAG 上下文。
· 结构化答案生成: 针对文本、数字、布尔值、公司名称列表和比较类问题设计不同 Pydantic Schema,输出结构化答案、推理摘要和相关页码,提升结果可解析性。
· 多公司比较处理: 对包含多个公司的问题拆分为公司级子问题,分别执行独立检索与回答,再聚合各公司的结果及引用。
Python · MinerU · DashScope/Qwen · Faiss · LangChain · Streamlit



评论