这是一个面向企业采购、订单整理和财务对账场景的个人演示项目。多页PDF报表中的采购订单通常需要人工复制到Excel,不仅耗时,还容易发生漏行、金额录入错误和来源无法追溯等问题。本项目使用Python自动识别并提取PDF中的表格,将订单记录转换为结构化数据,同时保留原始页码和行号,便于后续筛选、统计与复核。
点击空白处退出提示
这是一个面向企业采购、订单整理和财务对账场景的个人演示项目。多页PDF报表中的采购订单通常需要人工复制到Excel,不仅耗时,还容易发生漏行、金额录入错误和来源无法追溯等问题。本项目使用Python自动识别并提取PDF中的表格,将订单记录转换为结构化数据,同时保留原始页码和行号,便于后续筛选、统计与复核。
系统支持逐页读取带表格线的多页PDF,识别采购订单表头并提取订单编号、日期、供应商、分类、商品描述、数量、单价、行金额、币种和状态等内容。程序会统一文本、日期和金额格式,记录每条数据对应的PDF页码及原始行号,并重新计算数量乘以单价的金额,与PDF原金额进行差异比较。结果将标记为PASS或REVIEW,最后输出可直接用于Excel的数据文件。
本项目由我独立完成字段设计、PDF解析、数据验证、Python编码和结果检查。使用pdfplumber根据表格线识别并读取单元格,通过预期表头过滤无关内容;使用正则表达式解析金额,再利用pandas统一日期和数值格式、删除重复订单并生成验证字段。演示PDF包含3页人工生成的采购订单数据,不涉及真实客户或商业隐私。程序最终提取48条唯一订单记录和15个结构化字段,48条记录均通过金额一致性验证。开发过程中使用Codex辅助编写和检查代码,最终由我本人运行并核验结果。





评论