个人介绍
计算机科学与技术本科毕业,主要使用Python完成数据采集、数据清洗、文件转换和小型自动化工具开发。已独立完成公开网页商品数据采集、Excel/CSV清洗去重、PDF表格提取等个人演示项目,熟悉pandas、lxml、pdfplumber以及Excel/CSV数据处理。
工作时会先确认输入文件、字段规则、输出格式和验收标准,重视代码可读性、数据验证、结果检查和使用说明。能够使用Codex辅助开发,但会自行运行、测试和复核最终结果。
目前可承接需求明确的小型Python脚本、公开网页数据采集、Excel/CSV批量处理、PDF表格转Excel以及基础API和后端辅助开发任务。
工作经历
2026-03-03 -至今个人项目(非商业客户项目)Python开发者(个人实践)
以个人学习和作品展示为目的,独立完成Python公开网页商品数据采集、Excel/CSV数据清洗去重和PDF表格提取三个演示项目。项目均使用公开练习网站或人工生成的合成数据,不涉及真实客户资料和商业隐私。 在项目中负责需求拆解、字段设计、Python编码、数据格式转换、结果验证、测试和使用说明整理。使用过pandas、lxml、pdfplumber、正则表达式以及Excel/CSV处理技术。开发过程中使用Codex辅助编写和检查代码,最终由本人运行程序、检查输出结果并整理交付材料。
教育经历
2020-09-10 - 2024-07-06厦门大学嘉庚学院计算机科学与技术本科
资质认证
语言
技能

系统支持逐页读取带表格线的多页PDF,识别采购订单表头并提取订单编号、日期、供应商、分类、商品描述、数量、单价、行金额、币种和状态等内容。程序会统一文本、日期和金额格式,记录每条数据对应的PDF页码及原始行号,并重新计算数量乘以单价的金额,与PDF原金额进行差异比较。结果将标记为PASS或REVIE

系统支持清理姓名、*、**、日期、城市、国家、金额和状态等常见字段;按照标准化后的*识别重复记录,并优先保留信息更完整的数据。程序会记录被合并的原始行号,方便后续审计,同时标记缺少**等需要人工检查的记录。最终输出原始CSV、清洗后CSV、质量统计结果和便于查看的Excel工作簿。




