个人介绍
我是一名爬虫工程师;我毕业于重庆交通大学计算机科学与技术专业,曾担任科技公司爬虫工程师及Python全栈开发工程师;负责过:多平台数据采集系统架构设计:主导Web、APP、小程序端的反爬策略分析与高并发采集框架搭建,解决动态渲染、参数加密、IP封禁等复杂场景;智能化数据清洗与标准化流水线:设计自动化ETL流程,将非结构化网页数据转化为适配电商ERP、供应链系统的结构化格式;全栈业务系统开发:独立完成数据采集后台管理平台及可视化监控工具的前后端开发,实现采集任务调度、日志追踪与异常告警。
熟练使用:核心语言与自动化:Python(Scrapy、DrissionPage、Selenium)、JavaScript逆向;解析与存储:lxml + BeautifulSoup(HTML/XML精准解析)、Re/Json(正则与结构化提取);数据处理与导出:xlsxwriter + DataRecorder(百万级数据批量写入)、Pandas(数据清洗与聚合);GUI与多线程:tkinter / PyQt(桌面端工具开发)、Threading / asyncio(并发任务调度与UI实时交互);全栈补充:Vue.js + Flask/Django(管理后台搭建)、MySQL/Redis(数据缓存与持久化)。
工作经历
2016-07-15 -2018-10-10重庆测试开发工程师
1. 动态网站架构分析与数据提取负责解析目标网站(Dometic)的前端交互逻辑:深入分析商品详情页的 JavaScript 渲染机制(如折叠面板 Accordion、异步加载),精准定位 XPath 与 JSON 结构化数据节点。 制定变体(SKU)采集策略:设计颜色/尺寸多规格商品的抓取逻辑,通过动态拼接 URL 参数(?v=sku)实现不同款式数据的精准切换与去重汇总。 2. 爬虫系统开发与框架搭建 构建高可用采集框架:基于 DrissionPage 封装 Session 请求与 Chromium 浏览器渲染引擎,解决传统 Requests 无法抓取动态内容的痛点,确保复杂交互场景下的数据完整率。实现全品类自动化遍历:编写分页递归逻辑,对预配置的 100+ 个分类目录进行层级遍历,通过列表页商品链接提取,实现海量详情页的自动化调度。 3. 数据清洗与标准化入库 负责数据 ETL 流程:对抓取到的 HTML 源码进行深度清洗(移除冗余 CSS、SVG、广告下载按钮),将非结构化网页内容转化为结构化字段(价格、规格表、高清图链)。
教育经历
2013-09-01 - 2017-07-01重庆交通大学计算机科学与技术本科




