爬尔曼
1月前来过
全职 · 300/日  ·  6525/月
工作时间: 工作日09:30-22:00、周末09:30-19:00工作地点: 远程
服务企业: 0家累计提交: 0工时
聊一聊

APP聊一聊

个人介绍

我是一名爬虫工程师;我毕业于重庆交通大学计算机科学与技术专业,曾担任科技公司爬虫工程师及Python全栈开发工程师;负责过:多平台数据采集系统架构设计:主导Web、APP、小程序端的反爬策略分析与高并发采集框架搭建,解决动态渲染、参数加密、IP封禁等复杂场景;智能化数据清洗与标准化流水线:设计自动化ETL流程,将非结构化网页数据转化为适配电商ERP、供应链系统的结构化格式;全栈业务系统开发:独立完成数据采集后台管理平台及可视化监控工具的前后端开发,实现采集任务调度、日志追踪与异常告警。

熟练使用:核心语言与自动化:Python(Scrapy、DrissionPage、Selenium)、JavaScript逆向;解析与存储:lxml + BeautifulSoup(HTML/XML精准解析)、Re/Json(正则与结构化提取);数据处理与导出:xlsxwriter + DataRecorder(百万级数据批量写入)、Pandas(数据清洗与聚合);GUI与多线程:tkinter / PyQt(桌面端工具开发)、Threading / asyncio(并发任务调度与UI实时交互);全栈补充:Vue.js + Flask/Django(管理后台搭建)、MySQL/Redis(数据缓存与持久化)。

工作经历

  • 2016-07-15 -2018-10-10重庆测试开发工程师

    1. 动态网站架构分析与数据提取负责解析目标网站(Dometic)的前端交互逻辑:深入分析商品详情页的 JavaScript 渲染机制(如折叠面板 Accordion、异步加载),精准定位 XPath 与 JSON 结构化数据节点。 制定变体(SKU)采集策略:设计颜色/尺寸多规格商品的抓取逻辑,通过动态拼接 URL 参数(?v=sku)实现不同款式数据的精准切换与去重汇总。 2. 爬虫系统开发与框架搭建 构建高可用采集框架:基于 DrissionPage 封装 Session 请求与 Chromium 浏览器渲染引擎,解决传统 Requests 无法抓取动态内容的痛点,确保复杂交互场景下的数据完整率。实现全品类自动化遍历:编写分页递归逻辑,对预配置的 100+ 个分类目录进行层级遍历,通过列表页商品链接提取,实现海量详情页的自动化调度。 3. 数据清洗与标准化入库 负责数据 ETL 流程:对抓取到的 HTML 源码进行深度清洗(移除冗余 CSS、SVG、广告下载按钮),将非结构化网页内容转化为结构化字段(价格、规格表、高清图链)。

教育经历

  • 2013-09-01 - 2017-07-01重庆交通大学计算机科学与技术本科

语言

中文母语水平
0
1
2
3
4
5

技能

0
1
2
3
4
5
0
1
2
3
4
5
作品
爬虫项目

1.智能分类与批量采集可视化分类选择:提供基于tkinter的图形界面,完整罗列了Dometic官网所有品类(如冷却器、车顶架、露营装备、房车/船舶设备、电源系统等)。自定义抓取范围:支持“全选”或“取消全选”,允许用户按需勾选特定二级/三级目录,避免采集无关数据,精准控制爬取范围。2.自动化动态数

0
2026-07-01 18:12
下载次数:0
¥300
更新于: 07-16 浏览: 34