proginn1421467651
14小时前在线
全职 · 300/日  ·  6525/月
工作时间: 工作地点: 远程
服务企业: 0家累计提交: 0工时
聊一聊

APP聊一聊

个人介绍

项目交付能力:100+站点已跑通,数据直接进业务后台

独立闭环能力:从站点分析、脚本开发、反爬处理到数据清洗导出,全流程单人完成

分层解决问题:普通站点用requests,风控站点用指纹模拟,强反爬用浏览器

代码可维护性:实现断点续采、数据库备份、修复脚本,降低后续维护成本

工作经历

  • 2026-04-01 -2026-07-07中科凡语(武汉)科技有限公司爬虫工程师

    维护150多个多语言信息站点,检查采集任务、详情任务及MongoDB数据写入状态。 根据网站改版调整XPath、CSS选择器、分页参数和详情页解析规则,修复标题、正文、日期及链接提取异常。 处理403、429、请求超时、地区限制、Cloudflare验证和接口返回格式变化等问题。 使用Redis实现站点任务和详情任务解耦,排查任务积压、重复运行标记及队列阻塞问题。 使用MongoDB保存站点数据,通过URL、标题摘要、布隆过滤器等方式避免重复采集。 编写站点健康检查工具,自动统计每日新增数量、错误日志、长期无新增站点及缺失代码。 优化请求超时时间、异常重试、Redis扫描和运行日志,避免单个异常站点长时间阻塞整体任务。 使用Pytest编写站点解析测试,验证列表链接、标题、正文和发布时间的准确性。 使用Git和Gitee管理代码修改,记录站点修复及运行优化内容。 维护数据同步和导出脚本,完成MongoDB临时数据整理、去重、日期转换及正式数据导出。

  • 2025-07-09 -2026-03-26武汉亦可为电子商务有限公司爬虫

    1.独立完成100+海外电商站点商品数据采集,输出标准化数据直接对接后台导入;2.使用requests/curl_cffi/Playwright分层处理静态页、JSON接口、J5渲染页等不同数据格式;3.解决Cloudflare/Akamai反爬,通过浏览器指纹模拟、Cookie刷新、代理池保障任务稳定运行;4.基于SQLite实现断点续采,任务中断后可恢复进度,避免重复劳动;编写数据后处理脚本:去重、目录合并、图片批量下载与链接替换、Excel标准化导出

教育经历

  • 2022-09-01 - 2025-06-30武汉职业技术学院人工智能技术应用专科

资质认证

语言

中文母语水平
英语借工具书面交流
0
1
2
3
4
5
0
1
2
3
4
5

技能

Python掌握
0
1
2
3
4
5
更新于: 14小时前 浏览: 2