proginn0106321658
1小时前在线
全职 · 500/日  ·  10875/月
工作时间: 工作日16:30-00:30、周末11:00-00:30工作地点: 远程
服务企业: 0家累计提交: 0工时
聊一聊

APP聊一聊

个人介绍

我是程序员客栈的proginn0106321658,主要方向是Python、人工智能、Web数据采集与数据处理。

2025年6月毕业于郑州工商学院。2025年7月1日至12月16日期间参与企业外包项目,主要负责与大模型训练数据相关的数据采集与处理工作,项目与通义千问相关。

具备多类型数据采集经验,包括网页文本、PDF、图片、音频、视频等。曾参与TB级数据处理任务,在大规模数据采集场景下使用Kubernetes集群进行批量下载和任务处理,并使用ODPS(MaxCompute)、OSS、Parquet等完成数据存储、处理和整理。

熟悉从数据源获取 → 批量采集 → 数据处理 → 数据转换 → 数据映射 → 数据入库/交付的完整流程,也有集群任务监控、日志分析和问题排查经验。

目前可承接Python开发、Web爬虫/数据采集、数据清洗与处理、自动化脚本、API数据获取、AI相关开发等项目。

工作经历

  • 2025-07-01 -2025-12-16易宝软件(深圳)有限公司通用技术岗

    易宝软件是一家外包公司,由甲方公司提出用人需求,根据需求招聘合适人才外派到甲方公司办公。项目内容主要涉及互联网平台的数据处理、业务系统维护及相关技术支持。 我的职责 负责大规模互联网数据采集及数据处理工作,根据项目需求采集指定网站的文本、PDF、图片、视频、音频等多类型数据,并参与从原始数据采集、分布式批量下载、文件转换、数据映射到 ODPS 数据仓库存储及最终数据提交的完整数据处理流程。 主要工作内容 - 根据项目需求,对指定网站及数据源进行大规模数据采集,涉及文本、PDF、图片、视频、音频等多种类型的数据。 - 使用 Python 等技术进行数据采集、批量下载及数据处理,处理几十 GB 至数 TB 规模的数据。 - 针对上亿条图片等资源下载链接,使用 Kubernetes 集群进行大规模并行下载任务。 - 根据 ODPS(MaxCompute) 中存储的原始数据 Meta 信息及对应下载链接,生成和提交 Kubernetes 批处理任务。 - 集群完成资源下载后,将下载结果按照项目要求存储至 Alibaba Cloud OSS 指定目录,部分下载结果以 Parquet 等批量数据文

教育经历

  • 2021-09-01 - 2025-06-30郑州工商学院数据科学与大数据技术本科

语言

中文母语水平
英语借工具书面交流
日语借工具书面交流
0
1
2
3
4
5
0
1
2
3
4
5

技能

Linux熟悉
Python掌握
Django掌握
MySQL掌握
Spark熟悉
0
1
2
3
4
5
0
1
2
3
4
5
更新于: 18小时前 浏览: 2