个人介绍
我是程序员客栈的proginn0106321658,主要方向是Python、人工智能、Web数据采集与数据处理。
2025年6月毕业于郑州工商学院。2025年7月1日至12月16日期间参与企业外包项目,主要负责与大模型训练数据相关的数据采集与处理工作,项目与通义千问相关。
具备多类型数据采集经验,包括网页文本、PDF、图片、音频、视频等。曾参与TB级数据处理任务,在大规模数据采集场景下使用Kubernetes集群进行批量下载和任务处理,并使用ODPS(MaxCompute)、OSS、Parquet等完成数据存储、处理和整理。
熟悉从数据源获取 → 批量采集 → 数据处理 → 数据转换 → 数据映射 → 数据入库/交付的完整流程,也有集群任务监控、日志分析和问题排查经验。
目前可承接Python开发、Web爬虫/数据采集、数据清洗与处理、自动化脚本、API数据获取、AI相关开发等项目。
工作经历
2025-07-01 -2025-12-16易宝软件(深圳)有限公司通用技术岗
易宝软件是一家外包公司,由甲方公司提出用人需求,根据需求招聘合适人才外派到甲方公司办公。项目内容主要涉及互联网平台的数据处理、业务系统维护及相关技术支持。 我的职责 负责大规模互联网数据采集及数据处理工作,根据项目需求采集指定网站的文本、PDF、图片、视频、音频等多类型数据,并参与从原始数据采集、分布式批量下载、文件转换、数据映射到 ODPS 数据仓库存储及最终数据提交的完整数据处理流程。 主要工作内容 - 根据项目需求,对指定网站及数据源进行大规模数据采集,涉及文本、PDF、图片、视频、音频等多种类型的数据。 - 使用 Python 等技术进行数据采集、批量下载及数据处理,处理几十 GB 至数 TB 规模的数据。 - 针对上亿条图片等资源下载链接,使用 Kubernetes 集群进行大规模并行下载任务。 - 根据 ODPS(MaxCompute) 中存储的原始数据 Meta 信息及对应下载链接,生成和提交 Kubernetes 批处理任务。 - 集群完成资源下载后,将下载结果按照项目要求存储至 Alibaba Cloud OSS 指定目录,部分下载结果以 Parquet 等批量数据文
教育经历
2021-09-01 - 2025-06-30郑州工商学院数据科学与大数据技术本科



