个人介绍
6年以上SRE运维开发经验,2-3年团队管理经验。
专注于通过自动化工具链与工程实践,打通开发与运维流程,旨在提升系统可靠性、部署效率与团队协作效能。具备端到端的可观测性体系建设、高可用架构设计、以及从CI/CD到运维自动化平台的完整开发经验。善于将运维需求转化为可落地的工程解决方案,守护生产环境的SLO,并加速业务价值的持续、安全交付。
具备扎实的Linux系统、网络及监控体系知识,精通Linux操作系统、常用服务部署及网络故障排查,熟悉Kubernetes网络(Calico/Flannel)、存储(CSI)及安全策略,设计过HPA自动伸缩或故障自愈机制。
深度参与并实践DevOps文化,具备运维自动化平台(Zephyr)的独立设计开发能力,精通使用Jenkins, Kubernetes, Docker 等工具构建和优化CI/CD流水线,系统性消除琐事。
深度掌控Zabbix、Grafana、InfluxDB等监控栈的搭建、优化与二次开发。
熟悉mysql,redis等等的操作与运维灾备方案。
熟练使用Python、Shell等开发自动化脚本和工具平台。
熟悉各大云平台如aws,aliyun核心服务的运维与优化。
拥有丰富的On-Call与紧急事件处理经验,专注于优化MTTR(平均恢复时间),并推动有效的故障复盘(Post-Mortem)与改进项落地。
具备强烈的责任心和处理生产环境紧急事件的卓越能力,是系统稳定性的核心保障。
具备团队培训和新成员指导经验,能有效进行工作分解与协调,促进团队共同成长。
工作经历
2021-03-10 -至今深圳比核科技有限公司成都分公司运维工程师
1. 全球可观测性数据平台高可用架构项目 工作内容: 负责支撑全球流媒体业务的可观测性数据平台(InfluxDB)的稳定性、性能与成本优化。该平台每秒处理百万级数据点,是定义和衡量所有核心业务SLA的基石。 主导完成了从单点内存型架构到多实例、文件存储、高可用架构的彻底重构,设计并实施了基于VIP切换的全球主备容灾方案。 关键业绩: 将平台自身可用性从99.5%提升至99.95%,为全球用户观看体验的稳定性提供了坚实的数据保障。 通过架构拆分与存储优化,抵御了因业务增长带来的数据洪峰,在数据量增长300%的情况下,数据丢失率降至0.1%以下,有效守护了服务的“错误预算”。 2. Zephyr自动化运维平台——驱动全球运维效率变革 工作内容: 识别到全球业务运维中存在的批量配置、数据通报等大量重复性手动操作是效率瓶颈和风险点,独立发起并完成了Zephyr自动化平台的设计与开发。 将平台与CI/CD流程(Jenkins/K8s)深度集成,实现了流媒体应用全球发布后的自动化监控装配与上线检查。 作为平台Owner,海外运维团队进行全英文的产品演示与培训,推动平台成为跨地域团队的标准化运
教育经历
2021-10-01 - 电子科技大学行政管理本科
2016-09-01 - 2019-06-30加拿大荷兰学院软件技术本科
非全日制,中加合作办学
2016-09-01 - 2019-06-30成都工业学院软件技术专科




