NicholasZou
9小时前在线
全职 · 300/日  ·  6525/月
工作时间: 工作日17:30-24:00、周末09:00-17:00工作地点: 远程
服务企业: 0家累计提交: 0工时
聊一聊

APP聊一聊

个人介绍

6年以上SRE运维开发经验,2-3年团队管理经验。

专注于通过自动化工具链与工程实践,打通开发与运维流程,旨在提升系统可靠性、部署效率与团队协作效能。具备端到端的可观测性体系建设、高可用架构设计、以及从CI/CD到运维自动化平台的完整开发经验。善于将运维需求转化为可落地的工程解决方案,守护生产环境的SLO,并加速业务价值的持续、安全交付。

具备扎实的Linux系统、网络及监控体系知识,精通Linux操作系统、常用服务部署及网络故障排查,熟悉Kubernetes网络(Calico/Flannel)、存储(CSI)及安全策略,设计过HPA自动伸缩或故障自愈机制。

深度参与并实践DevOps文化,具备运维自动化平台(Zephyr)的独立设计开发能力,精通使用Jenkins, Kubernetes, Docker 等工具构建和优化CI/CD流水线,系统性消除琐事。

深度掌控Zabbix、Grafana、InfluxDB等监控栈的搭建、优化与二次开发。

熟悉mysql,redis等等的操作与运维灾备方案。

熟练使用Python、Shell等开发自动化脚本和工具平台。

熟悉各大云平台如aws,aliyun核心服务的运维与优化。

拥有丰富的On-Call与紧急事件处理经验,专注于优化MTTR(平均恢复时间),并推动有效的故障复盘(Post-Mortem)与改进项落地。

具备强烈的责任心和处理生产环境紧急事件的卓越能力,是系统稳定性的核心保障。

具备团队培训和新成员指导经验,能有效进行工作分解与协调,促进团队共同成长。

工作经历

  • 2021-03-10 -至今深圳比核科技有限公司成都分公司运维工程师

    1. 全球可观测性数据平台高可用架构项目 工作内容: 负责支撑全球流媒体业务的可观测性数据平台(InfluxDB)的稳定性、性能与成本优化。该平台每秒处理百万级数据点,是定义和衡量所有核心业务SLA的基石。 主导完成了从单点内存型架构到多实例、文件存储、高可用架构的彻底重构,设计并实施了基于VIP切换的全球主备容灾方案。 关键业绩: 将平台自身可用性从99.5%提升至99.95%,为全球用户观看体验的稳定性提供了坚实的数据保障。 通过架构拆分与存储优化,抵御了因业务增长带来的数据洪峰,在数据量增长300%的情况下,数据丢失率降至0.1%以下,有效守护了服务的“错误预算”。 2. Zephyr自动化运维平台——驱动全球运维效率变革 工作内容: 识别到全球业务运维中存在的批量配置、数据通报等大量重复性手动操作是效率瓶颈和风险点,独立发起并完成了Zephyr自动化平台的设计与开发。 将平台与CI/CD流程(Jenkins/K8s)深度集成,实现了流媒体应用全球发布后的自动化监控装配与上线检查。 作为平台Owner,海外运维团队进行全英文的产品演示与培训,推动平台成为跨地域团队的标准化运

教育经历

  • 2021-10-01 - 电子科技大学行政管理本科

  • 2016-09-01 - 2019-06-30加拿大荷兰学院软件技术本科

    非全日制,中加合作办学

  • 2016-09-01 - 2019-06-30成都工业学院软件技术专科

资质认证

语言

中文母语水平
英语可口语交流
0
1
2
3
4
5
0
1
2
3
4
5

技能

Linux熟练
Python熟练
K8S熟练
Zabbix精通
Jenkins掌握
0
1
2
3
4
5
0
1
2
3
4
5
作品
Zephyr自动化运维平台

Zephyr是一套独立设计开发的运维自动化平台,核心解决"重复操作自动化"和"标准化协作"两个问题。主要功能包括:1)批量配置管理,支持跨环境、跨地域的配置统一下发;2)与CI/CD流程(Jenkins/Kubernetes)深度集成,实现应用发布后的自动化监控装配与上线检查;3)标准化运维流程模板

0
2026-08-06 20:49
更新于: 8小时前 浏览: 3