个人介绍
10年+互联网SRE与运维架构实战经验,专注高可用架构设计、稳定性治理、自动化运维体系搭建、云资源成本优化,具备大规模云原生集群、高并发微服务、IoT网关、海量数据业务的全链路SRE保障能力。精通Kubernetes容器化、可观测体系建设、故障自愈、容量规划与混沌工程落地;主导过日请求5亿+、日订单20万+高并发系统稳定性保障,核心业务SLA稳定达99.95%+;擅长通过SLO/SLA治理、自动化平台、全链路压测与容灾架构提升系统韧性;独立主导等保2.0三级、ISO体系认证落地,具备强技术落地与跨部门协同能力。
核心技能
• 云原生与容器化: 阿里云、腾讯云、Kubernetes 集群规划、调度优化、高可用与故障自愈、Docker、Mesos、
Istio 服务网格、Terraform Iac 、GPU 资源调度
• 稳定性与高可用: SLO/SLA 体系建设、限流熔断、容灾多活、故障演练、Spring Cloud Alibaba 微服务治理、Istio流量治理 / 灰度 / 熔断、LVS/HAProxy/Nginx 负载均衡
• 中间件与数据库: Kafka/RabbitMQ、Redis、ZooKeeper、MySQL(MyCat 分库分表)、ClickHouse、ElasticSearch
集群高可用、性能调优、容量规划
• 可观测体系: Prometheus、Grafana、Alertmanager、Kiali 、ELK/EFK、 Jaeger 全链路追踪、全链路监控、日志检
索、告警收敛、根因分析 RCA
• 自动化运维: Terraform 云资源编排、Jenkins CI/CD、Ansible、Shell/Python 脚本开发、自动化发布、巡
检、备份、扩缩容、自愈能力建设
• 安全与合规: 安全基线配置、WAF运维、权限审计、数据脱敏等保2.0三级、ISO体系认证落地
工作经历
和TA聊聊APP扫码和程序员直接沟通

该用户选择隐藏工作经历信息,如需查看详细信息,可点击右上角“和TA聊一聊”查看
教育经历
2012-09-01 - 2015-12-31中国地质大学(武汉)计算机科学与技术本科已认证
资质认证
语言

1. 深厚的技术知识:掌握广泛的技术栈,包括操作系统(如Linux/Unix, Windows)、网络协议、虚拟化技术(如Docker, Kuber netes)、云服务(如阿里云,腾讯云)等。 2. 问题解决能力:能够迅速识别并解决系统中的故障或性能瓶颈,具备良好的调试和分析技能。 3. 自动化技能:熟悉各种自动化工具和技术(如Ansible, Jenkins),能够编写脚本(如Bash, Python)以实现日常任务的自动 化,提高效率和准确性。 4. 监控与维护:精通使用监控工具(如Prometheus,Grafana)进行系统的实时监控和性能评估,确保系统的高可用性和稳定 性。 5. 安全意识:理解网络安全的基本原则,能够实施安全策略来保护数据和系统的完整性。 6. 持续学习的态度:IT领域发展迅速,保持对新技术的好奇心和学习热情,持续提升自我能力。 7. 应急响应能力:在面对突发事件时,能够冷静处理,快速采取行动以减少损失,保障业务连续性。



