面向 Kubernetes 上运行的大规模 Java 微服务生产环境,针对 OOMKilled、Exit 137、Pod 异常重启、资源利用率不合理、服务优雅下线及节点弹性过程中业务稳定性等问题进行治理,提高容器资源配置合理性及服务异常情况下的恢复能力。
点击空白处退出提示
面向 Kubernetes 上运行的大规模 Java 微服务生产环境,针对 OOMKilled、Exit 137、Pod 异常重启、资源利用率不合理、服务优雅下线及节点弹性过程中业务稳定性等问题进行治理,提高容器资源配置合理性及服务异常情况下的恢复能力。
围绕 Kubernetes 工作负载建立资源及稳定性治理方案,包括 CPU/Memory requests 与 limits、JVM Heap 与容器内存配置、HPA 自动扩缩容、PDB 可用性保护、健康检查、优雅终止及节点弹性等。同时结合 Events、容器状态、JVM 指标和监控数据进行生产故障定位。
负责 Kubernetes Java 微服务相关生产问题分析及治理。针对 OOMKilled/Exit 137 场景,从 cgroup 内存、JVM Heap、Native Memory、Metaspace、线程及容器 Limit 等维度进行分析;结合 readiness/liveness、terminationGracePeriodSeconds 和服务注册中心机制优化应用上下线流程;同时处理 HPA、PDB、Pod 驱逐及节点弹性之间的协同问题。



评论