Kubernetes 生产环境 OOM 告警全链路排查与防护实战
本文基于真实生产事故整理,已脱敏处理。涵盖 OOM 根因分析、JVM 调优、K8s 配置优化、零中断发版方案。
一、背景
某天早上收到连续告警:生产命名空间 3 个 Pod 被 OOM Killed,深入排查后发现8 个服务内存使用率超过 85%,多个即将崩溃。
本文记录完整的排查过程和最终解决方案。
二、快速定位:从告警到现场
2.1 第一步:确认 Pod 状态
# 查看有重启的 Podkubectl get pods-npro --sort-by='.status.containerStatuses[0].restartCount'|grep-v