监控老年代使用率是预防oom最直接有效的手段,需在占用持续攀升未触顶时预警;可用jstat实时计算ou/oc比率,配合gc日志、jmx+prometheus+grafana可视化及堆转储定位根因。

监控老年代使用率是预防内存溢出(OOM)最直接有效的手段之一。关键不在于等 Full GC 发生,而是在老年代占用持续攀升、但尚未触顶时就发出预警。
用 jstat 实时查看老年代使用比例
jstat 是 JDK 自带的轻量级命令行工具,无需侵入应用,适合线上环境快速诊断:
- 执行 jstat -gc
1000 (每秒刷新一次),重点关注字段:
OU:老年代已使用容量(KB)
OC:老年代总容量(KB)
计算公式:(OU / OC) × 100% 即为当前使用率 - 若 OU 持续增长且每次 Minor GC 后不回落,或多次 Full GC 后 OU 仍 >85%,说明对象晋升过快或存在泄漏
- 配合 -gcutil 可更直观看百分比:jstat -gcutil
2000 显示 S0, S1, E, O, M, CCS, YGC, YGCT, FGC, FGCT 等,其中 O 列就是老年代使用率
通过 JVM 启动参数开启详细 GC 日志
日志是回溯分析的依据,必须长期保留:
在 Java 中初始化和管理阿里云 SDK客户端。包括单例模式、线程安全、endpoint 与 region 配置、VPC 终端节点、同步与异步等。
- 推荐组合(JDK 8u262+ 或 JDK 11+):
-Xlog:gc*:file=gc.log:time,tags,uptime,level -Xlog:safepoint -Xlog:gc+age=trace
关键要包含 gc+heap+exit 和 gc+metaspace,确保能追踪老年代分配与回收细节 - 重点观察日志中类似 [GC (Allocation Failure) ... [PSYoungGen: ...] [ParOldGen: 1245678K->1245000K(2097152K)] 的片段:
ParOldGen 后的 1245000K/2097152K 就是老年代当前使用量与总量,可直接算出使用率 - 设置告警阈值:当日志中连续出现老年代使用率 ≥90% 的记录,立即触发通知
集成 JMX + Prometheus + Grafana 做可视化监控
适用于生产环境常态化监控:
- JVM 暴露的标准 MBean 中,java.lang:type=MemoryPool,name=PS Old Gen(或 G1OldGen、CMS Old Gen,依 GC 类型而定)提供:
Usage.used 和 Usage.max —— 直接对应 OU 和 OC - 用 Prometheus 的 jmx_exporter 抓取该指标,定义告警规则如:
10m avg over (rate(jvm_memory_pool_bytes_used{pool=~"Old.*"}[5m])) / avg(jvm_memory_pool_bytes_max{pool=~"Old.*"}) > 0.85 - Grafana 面板中叠加老年代使用率曲线、Full GC 次数、单次 Full GC 耗时三组指标,能清晰识别“使用率缓升 + GC 频次突增”的泄漏前兆
结合堆转储做根因定位(当使用率超限后)
监控发现异常后,需快速锁定是什么对象占满老年代:
- 触发堆转储:
jmap -dump:format=b,file=oldgen.hprof(慎用,会暂停应用)
或更安全的方式:启动时加 -XX:+HeapDumpOnOutOfMemoryError -XX:HeapDumpPath=/path/to/dumps/ - 用 Eclipse MAT 打开 dump 文件,按 Histogram → Group by package/class,排序 “Retained Heap” 列,重点关注:
长生命周期集合(如 static HashMap)、未关闭的资源持有者(Connection、InputStream)、缓存类(Caffeine/Guava Cache 实例) - 特别注意 “Dominator Tree” 视图,它能直接显示谁持有了最多老年代对象,比单纯看对象数量更准确
Java免费学习笔记:立即使用
解锁 Java 大师之旅:从入门到精通的终极指南










