必须建立监控机制:用watch -n 1 "ps -eo pid,comm,%mem,rss --sort=-%mem | head -n 5"每秒刷新捕获趋势,重点关注%mem单调上升和rss每分钟增数百mb;跨时段采样比对rss_trend.log确认阶梯/线性增长;再通过/proc/pid/smaps中pss持续上涨、vmdata同步增长、pmap快照差异及anonymous页飙升三步穿透定位泄漏源头。

当麒麟系统上运行的关键业务进程(如nginx、java应用或自研服务)内存占用持续攀升且不回落时,必须建立一套能及时捕获泄漏起点、量化增长速率、定位泄漏源头的监控机制。
实时捕获内存异常增长趋势
打开终端,执行:
watch -n 1 "ps -eo pid,comm,%mem,rss --sort=-%mem | head -n 5"
该命令每秒刷新一次,聚焦内存占用最高的5个进程。重点关注%mem列是否呈现单调上升、rss值是否每分钟增加数百MB以上——这是内存泄漏最直观的信号。
若目标进程PID已知(例如为12345),可精简为:
watch -n 1 "ps -p 12345 -o pid,comm,%mem,rss,vsz"
注意:不要依赖top交互式界面做长期监控,因其默认刷新间隔为3秒且历史数据不可回溯,漏掉关键拐点风险极高。
验证泄漏是否真实存在
方法一:跨时段采样比对
执行以下命令,每10分钟记录一次目标进程RSS值:
while true; do echo "$(date): $(ps -p 12345 -o rss= 2>/dev/null) KB"; sleep 600; done >> rss_trend.log
运行2小时后用cat rss_trend.log查看。若数值呈阶梯式或线性增长,且无明显回落,则基本确认泄漏存在。
方法二:检查/proc/[PID]/smaps中PSS是否同步上涨
先获取当前PSS值:
grep "^Pss:" /proc/12345/smaps | awk '{sum += $2} END {print sum}'
等待30分钟后再次执行。PSS持续上升而进程无新功能加载,即为强泄漏证据。
【/proc/[PID]/smaps仅对存活进程有效,进程崩溃后该路径立即失效】
定位泄漏源头的三步穿透法
第一步:确认进程是否在持续分配新内存
执行:
sudo cat /proc/12345/status | grep -E "VmRSS|VmSize|VmData"
连续执行3次(间隔10秒),观察VmData(数据段大小)是否同步增长。若VmData涨而代码逻辑未加载新模块,说明进程内部存在未释放的堆内存。
第二步:抓取内存映射快照对比
分别在t0和t1时刻执行:
sudo pmap -x 12345 > pmap_t0.txt
sudo pmap -x 12345 > pmap_t1.txt
然后用diff pmap_t0.txt pmap_t1.txt | grep -E "[0-9]+[[:space:]]+[0-9]+[[:space:]]+[0-9]+"提取新增的内存块。
第三步:检查是否存在大量匿名映射页
执行:
grep -A 5 "Anonymous:" /proc/12345/smaps | tail -n +2 | head -n 1 | awk '{print $2}'
若该值在数小时内从几MB飙升至几百MB,基本锁定为malloc/new未free/delete的C/C++级泄漏。











