百度360必应搜狗淘宝本站头条
当前位置:网站首页 > 技术教程 > 正文

记一次生产环境jvm内存泄漏的排查

csdh11 2025-03-26 11:12 28 浏览

1.问题现象

JVM就抛出OOM异常,后台服务进程假死,健康检查都是失败,服务无法访问。

重启服务器

2023-11-14 06:19 收到告警某个线上有个服务一直无响应,监控程序主动把流量摘除。

登录服务器,查看是否有dump文件和gc日志,已经有日志了。赶忙将该服务先重启,挂上流量。

查看业务日志

查看业务日志是否有报错,观察业务日志,发生了
Java.lang.OutOfMemoryError: Java heap space 如下图所示,但是很奇怪的是通过这里定位不出来到底是哪里有问题。当时就怀疑是这块代码有问题,但是看了业务代码没发现问题。

观察GC日志

接下来看了一下gc日志,发现频繁Full GC,并且gc日志是从2023-11-12日开始的,到2023-11-14 06:19 FUll GC 的频率越来越快,最后Full GC 后释放不了空间了,所以导致了
Java.lang.OutOfMemoryError: Java heap space,如下图

MAT(Memory Analyzer Tool)工具进行分析

在这里已经能感觉到内存泄露造成的,但是还没确定是哪块业务代码造成的。接下来我用了MAT(Memory Analyzer Tool)这个工具来查看堆栈日志,如果没有这个工具可以去官网下载,官网地址:
https://eclipse.dev/mat/downloads.php
,根据自己的电脑选择对应的版本下载。

双击运行MemoryAnalyzer.exe的时候如果报以下图错误,需要打开MemoryAnalyzer.ini

添加如下配置:

-vm
C:/Program Files/Java/jdk-17.0.9/bin/javaw.exe

如果还是报错,可以尝试看一下官网MemoryAnalyzer.exe需要jdk的那个版本。

MAT怎么使用在这里就不介绍了,可以看一下官网方文档,文档地址:Help - Eclipse Platform

用MAT打开堆文件,会弹出向导界面,保持默认设置,直接点Finish即是分析内存泄露问题。在点击Finish后,会出现overview界面,您可以点击工具栏上的 Leak Suspects 菜单项来生成内存泄露分析报告,也可以直接点击饼图下方的 Reports->Leak Suspects链接来生成报告。如图:

MAT工具分析了heap dump后在界面上非常直观的展示了一个饼图,该图深色区域被怀疑有内存泄漏,可以发现整个heap才250M内存,深色区域就占了85..02%。接下来是一个简短的描述,告诉我们QueryPlanCache这里占用了大量的内存,在下面还有一个"Details"链接,在点开之前不妨考虑一个问题:为何对象实例会聚集在内存中,为何存活(而未被GC)?

点击了"Details"链接之后,除了在上一页看到的描述外,还有Shortest Paths To the Accumulation Point和Accumulated Objects by Class in Dominator Tree 部分,这里说明了从GC root到聚集点的最短路径,以及完整的reference chain。观察Accumulated Objects部分,BoundedConcurrentHashMap$Segment[]占用最大,但是这里面存放的是什么呢?

接下来我们打开dominator_tree来看一下,展开大对象,发现ConcurrentHashMap中所有的元素都是一个参数值不同的HQL(jpa封装的sql)缓存值,格式化HQL分析,可以看出该HQL 对应的 查询条件 由 IN where 对应一个字段,在代码中查找定位相关代码。

原因解析

通过stackOverflow文章定位了原因,文章地址:Attention Required! | Cloudflare

如果您使用了Hibernate或Spring data jpa。QueryPlanCache会缓存sql,以便于后边的相同的sql重复编译,如果in后的参数不同,hibernate会把其当成不同的sql进行缓存,从而缓存大量的sql导致heap内存溢出。

虽然问题定位了,但是发现了一个奇怪的现象,为啥堆内存的大小是250M呢,明明启动参数是设置的是4个G,经过一凡追踪和询问,上次有个kafka问题重启服务的时候启动脚本带的堆内存大小是250M,思考如果堆内存还是4个G。这个问题多久能报出来?还是永远不会爆出来呢?

解决方案

#管理缓存中 ParameterMetadata 实例的数量(默认为 128)
spring.jpa.properties.hibernate.query.plan_parameter_metadata_max_size=5

#控制计划缓存中的最大条目数(默认为 2048)
spring.jpa.properties.hibernate.query.plan_cache_max_size=64

#设置缓存中保存的最大软引用数。将此值设置为 Integer.MAX_VALUE 以复制 5.1.1 及更早版本的行为。例如2048(默认)
spring.jpa.properties.hibernate.query.plan_cache_max_soft_references=1024

#设置缓存中保存的最大强引用数。例如128(默认)
spring.jpa.properties.hibernate.query.plan_cache_max_strong_references=64

spring.jpa.properties.hibernate.query.in_clause_parameter_padding=true

知识补充:

Shallow Size是对象本身占据的内存的大小,不包含其引用的对象。对于常规对象(非数组)的Shallow Size由其成员变量的数量和类型来定,而数组的ShallowSize由数组类型和数组长度来决定,它为数组元素大小的总和。

Retained Size=当前对象大小+当前对象可直接或间接引用到的对象的大小总和。(间接引用的含义:A->B->C,C就是间接引用) ,并且排除被GC Roots直接或者间接引用的对象

Java启动参数配置看一下这个文章
https://zhuanlan.zhihu.com/p/269591764

相关推荐

NUS邵林团队发布DexSinGrasp基于强化学习实现物体分离与抓取统一

本文的作者均来自新加坡国立大学LinSLab。本文的共同第一作者为新加坡国立大学实习生许立昕和博士生刘子轩,主要研究方向为机器人学习和灵巧操纵,其余作者分别为硕士生桂哲玮、实习生郭京翔、江泽宇以及...

「PLC进阶」如何通过编写SCL语言程序实现物料分拣?

01、前言SCL作为IEC61131-3编程语言的一种,由于其高级语言的特性,特别适合复杂运算、复杂数学函数应用的场合。本文以FactoryIO软件中的物料分拣案例作为硬件基础,介绍如何通过SCL来实...

zk源码—5.请求的处理过程一(http1.1请求方法)

大纲1.服务器的请求处理链...

自己动手从0开始实现一个分布式 RPC 框架

前言为什么要自己写一个RPC框架,我觉得从个人成长上说,如果一个程序员能清楚的了解RPC框架所具备的要素,掌握RPC框架中涉及的服务注册发现、负载均衡、序列化协议、RPC通信协议、Socket通信、异...

MLSys’25 | 极低内存消耗:用SGD的内存成本实现AdamW的优化性能

AIxiv专栏是机器之心发布学术、技术内容的栏目。过去数年,机器之心AIxiv专栏接收报道了2000多篇内容,覆盖全球各大高校与企业的顶级实验室,有效促进了学术交流与传播。如果您有优秀的工作想要分享,...

线程池误用导致系统假死(线程池会自动销毁吗)

背景介绍在项目中,为了提高系统性能使用了RxJava实现异步方案,其中异步线程池是自建的。但是当QPS稍微增大之后却发现系统假死、无响应和返回,调用方出现大量超时现象。但是通过监控发现,系统线程数正常...

大型乘用车工厂布局规划(六大乘用车基地)

乘用车工厂的布局规划直接影响生产效率、物流成本、安全性和未来扩展能力。合理的布局应确保生产流程顺畅、物流高效、资源优化,并符合现代化智能制造和绿色工厂的要求。以下是详细的工厂布局规划要点:1.工厂布...

西门子 S7-200 SMART PLC 连接Factory IO的方法

有很多同学不清楚如何西门子200smart如何连接FactoryIO,本教程为您提供了如何使用西门子S7-200SMARTPLC连接FactoryIO的说明。设置PC和PLC之间的...

西门子博图高级仿真软件的应用(西门子博途软件仿真)

1.博图高级仿真软件(S7-PLCSIMAdvancedV2.0)S7-PLCSIMAdvancedV2.0包含大量仿真功能,通过创建虚拟控制器对S7-1500和ET200SP控制器进行仿真...

PLC编程必踩的6大坑——请对号入座,评论区见

一、缺乏整体规划:面条式代码问题实例:某快递分拣线项目初期未做流程图设计,工程师直接开始编写传送带控制程序。后期增加质检模块时发现I/O地址冲突,电机启停逻辑与传感器信号出现3处死循环,导致项目延期2...

统信UOS无需开发者模式安装软件包
统信UOS无需开发者模式安装软件包

原文链接:统信UOS无需开发者模式安装软件包...

2025-05-05 14:55 csdh11

100个Java工具类之76:数据指纹DigestUtils

为了提高数据安全性,保证数据的完整性和真实性,DigestUtils应运而生。正确恰当地使用DigestUtils的加密算法,可以实现数据的脱敏,防止数据泄露或篡改。...

麒麟KYLINIOS软件仓库搭建02-软件仓库添加新的软件包

#秋日生活打卡季#原文链接:...

Java常用工具类技术文档(java中工具类的作用)

一、概述Java工具类(UtilityClasses)是封装了通用功能的静态方法集合,能够简化代码、提高开发效率。本文整理Java原生及常用第三方库(如ApacheCommons、GoogleG...

软路由的用法(自动追剧配置)(软路由教学)

本内容来源于@什么值得买APP,观点仅代表作者本人|作者:值友98958248861环境和需求...