本文转载自微信公众号「捉虫大师」,线上作者捉虫大师。故障转载本文请联系捉虫大师公众号。线上 最近某天的故障深夜,刚洗完澡就接到业务方打来电话,线上说他们的故障 dubbo 服务出故障了,要我协助排查一下。线上 电话里,故障询问了他们几点 于是我打开电脑,连上 网络看问题。故障为了便于理解,线上架构简化如下 只需要关注 A、故障B、线上C 三个服务,故障他们之间调用都是线上 dubbo 调用。 发生故障时 B 服务有几台机器完全夯死,处理不了请求,剩余正常机器请求量激增,耗时增加,如下图(图一请求量、图二耗时) 由于现场已被破坏,只能先看监控和日志 除了上述监控外,翻看了 B 服务 CPU 和内存等基础监控,发现故障的几台机器内存上涨比较多,都达到了 80% 的水平线,且 CPU 消耗也变多 这时比较怀疑内存问题,服务器托管于是看了下 JVM 的 fullGC 监控 果然 fullGC 时间上涨很多,基本可以断定是内存泄漏导致服务不可用了。但为什么会内存泄漏,还无法看出端倪。 申请机器权限,查看日志,发现了一条很奇怪的 WARN 日志 可以看出业务方使用的是2.7.12版本的 dubbo 拿这个日志去 dubbo 的 github 仓库搜了一下,找到了如下这个 issue: https://github.com/apache/dubbo/issues/6820 但很快排除了该问题,因为在 2.7.12 版本中已经是修复过的代码了。 继续又找到了这两个 issue: https://github.com/apache/dubbo/issues/8172 https://github.com/apache/dubbo/pull/8188 从报错和版本上来看,完全符合,但没有提及内存问题,先不管内存问题,看看是否可以按照 #8188 这个 issue 复现 issue 中也说的比较清楚如何复现,于是我搭了这样三个服务来复现,刚开始还没有复现。通过修复代码来反推 删除代码部分是有问题,但我们复现却难以进入这块,怎么才能进入呢? 这里一个 feature 代表一个请求,站群服务器只有当请求没有完成时才会进入,这就好办了,让 provider 一直不返回,肯定可以实现,于是在 provider 端测试代码加入 经过测试果然复现了,如 issue 所说,当 kill -9 掉第一个 provider 时,消费者全局 ExecutorService 被关闭,当 kill -9 第二个 provider 时,SHARED_EXECUTOR 也被关闭。 那么这个线程池是用来干什么的呢? 它在 HashedWheelTimer 中被用来检测 consumer 发出的请求是否超时。 HashedWheelTimer 是 dubbo 实现的一种时间轮检测请求是否超时的算法,具体这里不再展开,改天可以详细写一篇 dubbo 中时间轮算法。 当请求发出后,如果可以正常返回还好,但如果超过设定的超时时间还未返回,则需要这个线程池的任务来检测,对已经超时的任务进行打断。 如下代码为提交任务,当这个线程池被关闭后,网站模板提交任务就会抛出异常,超时也就无法检测。 到这里恍然大悟:如果请求一直发送,不超时,那是不是有可能撑爆内存?于是我又模拟了一下,并且开了 3 个线程一直请求 provider,果然复现出内存被撑爆的场景,而当不触发这个问题时,内存是一直稳定在一个低水平上。 这里我用的 arthas 来看的内存变化,非常方便 在本地复现后,于是跟业务方求证一下,这个问题复现还是比较苛刻的,首先得是异步调用,其次 provider 需要非正常下线,最后 provider 需要有阻塞,即请求一直不返回。 异步调用得到业务方的确认,provider 非正常下线,这个比较常见,物理机的故障导致的容器漂移就会出现这个情况,最后 provider 有阻塞这点也得到业务方的确认,确实 C 服务有一台机器在那个时间点附近僵死,无法处理请求,但进程又是存活的。 所以这个问题是 dubbo 2.7.12 的 bug 导致。翻看了下这个 bug 是 2.7.10 引入, 2.7.13 修复。 差不多花了1天的时间来定位和复现,还算顺利,运气也比较好,没怎么走弯路,但这中间也需要有些地方需要引起重视。 【责任编辑:武晓燕 TEL:(010)68476606】背景
问题排查
得出结论
复盘