TCP的backlog导致的HBase超时问题排查-阿里云开发者社区

TCP的backlog导致的HBase超时问题排查

2017-07-05 2896

版权

本文内容由阿里云实名注册用户自发贡献，版权归原作者所有，阿里云开发者社区不拥有其著作权，亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容，填写侵权投诉表单进行举报，一经查实，本社区将立刻删除涉嫌侵权内容。

简介： TCP的backlog导致的超时问题排查

客户问题场景

tcpbacklog_jpeg

如上图所示，用户业务服务器(ApplicationServer)上面发起HTTP GET/PUT请求，经过SLB到达后端服务器(HBase-Rest-Server), 一般请求链路耗时大概100ms左右，但是会有一定的概率出现耗时很长(超过3s)。

问题排查

1. 抓包分析

通过在HBase-REST-Server上面抓包，发现有SYN重传，引起SYN重传的原因是上图所示的Queue满了，导致新请求的SYN包丢弃。

Linux的SYN重传通过net.ipv4.tcp_syn_retries参数控制重传次数，每次重传的时间间隔为(第一次3s,第二次6s,第三次12s,每增加一次时间间隔翻倍),所以当SYN包被丢弃后，第一次会经过3s后进行重传，这个3s也跟上述的超时3s比较吻合。

2. 参数调整

从上面可以看出Queue满导致重传，所以适当增加Queue的大小可以解决重传，Queue的大小受一些参数来控制：

http server启动设置的backlog大小
net.core.somaxconn
tcp_max_syn_backlog

最终通过增加上述参数，问题解决。

相关实践学习

云数据库HBase版使用教程

  相关的阿里云产品：云数据库 HBase 版面向大数据领域的一站式NoSQL服务，100%兼容开源HBase并深度扩展，支持海量数据下的实时存储、高并发吞吐、轻SQL分析、全文检索、时序时空查询等能力，是风控、推荐、广告、物联网、车联网、Feeds流、数据大屏等场景首选数据库，是为淘宝、支付宝、菜鸟等众多阿里核心业务提供关键支撑的数据库。了解产品详情: https://cn.aliyun.com/product/hbase   ------------------------------------------------------------------------- 阿里云数据库体验：数据库上云实战开发者云会免费提供一台带自建MySQL的源数据库 ECS 实例和一台目标数据库 RDS实例。跟着指引，您可以一步步实现将ECS自建数据库迁移到目标数据库RDS。点击下方链接，领取免费ECS&RDS资源，30分钟完成数据库上云实战！https://developer.aliyun.com/adc/scenario/51eefbd1894e42f6bb9acacadd3f9121?spm=a2c6h.13788135.J_3257954370.9.4ba85f24utseFl

TCP的backlog导致的HBase超时问题排查

客户问题场景

问题排查

1. 抓包分析

2. 参数调整

开源大数据平台 E-MapReduce

热门文章

最新文章

相关课程

相关电子书