Redis replication backlog 不足导致频繁全量同步的排查与治理实践
适用场景 Redis 采用主从复制,业务高峰时偶发写入延迟、主库 CPU 或网络突刺。日志中反复出现 Full resync requested、Partial resynchronization not accepted,从库短时间内加载 RDB,甚至与主库断开后很久才恢复。 本文适用于 Redis 6/7 的单主多
Tag
包含这个标签的文章。
适用场景 Redis 采用主从复制,业务高峰时偶发写入延迟、主库 CPU 或网络突刺。日志中反复出现 Full resync requested、Partial resynchronization not accepted,从库短时间内加载 RDB,甚至与主库断开后很久才恢复。 本文适用于 Redis 6/7 的单主多
适用场景 本文适用于 Prometheus 运行一段时间后出现以下现象的场景: Prometheus 数据目录持续膨胀,磁盘空间很快被打满; prometheus_tsdb_head_series、prometheus_tsdb_head_chunks 持续上涨; 查询变慢,Prometheus 重启时间明显变长; 日
适用场景 业务表按租户、状态和创建时间查询列表。数据量从几十万增长到千万级后,接口 P95 延迟突然升高;应用监控中数据库耗时占比明显增加,但 CPU 和磁盘利用率并不一定很高。 本文以常见的订单列表为例,说明如何确认“建了索引却没有用好”的联合索引问题,并在不影响线上写入的前提下完成优化。 现象描述 接口执行的 SQ
适用场景 本文适用于 Kubernetes 集群中出现以下问题的场景: 新发布的 Pod 长时间处于 Pending 状态; kubectl describe pod 中看到 node(s) had disk pressure; 节点状态出现 DiskPressure=True; 容器镜像、日志或临时目录占满节点磁盘,
适用场景 线上服务出现间歇性超时、请求延迟抖动、连接偶发重置,但应用日志没有明显报错,CPU 总使用率也不高。进一步观察会发现某几颗 CPU 的 si 软中断占用很高,网卡统计里存在 rx_dropped、rx_missed_errors 或 ring buffer 溢出。这类问题常见于高并发网关、Nginx 入口机、
适用场景 本文适用于 Nginx 作为反向代理或网关时,用户访问接口偶发或持续返回 504 Gateway Time-out,错误日志中出现 upstream timed out、while reading response header from upstream 等信息的场景。 典型架构如下: Client ->
适用场景 这篇文章适用于线上服务出现“偶发连接超时、重试后成功、服务 CPU 不高但新连接建立慢”的问题,尤其是 Nginx、网关、Java/Python Web 服务、RPC 服务或四层代理在流量突增时出现以下现象: 客户端报 connection timed out、connect timeout 或偶发 502/
适用场景 本文适用于线上 MySQL 出现以下情况: 接口偶发变慢,慢查询集中在 ORDER BY、GROUP BY、DISTINCT、复杂分页或报表 SQL 上。 数据库实例的磁盘使用率短时间上涨,过一段时间又自动回落。 tmpdir 所在分区 IO 使用率升高,甚至出现 No space left on devic
适用场景 这篇文章适用于 Pod 一直停留在 Pending、ErrImagePull 或 ImagePullBackOff,业务发布后没有新实例可用的场景。常见环境包括自建 Kubernetes、云厂商托管集群、私有镜像仓库 Harbor、阿里云/腾讯云镜像仓库,以及通过 CI/CD 自动更新镜像 tag 的发布链路
适用场景 本文适用于线上 Redis 开启 AOF 持久化后,业务在某些时间段出现接口变慢、写入超时、Redis used_cpu_sys 升高、磁盘 await 或 util 接近打满的场景。常见部署形态包括单机 Redis、主从 Redis、哨兵架构,以及运行在云主机本地盘或云盘上的 Redis 实例。 重点关注下