Tag

#监控

包含这个标签的文章。

数据库 506 阅读

PostgreSQL 连接池耗尽:从 idle in transaction 到事务边界治理

适用场景 应用运行一段时间后,新请求开始等待数据库连接,接口 P99 持续升高,最终出现连接池获取超时或 PostgreSQL too many connections。数据库 CPU、磁盘 I/O 和慢 SQL 指标却不高,重启应用后又能短暂恢复。 这类现象经常不是“连接池太小”,而是业务代码开启事务后没有及时提交或

阅读全文
系统运维 539 阅读

MySQL 主从复制延迟持续扩大:从现场取证到并行复制治理的排查实践

适用场景 本文适用于 MySQL 8.0 或已启用 GTID 的 MySQL 5.7 主从/主备架构:监控显示 Seconds_Behind_Source 持续增长,报表、读库或故障切换的恢复点开始不可接受。目标是先确认延迟真实原因,再在不破坏复制一致性的前提下恢复追平。 现象描述 一次订单促销后,主库写入从平时每秒数

阅读全文
系统运维 556 阅读

Linux 时间漂移导致 JWT 校验失败与 TLS 握手异常:从证据采集到 chrony 治理

适用场景 适用于运行在 Linux 虚拟机、物理机或容器节点上的 Web 服务。业务表现为同一版本在部分机器上间歇出现登录失效、JWT token is not active / token expired、HTTPS 握手失败或调用云 API 返回签名过期;重试、重启应用有时短暂恢复,但问题会再次出现。 本文以“应用

阅读全文
网络 554 阅读

Linux conntrack 表满导致偶发网络超时:从现场确认到容量治理的排查实践

适用场景 业务运行在 Linux 主机、Docker 或 Kubernetes 节点上,经过 NAT、iptables/nftables 防火墙或四层负载均衡转发。某个时段开始出现 API 偶发超时、DNS 请求失败、容器无法访问外部服务,但主机 CPU、内存和带宽看起来都正常;重启网络或重启节点后短暂恢复。 本文以

阅读全文
系统运维 596 阅读

Redis 延迟偶发飙升:从 Hot Key 与 Big Key 定位到分阶段治理实践

适用场景 业务使用 Redis 承载登录态、商品详情、计数器或排行榜。平时接口稳定,但在促销、定时任务或某些请求集中到来时,应用开始出现 Redis 超时;监控中 instantaneous_ops_per_sec 并不一定很高,CPU 也可能没有持续满载。 本文以单实例或主从架构为例,说明如何区分 Hot Key(极

阅读全文
系统运维 648 阅读

Docker 容器频繁 OOMKilled:从 cgroup 内存指标到限额配置的排查与治理实践

适用场景 服务容器偶发或持续重启,docker ps -a 显示退出码为 137,应用日志末尾没有 Java、Python 或 Go 自己抛出的异常。宿主机看起来还有可用内存,但容器仍被杀掉;或者一次流量高峰后多个容器同时不可用。 本文以 Docker / Docker Compose 部署的 API 服务为例,说明如

阅读全文
系统运维 612 阅读

Linux 磁盘空间充足却无法创建文件:inode 耗尽的排查与治理实践

适用场景 应用报出 No space left on device,但 df -h 显示磁盘使用率不高;Nginx 无法写入访问日志、容器无法创建临时文件、CI 构建失败,甚至 touch 一个空文件也失败。这通常不是字节空间耗尽,而是文件系统可分配的 inode 已经用完。 本文以 ext4/XFS 主机为例,给出从

阅读全文
系统运维 662 阅读

systemd-journald 限流导致关键日志丢失的排查与治理实践

适用场景 服务运行正常,但在故障窗口里 journalctl 中恰好缺少应用最关键的一段日志;常见于 Java、Python、Nginx/OpenResty、容器运行时或短时间大量报错的 systemd 服务。运维人员往往把它误判为程序没有输出,实际日志可能已经被 systemd-journald 的限流机制主动丢弃。

阅读全文