Tag

#排查

包含这个标签的文章。

系统运维 611 阅读

Linux conntrack 表满导致连接超时的排查与治理实践

适用场景 本文适用于 Linux 主机、NAT 网关、Docker 宿主机、Kubernetes Node 或开启防火墙规则的服务器。当业务出现偶发连接超时、DNS 查询失败、服务间调用间歇性失败,而 CPU、内存、磁盘都看起来正常时,可以把 conntrack 连接跟踪表作为重点排查对象。 典型环境包括: 单机部署了

阅读全文
系统运维 631 阅读

Linux OOM Killer 导致服务被杀的排查与治理实践

适用场景 这篇文章适用于线上服务突然退出、容器被重启、systemd 日志里只有 Killed、监控显示内存瞬时打满,但应用日志没有明确异常栈的场景。常见环境包括物理机、云主机、Docker 容器和 Kubernetes 节点。 OOM Killer 的本质是内核在内存不可回收时主动选择进程终止,以保证系统还能继续运行

阅读全文
系统运维 618 阅读

Docker 容器 json-file 日志膨胀导致磁盘被打满的排查与治理

适用场景 这类问题常见于单机 Docker、docker-compose 或没有接入集中日志系统的测试/生产节点。应用本身还在运行,但主机磁盘空间持续下降,最终出现接口异常、容器重启失败、镜像拉取失败、数据库写入失败等问题。 典型环境特征: Docker 使用默认 json-file 日志驱动。 容器持续输出访问日志、

阅读全文
系统运维 617 阅读

Linux 临时端口耗尽导致接口间歇性超时的排查实践

适用场景 这类问题常见于网关、爬虫、批处理任务、消息消费者、API 聚合服务等高并发出站访问场景。应用本身没有明显 CPU 或内存瓶颈,但访问下游服务、Redis、MySQL 代理、HTTP API 时偶发超时,重启应用后短时间恢复,过一会儿又开始失败。 临时端口耗尽的核心原因是:本机主动发起大量 TCP 连接,连接关

阅读全文