Tag

#系统运维

包含这个标签的文章。

系统运维 51 阅读

Linux 网卡 RX 队列和软中断堆积导致丢包的排查与治理实践

## 适用场景 线上服务出现间歇性超时、请求延迟抖动、连接偶发重置,但应用日志没有明显报错,CPU 总使用率也不高。进一步观察会发现某几颗 CPU 的 `si` 软中断占用很高,网卡统计里存在 `rx_dropped`、`rx_missed_errors` 或 ring buffer 溢出。这类问题常见于高并发网关、

阅读全文
系统运维 178 阅读

Linux OOM Killer 导致服务被杀的排查与治理实践

## 适用场景 这篇文章适用于线上服务突然退出、容器被重启、systemd 日志里只有 `Killed`、监控显示内存瞬时打满,但应用日志没有明确异常栈的场景。常见环境包括物理机、云主机、Docker 容器和 Kubernetes 节点。 OOM Killer 的本质是内核在内存不可回收时主动选择进程终止,以保证系

阅读全文
系统运维 190 阅读

Docker 容器 json-file 日志膨胀导致磁盘被打满的排查与治理

## 适用场景 这类问题常见于单机 Docker、docker-compose 或没有接入集中日志系统的测试/生产节点。应用本身还在运行,但主机磁盘空间持续下降,最终出现接口异常、容器重启失败、镜像拉取失败、数据库写入失败等问题。 典型环境特征: - Docker 使用默认 `json-file` 日志驱动。 -

阅读全文