Tag

#排查

包含这个标签的文章。

系统运维 620 阅读

MySQL 联合索引顺序不匹配导致慢查询的排查与优化实践

适用场景 业务表按租户、状态和创建时间查询列表。数据量从几十万增长到千万级后,接口 P95 延迟突然升高;应用监控中数据库耗时占比明显增加,但 CPU 和磁盘利用率并不一定很高。 本文以常见的订单列表为例,说明如何确认“建了索引却没有用好”的联合索引问题,并在不影响线上写入的前提下完成优化。 现象描述 接口执行的 SQ

阅读全文
系统运维 622 阅读

Linux 网卡 RX 队列和软中断堆积导致丢包的排查与治理实践

适用场景 线上服务出现间歇性超时、请求延迟抖动、连接偶发重置,但应用日志没有明显报错,CPU 总使用率也不高。进一步观察会发现某几颗 CPU 的 si 软中断占用很高,网卡统计里存在 rx_dropped、rx_missed_errors 或 ring buffer 溢出。这类问题常见于高并发网关、Nginx 入口机、

阅读全文
系统运维 542 阅读

Redis AOF 重写导致磁盘 IO 飙高和写入延迟的排查与治理

适用场景 本文适用于线上 Redis 开启 AOF 持久化后,业务在某些时间段出现接口变慢、写入超时、Redis used_cpu_sys 升高、磁盘 await 或 util 接近打满的场景。常见部署形态包括单机 Redis、主从 Redis、哨兵架构,以及运行在云主机本地盘或云盘上的 Redis 实例。 重点关注下

阅读全文