Tag

#排查

包含这个标签的文章。

数据库 34 阅读

PostgreSQL 并发建索引失败留下 INVALID:从等待取证到在线修复

适用场景 本文适用于 PostgreSQL 13 及以上版本的生产库:为了避免普通 CREATE INDEX 长时间阻塞写入,运维或开发人员改用 CREATE INDEX CONCURRENTLY,但命令执行数十分钟后失败、被取消,或者发布系统超时退出。重新执行时又提示索引已存在,查询计划却仍然走顺序扫描。 本文重点处

阅读全文
Python 70 阅读

HTTPX 流式响应偶发 PoolTimeout:从连接未释放到生命周期闭环

Python 服务用 HTTPX 转发大文件、对象存储下载或上游 SSE 时,通常会启用流式响应,避免把整个响应体读入内存。上线后却可能出现一种很迷惑的故障:服务启动时一切正常,运行一段时间后请求开始批量报 httpx.PoolTimeout;重启进程能暂时恢复,单纯调大连接池只能延后复发。 这类问题往往不是上游连接慢

阅读全文
数据库 123 阅读

Redis 热点缓存过期后数据库被打满:互斥重建与逻辑过期实践

适用场景 商品详情、活动配置、首页聚合数据和权限策略等读取接口,通常会把查询结果缓存在 Redis 中。平时数据库负载很低,一旦某个热点键过期,大量并发请求却可能同时回源,几百毫秒内把连接池占满,最终形成接口超时、重试放大和数据库雪崩。 本文讨论的是单个或少量热点键失效导致的缓存击穿。如果大量键在同一时间过期,属于缓存

阅读全文
监控 137 阅读

Prometheus 告警反复触发与恢复:从指标断点到稳定窗口的治理实践

适用场景 这篇文章适合已经使用 Prometheus 和 Alertmanager,但值班群里经常出现同一告警在几分钟内“触发—恢复—再次触发”的团队。典型场景包括: 接口错误率在阈值附近上下波动; 抓取偶发失败,表达式短暂返回空向量; 应用滚动发布后计数器重置,瞬时比率失真; 规则计算过慢或远端数据到达较晚,评估结果

阅读全文
Python 176 阅读

Python asyncio 优雅停机卡住:从取消信号被吞到结构化并发治理

适用场景与现象 异步消费者、WebSocket 网关或定时任务服务收到 SIGTERM 后,健康检查已经失败,进程却迟迟不退出,最终被 Kubernetes 在宽限期结束时强制 SIGKILL。常见伴随现象是: 停机日志只出现“开始关闭”,没有“后台任务已结束”; 某个任务仍处于 PENDING,但业务请求已经停止进入

阅读全文
数据库 271 阅读

MySQL 连接池复用后请求行为漂移:会话状态泄漏的排查与复位实践

适用场景与现象 同一个接口在生产环境中偶发出现以下现象:有时写入没有立即提交,有时日期相差 8 小时,有时普通查询突然以更严格的事务隔离级别执行。重启应用后故障暂时消失,单独连接 MySQL 手工执行又无法复现。 这类问题常见于使用连接池的 Web 服务、异步任务和批处理程序。连接池归还的是可复用的物理连接,而 MyS

阅读全文
开发 303 阅读

Django 新订单偶发查询不到:Celery 任务早于事务提交的排查与修复

Django 新订单偶发“查询不到”:Celery 任务早于事务提交的排查与修复 适用场景与现象 下单接口先写入订单,再让 Celery Worker 发送确认邮件。接口返回成功,Worker 却偶发 Order.DoesNotExist;在管理后台查询,同一订单已经存在。失败多发生在数据库写入较慢、Worker 较空

阅读全文
网络 300 阅读

新增 DNS 记录后仍返回 NXDOMAIN:权威链路与负缓存的排查实践

适用场景 为新接口 api.example.test 添加 A 记录后,监控节点已能解析,部分用户却持续报告“找不到域名”。本文以新建记录为例,区分权威服务器未同步、递归解析器负缓存和终端本地缓存。文中的 example.test、权威服务器和 IP 均为示例,执行前须替换为自己的域名与地址。 现象先分清 DNS 查询

阅读全文