Prometheus remote_write 延迟持续升高:从队列积压到安全恢复的排查实践
## 适用场景 本文适用于 Prometheus 通过 `remote_write` 把指标发送到 Thanos Receive、Grafana Mimir、VictoriaMetrics 或其他远端存储的场景。典型问题是本地抓取仍然正常,Prometheus 查询近期数据也没有明显异常,但远端查询、告警或长期存储中
Tag
包含这个标签的文章。
## 适用场景 本文适用于 Prometheus 通过 `remote_write` 把指标发送到 Thanos Receive、Grafana Mimir、VictoriaMetrics 或其他远端存储的场景。典型问题是本地抓取仍然正常,Prometheus 查询近期数据也没有明显异常,但远端查询、告警或长期存储中
## 适用场景 本文适用于 Prometheus 根据错误率、延迟、资源使用率等指标触发告警,并通过 Alertmanager 发送通知的场景。典型问题是:指标在阈值附近波动,告警几分钟内反复触发和恢复;短暂采集缺口被误判为恢复;值班人员收到大量重复通知,却难以判断故障是否真正结束。 目标不是简单地“把告警调迟”,
## 适用场景 本文适用于 Prometheus 运行一段时间后出现以下现象的场景: - Prometheus 数据目录持续膨胀,磁盘空间很快被打满; - `prometheus_tsdb_head_series`、`prometheus_tsdb_head_chunks` 持续上涨; - 查询变慢,Prometh