Skip to content慢查询、告警与一份 Runbook
本周做了什么
- 慢查询清单第一次真正清零。 把积压的最后三条长尾慢查询处理掉了:两条是典型的 N+1,改成批量预取之后,P99 从 1.8 s 降到 120 ms 左右;另一条是历史遗留的全表扫描,加了一个覆盖索引就结束了。清单空了之后反而不太敢相信,又验证了一遍执行计划。
- 值了两个夜班。 周二凌晨的告警是磁盘水位,根因是日志滚动配置在半个月前的一次变更里被顺手改坏了。修复本身只花十分钟,但我把「为什么巡检没兜住」写成一页 Runbook,补上了漏掉的水位检查项。告警不可怕,同样的告警第二次响才可怕。
- 给数据管道补了断点续传。 之前任务失败只能整批重跑,最坏要四十分钟;现在按分片记录进度,重跑只补缺口。改动不大,但心里踏实了很多。
- 周五做了一次内部分享,讲怎么用影子流量验证重构。到场的人比预期多,被问住的问题是「影子流量的成本怎么核算」——当时答得含糊,下周把这笔账算清楚。
卡在哪
- 一个跨团队接口的边界没谈拢:我希望对方保证幂等,对方希望由我们做去重。两边都说得通,僵住了。下周约了面聊,先把自己这边的去重成本算出来再上桌,不带情绪,只带数字。
- 测试环境这周抽风三次,两次 CI 重跑才过。排查它花的时间比写代码还多,准备下周提一个小专项,把它当正经问题治理,而不是当背景噪音。
下周计划
- 管道灰度放量到 50%,盯一夜再决定全量。
- 给管道补一个监控面板,重点看分片重跑次数。
- 把周五的分享整理成文章,发到这个栏目。