STANDARD PLAYBOOK

故障排查方法

用影响判断、证据链和可验证假设快速收敛现场问题。

更新于 2026-09-14故障排查 · 根因分析 · 应急响应

第一步:控制影响

确认受影响的用户、业务、区域、版本和开始时间。需要时先隔离、降级或回退,止损优先于寻找完整根因。

第二步:建立时间线

记录最后一次正常时间、首次异常时间以及期间发生的发布、配置、数据、证书、网络和依赖变化。

第三步:形成假设

每个假设必须能被一个观察或实验支持或否定。优先验证概率高、影响大且验证成本低的假设。

第四步:分层定位

用户入口 → DNS/CDN → 网络 → 应用 → 依赖服务 → 数据库 → 数据 → 外部接口。一次只改变一个变量,避免制造新的不确定性。

第五步:验证恢复

修复后验证技术指标、核心业务、历史数据、告警状态和持续稳定性。不能以“错误日志不再出现”代替业务验证。

故障案例模板

故障现象 → 影响范围 → 时间线 → 证据 → 假设与排除 → 根因 → 临时处置 → 永久修复 → 验证 → 预防措施。