# 故障排查方法

用影响判断、证据链和可验证假设快速收敛现场问题。

## 第一步：控制影响

确认受影响的用户、业务、区域、版本和开始时间。需要时先隔离、降级或回退，止损优先于寻找完整根因。

## 第二步：建立时间线

记录最后一次正常时间、首次异常时间以及期间发生的发布、配置、数据、证书、网络和依赖变化。

## 第三步：形成假设

每个假设必须能被一个观察或实验支持或否定。优先验证概率高、影响大且验证成本低的假设。

## 第四步：分层定位

用户入口 → DNS/CDN → 网络 → 应用 → 依赖服务 → 数据库 → 数据 → 外部接口。一次只改变一个变量，避免制造新的不确定性。

## 第五步：验证恢复

修复后验证技术指标、核心业务、历史数据、告警状态和持续稳定性。不能以“错误日志不再出现”代替业务验证。

## 故障案例模板

> 故障现象 → 影响范围 → 时间线 → 证据 → 假设与排除 → 根因 → 临时处置 → 永久修复 → 验证 → 预防措施。
