本次官方公告的核心是:CDN 故障排查流程已更新,新流程更强调分层定位和边界确认。无论您是刚接触 CDN 还是已有运维经验,建议先理解新流程的适用范围,再按步骤操作。本文不涉及具体配置命令,仅基于 Cloudflare 官方文档总结通用原则。
新流程的边界与适用场景
新流程适用于以下三类典型故障:缓存未命中、DDoS 攻击导致的访问异常、源站响应缓慢。它不适用于域名解析(DNS)配置错误或账户权限问题,这类问题请参照其他官方文档。若您的 CDN 服务商不是 Cloudflare,部分操作(如清除缓存)可能不同,但排查思路通用。
第一步:确认故障现象与影响范围
开始排查前,先明确故障是全局性的还是局部性的。例如,仅部分区域用户访问慢,可能指向节点覆盖问题;而全部用户均无法访问,则更可能是源站或 DDoS 攻击。记录故障开始时间、持续时间、影响区域,这些信息有助于后续判断。
第二步:检查缓存状态
缓存是 CDN 加速的核心,也是故障高发点。根据 Cloudflare 缓存文档,缓存默认行为受文件扩展名和 Cache Rules 影响。若资源未缓存,可能原因包括:文件类型不在默认缓存列表、Cache Rules 未配置、或缓存被主动清除。您可以通过响应头(如 CF-Cache-Status)判断命中状态。若 HIT,则问题可能出在缓存内容本身(如过期或错误);若 MISS,则需检查源站是否正常。
第三步:排查 DDoS 攻击
若故障伴随流量突增、请求来源分散,则需考虑 DDoS 攻击。Cloudflare 的 DDoS 防护文档 指出,其系统会自动检测并缓解 L3/4 和 L7 攻击,但您可能仍需调整托管规则。检查攻击是否被自动缓解,可查看安全事件日志。若攻击绕过防护,则需自定义规则,例如对特定 IP 或区域进行速率限制。
第四步:验证源站健康
若缓存和 DDoS 均无异常,则问题可能源于源站。直接访问源站 IP(绕过 CDN)可测试其响应时间。若源站响应慢或超时,则需检查源站服务器负载、数据库查询等。此外,Cloudflare 的 Workers 可缓存源站响应,若您使用了 Workers,也需检查其逻辑是否异常。
常见误区与失败条件
误区一:认为清除缓存即可解决所有问题。实际上,若源站已故障,清除缓存只会加重源站压力。误区二:忽略 DDoS 攻击的隐蔽性,某些攻击流量可能未触发自动告警。误区三:未检查 Workers 代码,导致缓存逻辑错误。新流程的失败条件包括:未记录故障时间线、未对比多种现象、未验证源站直接访问。
操作步骤总结
- 记录故障现象、时间、区域。
- 检查响应头中的缓存状态,判断是否命中。
- 查看安全事件,确认是否有 DDoS 攻击。
- 直接访问源站,测试其响应。
- 若以上均无异常,检查 Workers 或边缘计算逻辑。
参考资料
延伸阅读
