跳转到内容
搜索文档

排除连接故障

最后更新 查看 MarkdownAgent 设置

本指南帮助您判断隧道健康告警是否实际影响了您的流量。仅当您的流量当前正在通过隧道不健康的 Cloudflare 数据中心路由时,降级或中断的隧道才会对您产生影响。

开始之前

了解 Cloudflare WAN 健康检查和流量路由的工作原理:

  • 健康检查从每个 Cloudflare 数据中心独立运行。
  • 每个数据中心根据自身探测来评估隧道健康状况。
  • 流量通过 anycast 路由进入离源最近的 Cloudflare 数据中心。
  • 某数据中心的隧道降级,若该数据中心并未处理您的流量,则对您的连接没有影响。

如果您遇到实际的隧道健康问题(隧道抖动、所有隧道中断或 IPsec 错误),请改为参阅排查隧道健康问题

诊断流程图

使用此流程图判断隧道健康告警是否需要采取行动。

flowchart TD
accTitle: 连接故障排查流程图
accDescr: 一个决策树,用于判断降级的隧道告警是否影响了您的流量。

A["您收到了隧道<br>健康告警"] --> B{"您的流量<br>是否受影响?"}
B -- "是,我有<br>连接问题" --> C["确定您的入站<br>数据中心并检查<br>该处的隧道健康状况"]
B -- "否,流量<br>正常" --> D{"告警是否匹配<br>承载您流量的<br>数据中心?"}
D -- "否" --> E["无需操作。<br>降级隧道所在<br>数据中心未承载<br>您的流量。"]
D -- "是" --> C
C --> G{"您的入站<br>数据中心隧道<br>是否健康?"}
G -- "是" --> H["问题与隧道<br>无关。请检查<br>Cloudflare 状态和<br>您的源网络。"]
G -- "否" --> I["您的入站数据中心<br>隧道不健康。<br>请参阅排查<br>隧道健康问题。"]

1. 确定您的入站数据中心

确定您的流量进入哪个 Cloudflare 数据中心。这是唯一与您当前连接状况相关的数据中心。

使用 traceroute

从源网络向您的 Cloudflare WAN 前缀运行 traceroute。在跟踪输出中查找 Cloudflare 数据中心主机名,其中包含标识数据中心的三字母 IATA 机场代码

traceroute 203.0.113.1
 1  192.168.1.1 (192.168.1.1)  1.234 ms
 2  10.0.0.1 (10.0.0.1)  5.678 ms
 3  198.51.100.1 (198.51.100.1)  10.123 ms
 4  198.51.100.10 (198.51.100.10)  12.345 ms
 5  lhr01.cf (198.51.100.11)  15.678 ms

在此示例中,lhr 表示流量进入 Cloudflare 的伦敦(希思罗)数据中心。

使用 Cloudflare 仪表板

您可以使用网络分析来确定哪些数据中心处理了您的流量。

  1. 前往 Network analytics(网络分析) 页面。

    Go to Network analytics ↗
  2. 选择 Add filter(添加过滤器),按您的源 IP 地址过滤流量以隔离您的流量。

  3. Packet summary(数据包摘要) 下,选择 Source data center(源数据中心) 标签页。如果标签页不可见,请选择三点菜单(...)以显示更多查看选项并选择 Source data center(源数据中心)

  4. 查看每个数据中心的流量细分,以确定哪些 Cloudflare 数据中心正在处理您的流量。

  5. 将这些数据中心与Connector health(连接器健康状况)页面上的隧道健康状态进行交叉验证。如果承载您流量的数据中心隧道健康,则其他数据中心的隧道降级告警不是您连接问题的原因。

2. 关联 Cloudflare 状态

如果相关数据中心的隧道健康,但您仍然遇到连接问题,请检查是否存在更广泛的平台问题。

  1. 前往 Cloudflare 状态页面
  2. 查找您所确定的数据中心是否有活跃事件或维护计划。
  3. 检查是否有可能影响您流量的事件,例如与网络、BYOIP 或您的配置所依赖的服务相关的故障。

3. 收集支持所需的信息

如果您已完成本指南的所有步骤但仍无法解决问题,请在联系 Cloudflare 支持之前收集以下信息。

必要信息

  1. 受影响的账户 ID隧道名称
  2. 问题开始的时间戳(UTC)
  3. 您确定的入站数据中心(机场代码,例如 LHRIAD
  4. 观察到的症状:
    • 用户流量是否受影响,还是仅触发了健康检查告警
    • 哪些隧道和数据中心显示降级或中断状态
    • 问题是间歇性的还是持续性的

有用的诊断数据

  • 从您的源网络到 Cloudflare WAN 前缀的 traceroute 输出
  • 显示相关数据中心隧道健康状态的仪表板截图
  • 使用 ping.pe 等工具从多个全球位置测试可达性的分布式 traceroute
  • 如果确认存在流量丢失,请提供来自您路由器的数据包抓取

相关资源

这篇文档对您有帮助吗?