本指南通过记录可用的断开连接机制,并提供处理服务降级或基础设施不可用情况的决策指南,帮助您为 Cloudflare One Client 构建业务连续性策略。
Cloudflare One Client 在 Cloudflare 的全球分布式网络上运行,在全球拥有 300 多个接入点 (PoP)。Anycast 路由会自动将客户端连接导向最近的健康 PoP,而无需人工干预。即使无法访问 Cloudflare 的管理系统,客户端也会保留本地缓存的策略并继续执行安全控制。
有关详细的架构信息,请参阅 Cloudflare One Client 文档 和 Cloudflare 网络与服务弹性白皮书 ↗。
以下机制可帮助您在需要时执行故障断开决策。请提前记录您的决策标准,并确保适当的利益相关者有权触发断开连接。
| 方案 | 机制 | 指南 | 前提条件和限制 |
|---|---|---|---|
Cloudflare 基础设施故障期间完全不可用 示例:Cloudflare 管理系统无法访问;全局断开连接(Global Disconnection)不可用,但用户需要访问互联网以维持业务运营。 | 外部紧急断开连接(External Emergency Disconnect) 一个由客户托管的 HTTPS 端点,客户端对其进行轮询以获取断开连接的信号,独立于 Cloudflare 基础设施运行。 | 适用于:Cloudflare 的管理系统无法访问,但您需要断开客户端以恢复互联网访问。 指南:在发生故障之前预先配置此机制。在发生事件期间,更新您的端点以返回 预期结果:客户端在 1-2 个轮询时间间隔内(可配置,默认为 60 秒)断开连接;用户重新获得直接的互联网访问权限,而无需安全控制。 | 前提条件:
限制:
安全影响:失去所有 Zero Trust 控制(与全局断开连接相同)。 |
客户端连接完全不可用 示例:客户端无法建立安全隧道;用户无法访问受保护的应用程序或过滤的互联网。 | 全局断开连接(Global Disconnection) 通过仪表板或 API 立即从安全隧道中断开所有 Cloudflare One Client 的连接。 | 适用于:您需要立即在整个设备群中进行断开连接,且 Cloudflare 的管理系统是可访问的。 指南:先查看 Cloudflare 状态页面。如果 Cloudflare 基础设施出现问题,此机制可能会不可用 - 请改用外部紧急断开连接。 预期结果:所有客户端在几秒钟内断开连接;用户可以直接访问互联网,而无需过滤、威胁保护或私有应用程序连接。 | 前提条件:
限制:
安全影响:
|
需要立即在本地覆盖的单个设备问题 示例:单个用户由于策略配置错误而被锁定;客户端开关已禁用,但用户需要紧急访问。 | 管理员覆盖码(Admin Override Codes) 有时限、单次使用的代码,允许 IT 管理员临时解锁特定设备上的客户端设置。 | 适用于:单个设备需要立即处理。这是当外部紧急断开连接不可用时,iOS 和 Android 用户的唯一选择。 指南:在仪表板中生成代码,通过安全通道将其提供给用户,并让用户在本地输入以临时绕过锁定的开关。 预期结果:临时的本地覆盖,允许用户断开客户端连接一小时。 | 前提条件:
限制:
安全影响:单个设备在一小时内失去 Zero Trust 控制。 |
性能降级,影响用户生产力 示例:通过客户端隧道的延迟过高;间歇性连接断开影响工作质量。 | 渐进式响应策略 根据范围和严重程度使用机制组合。使用 Digital Experience (DEX) 确定范围和严重程度。 | 按范围提供的指南:
决策因素:在用户生产力需求与安全要求之间进行权衡。对于受监管行业,请在断开连接前咨询您的合规团队。 预期结果:恢复用户生产力,并在安全折中方面留有记录。 | 前提条件:
限制:
安全影响:取决于范围 - 请参阅上方的具体机制条目。 |
管理仪表板不可用,流量处理正常 示例:仪表板和 API 无法访问;边缘服务和客户端连接在使用缓存策略的情况下仍保持正常运转。 | 无需执行任何操作 边缘服务继续使用缓存的配置运行。在管理系统恢复之前,新的配置更改将不可用。 | 适用于:Cloudflare 的管理系统不可用,但用户流量继续正常处理。 指南:监控 Cloudflare 状态页面。通常无需客户采取任何操作 - 边缘服务会强制执行缓存的策略,直到管理系统恢复。 预期结果:现有配置继续应用;当管理系统恢复时,配置更改恢复正常。 | 前提条件:
限制:
安全影响:无 - 安全控制保持活动状态。 |
- 在仪表板中开启全局断开连接功能。
- 配置外部紧急断开连接端点并上传证书指纹。
- 在非生产环境中测试所有机制。
- 记录故障断开与故障关闭的决策标准,并创建授权矩阵。
- 验证 IT 和安全人员是否具有访问关键基础设施的备份机制。
- 定期跨部门和跨地域练习使用备份机制。
在发生事件期间所需的访问权限和凭据:
- Cloudflare 仪表板管理员访问权限
- 具有设备设置权限的 API 令牌(用于程序化控制)
- MDM 管理员凭据(用于针对不同组的响应)
- 使用专用的测试组织或租户进行初始验证。
- 在进行整个设备群部署之前,在小型试点组中进行测试。
- 每季度对所有三种断开连接机制进行测试。
- 每年进行一次完整的业务连续性演练,包括决策制定场景。
常见测试问题:
- 外部紧急断开连接的更改需要 1-2 个轮询时间间隔才能生效(默认为 60 秒)。
- 拆分隧道(Split Tunnel)的 **Include(包含)**模式会自动排除紧急端点 IP。
- 证书指纹更改需要重新向所有受影响的设备部署 MDM。
断开 Cloudflare One Client 的连接时,以下控制将受到影响:
- **网页过滤和威胁保护:**DNS 和 HTTP 策略停止执行;用户可以直接进行未过滤的互联网访问。
- **数据丢失预防 (DLP):**内容检查停止;敏感数据的上传和下载在没有 DLP 控制的情况下进行。
- **私有应用程序访问:**与受 Cloudflare Tunnel 保护的应用程序的连接丢失。对于关键应用程序,请考虑其他访问方法,例如直接 VPN。
- **Gateway 日志记录和分析:**在断开连接期间无法查看用户流量。
在以下情况下,请立即联系支持人员:
- 怀疑 Cloudflare 基础设施问题正在影响多个客户。
- 在关键安全事件期间,您无法访问仪表板。
- 外部紧急断开连接配置错误导致了整个设备群处于卡住状态。
开单时需要提供的信息:
- 账户 ID 和组织名称
- 受影响的设备数量和平台分布
- 您的 Cloudflare 状态页面检查结果
- 客户端诊断日志 (
warp-diag) - 时间线和已经采取的故障排除步骤
| 资源 | 链接 |
|---|---|
| 产品文档 | Cloudflare One Client 文档 |
| API 参考 | Zero Trust Devices Settings API |
| 全局断开连接 | 全局断开连接设置 |
| 外部紧急断开连接 | 外部紧急断开连接文档 |
| 管理员覆盖码 | 管理员覆盖码 |
| MDM 部署 | MDM 部署指南 |
| Terraform 提供商 | Cloudflare Terraform Provider – Zero Trust Devices ↗ |
| 状态页面 | cloudflarestatus.com ↗ |
| 故障排除 | 客户端故障排除指南 |
| 弹性白皮书 | Cloudflare 网络与服务弹性白皮书 ↗ |