跳转到内容
搜索文档

业务连续性指南

最后更新 查看 MarkdownAgent 设置

本指南通过记录可用的断开连接机制,并提供处理服务降级或基础设施不可用情况的决策指南,帮助您为 Cloudflare One Client 构建业务连续性策略。

当前弹性状况

Cloudflare One Client 在 Cloudflare 的全球分布式网络上运行,在全球拥有 300 多个接入点 (PoP)。Anycast 路由会自动将客户端连接导向最近的健康 PoP,而无需人工干预。即使无法访问 Cloudflare 的管理系统,客户端也会保留本地缓存的策略并继续执行安全控制。

有关详细的架构信息,请参阅 Cloudflare One Client 文档Cloudflare 网络与服务弹性白皮书

故障断开 (Fail-open) 与故障关闭 (Fail-closed) 决策

以下机制可帮助您在需要时执行故障断开决策。请提前记录您的决策标准,并确保适当的利益相关者有权触发断开连接。

客户影响和决策指南

方案机制指南前提条件和限制

Cloudflare 基础设施故障期间完全不可用

示例:Cloudflare 管理系统无法访问;全局断开连接(Global Disconnection)不可用,但用户需要访问互联网以维持业务运营。

外部紧急断开连接(External Emergency Disconnect)

一个由客户托管的 HTTPS 端点,客户端对其进行轮询以获取断开连接的信号,独立于 Cloudflare 基础设施运行。

适用于:Cloudflare 的管理系统无法访问,但您需要断开客户端以恢复互联网访问。

指南:在发生故障之前预先配置此机制。在发生事件期间,更新您的端点以返回 {"emergency_disconnect": true}

预期结果:客户端在 1-2 个轮询时间间隔内(可配置,默认为 60 秒)断开连接;用户重新获得直接的互联网访问权限,而无需安全控制。

前提条件:

  • 客户托管的 HTTPS 端点(IPv4/IPv6 地址,而非域名)
  • TLS 证书的 SHA-256 指纹
  • 用于针对不同组返回不同响应的 MDM 部署

限制:

  • 在 iOS、Android 或 ChromeOS 上不可用
  • 客户负责端点维护和证书更新
  • 没有断开事件的 Cloudflare 日志记录
  • 拆分隧道配置不得包含端点 IP

安全影响:失去所有 Zero Trust 控制(与全局断开连接相同)。

客户端连接完全不可用

示例:客户端无法建立安全隧道;用户无法访问受保护的应用程序或过滤的互联网。

全局断开连接(Global Disconnection)

通过仪表板或 API 立即从安全隧道中断开所有 Cloudflare One Client 的连接。

适用于:您需要立即在整个设备群中进行断开连接,且 Cloudflare 的管理系统是可访问的。

指南:先查看 Cloudflare 状态页面。如果 Cloudflare 基础设施出现问题,此机制可能会不可用 - 请改用外部紧急断开连接

预期结果:所有客户端在几秒钟内断开连接;用户可以直接访问互联网,而无需过滤、威胁保护或私有应用程序连接。

前提条件:

  • 仪表板或 API 访问权限
  • 账户管理员权限

限制:

  • 需要连接到 Cloudflare 的管理系统
  • 仅限整个账户范围(无组范围)
  • 在 Cloudflare 完全发生故障期间不可用

安全影响:

  • 失去网页过滤和恶意软件保护
  • 失去数据丢失预防 (DLP) 检查
  • 失去对私有应用程序的访问
  • 未加密的 DNS 查询(潜在的隐私泄露)

需要立即在本地覆盖的单个设备问题

示例:单个用户由于策略配置错误而被锁定;客户端开关已禁用,但用户需要紧急访问。

管理员覆盖码(Admin Override Codes)

有时限、单次使用的代码,允许 IT 管理员临时解锁特定设备上的客户端设置。

适用于:单个设备需要立即处理。这是当外部紧急断开连接不可用时,iOS 和 Android 用户的唯一选择。

指南:在仪表板中生成代码,通过安全通道将其提供给用户,并让用户在本地输入以临时绕过锁定的开关。

预期结果:临时的本地覆盖,允许用户断开客户端连接一小时。

前提条件:

  • 启用了 Lock client device switch(锁定客户端设备开关)策略
  • 有访问仪表板以生成代码的权限
  • 与最终用户直接沟通

限制:

  • 每个设备每小时一个代码
  • 需要手动 IT 干预
  • 无法针对整个设备群的场景进行扩展
  • 发生事件期间需要配备 IT 工作人员

安全影响:单个设备在一小时内失去 Zero Trust 控制。

性能降级,影响用户生产力

示例:通过客户端隧道的延迟过高;间歇性连接断开影响工作质量。

渐进式响应策略

根据范围和严重程度使用机制组合。使用 Digital Experience (DEX) 确定范围和严重程度。

按范围提供的指南:

  • 单个设备:管理员覆盖码 → 手动断开
  • 组或部门:带有 MDM 区分端点的外部紧急断开连接
  • 整个组织:全局断开连接(如果 Cloudflare 可访问)或外部紧急断开连接

决策因素:在用户生产力需求与安全要求之间进行权衡。对于受监管行业,请在断开连接前咨询您的合规团队。

预期结果:恢复用户生产力,并在安全折中方面留有记录。

前提条件:

  • 有关于故障断开与故障关闭的记录下来的决策标准
  • 在事件发生前预先配置的机制
  • 明确的授权矩阵

限制:

  • 每个机制都有不同的基础设施依赖性
  • 移动平台的选择有限

安全影响:取决于范围 - 请参阅上方的具体机制条目。

管理仪表板不可用,流量处理正常

示例:仪表板和 API 无法访问;边缘服务和客户端连接在使用缓存策略的情况下仍保持正常运转。

无需执行任何操作

边缘服务继续使用缓存的配置运行。在管理系统恢复之前,新的配置更改将不可用。

适用于:Cloudflare 的管理系统不可用,但用户流量继续正常处理。

指南:监控 Cloudflare 状态页面。通常无需客户采取任何操作 - 边缘服务会强制执行缓存的策略,直到管理系统恢复。

预期结果:现有配置继续应用;当管理系统恢复时,配置更改恢复正常。

前提条件:

  • 监控 Cloudflare 状态页面
  • 理解流量处理和管理是独立的系统

限制:

  • 在发生故障期间无法修改策略
  • 无法从仪表板触发全局断开连接
  • 实时日志和分析可能会被延迟

安全影响:无 - 安全控制保持活动状态。

其他注意事项

在事件发生前需要验证的前提条件

  • 在仪表板中开启全局断开连接功能。
  • 配置外部紧急断开连接端点并上传证书指纹。
  • 在非生产环境中测试所有机制。
  • 记录故障断开与故障关闭的决策标准,并创建授权矩阵。
  • 验证 IT 和安全人员是否具有访问关键基础设施的备份机制。
  • 定期跨部门和跨地域练习使用备份机制。

在发生事件期间所需的访问权限和凭据:

  • Cloudflare 仪表板管理员访问权限
  • 具有设备设置权限的 API 令牌(用于程序化控制)
  • MDM 管理员凭据(用于针对不同组的响应)

测试建议

  • 使用专用的测试组织或租户进行初始验证。
  • 在进行整个设备群部署之前,在小型试点组中进行测试。
  • 每季度对所有三种断开连接机制进行测试。
  • 每年进行一次完整的业务连续性演练,包括决策制定场景。

常见测试问题:

  • 外部紧急断开连接的更改需要 1-2 个轮询时间间隔才能生效(默认为 60 秒)。
  • 拆分隧道(Split Tunnel)的 **Include(包含)**模式会自动排除紧急端点 IP。
  • 证书指纹更改需要重新向所有受影响的设备部署 MDM。

集成依赖性

断开 Cloudflare One Client 的连接时,以下控制将受到影响:

  • **网页过滤和威胁保护:**DNS 和 HTTP 策略停止执行;用户可以直接进行未过滤的互联网访问。
  • **数据丢失预防 (DLP):**内容检查停止;敏感数据的上传和下载在没有 DLP 控制的情况下进行。
  • **私有应用程序访问:**与受 Cloudflare Tunnel 保护的应用程序的连接丢失。对于关键应用程序,请考虑其他访问方法,例如直接 VPN。
  • **Gateway 日志记录和分析:**在断开连接期间无法查看用户流量。

何时联系 Cloudflare 支持

在以下情况下,请立即联系支持人员:

  • 怀疑 Cloudflare 基础设施问题正在影响多个客户。
  • 在关键安全事件期间,您无法访问仪表板。
  • 外部紧急断开连接配置错误导致了整个设备群处于卡住状态。

开单时需要提供的信息:

  • 账户 ID 和组织名称
  • 受影响的设备数量和平台分布
  • 您的 Cloudflare 状态页面检查结果
  • 客户端诊断日志 (warp-diag)
  • 时间线和已经采取的故障排除步骤

相关资源

这篇文档对您有帮助吗?