跳转到内容
搜索文档

Logpush 运行状况仪表板

最后更新 查看 MarkdownAgent 设置

Logpush 运行状况仪表板(Logpush Health Dashboards)可让您清晰了解 Logpush 作业的性能与可靠性。您可以监控日志投递状态、诊断问题,并了解发送到已配置目标的数据量。这有助于确保用于安全、合规和可观测性的关键日志数据始终按预期流动。

通过运行状况通知保持知情

配置 Logpush 运行状况通知,以便在 Logpush 作业被禁用或出现错误时接收提醒。尽早检测至关重要,因为 Logpush 无法回填日志——数据一旦丢弃,将永久丢失。

运行状况通知与运行状况仪表板配合使用,为 Logpush 作业性能提供实时提醒和历史分析。


访问运行状况仪表板

  1. Cloudflare 仪表板中,前往账户或域名(zone)级别的 Logpush(日志推送) 页面。
  2. 前往 Health(运行状况) 选项卡。
  3. 选择要分析的作业。
  4. 指定要查看的时间范围。
  5. (可选)Jobs(作业) 选项卡中,找到要分析的作业。
  6. 将鼠标悬停在该作业的 Job Health (24h)(作业运行状况(24 小时)) 列上,然后选择 View Health(查看运行状况)
  7. 您将被重定向到 Health(运行状况) 选项卡,可在其中选择所需的分析时间范围。

数据可用性与 API 访问

  • 运行状况仪表板在 Cloudflare 仪表板中为每个 Logpush 作业显示最多 30 天的运行状况指标。
  • 可通过 GraphQL API 中的 logpushHealthAdaptiveGroups 数据集查询原始运行状况指标。
  • 您可以使用 Cloudflare GraphQL Explorer 探索或测试查询。

作业运行状况中的关键概念

日志行(Log line)

Cloudflare 生成的单条日志条目,例如 HTTP 请求、DNS 查询或 Access 事件。

批次(Batch)

Cloudflare 作为单个文件或请求一并上传到您目标的一组日志。批次也称为文件。

上传(Upload)

将一批日志上传到目标的单次尝试。如果首次尝试失败,Cloudflare 会自动重试,直到上传成功或达到重试上限。每次上传可能有三种结果之一:Successful(成功)Retry attempts(重试)Failed(失败)

Successful

表示一批日志已成功上传到您的目标,没有错误或超时。上传成功后,该批次被标记为已投递,不再进行进一步重试。

Retry attempts

在初始失败后进行的额外上传尝试。计数包括首次失败的尝试。重试会持续进行,直到批次成功投递或达到重试上限。

Failed

表示某批次的所有上传尝试均已用尽且未成功。当批次失败时,Cloudflare 无法将其日志投递到您的目标,该批次中的所有日志都会被丢弃。这些日志将永久丢失。

运行状况仪表板流程

Logpush 运行状况仪表板提供两个互补视图,帮助您监控和排查日志投递:Upload Health(上传运行状况)Upload Reliability(上传可靠性)

每个视图突出显示作业性能的不同方面——已投递的内容以及投递的可靠程度。

Upload Health(上传运行状况)

Upload Health(上传运行状况) 帮助您了解有多少数据已成功上传,以及在何处上传失败或数据被丢弃。此视图回答的问题是:上传是否成功,日志是否到达目标?

图表与指标

  • Batch Upload Success vs. Failure(批次上传成功与失败):显示成功上传与失败的批次数。

    • Successful Uploads(成功上传) - 成功上传的批次总数。
    • Failed Uploads(失败上传) - 由于连接或目标问题而未能上传的批次总数。
  • Log Lines Uploaded(已上传日志行):跟踪成功上传到目标的日志行总数。

    • Uploaded Log Lines(已上传日志行) - 成功投递的日志行总数。
    • Dropped Log Lines(已丢弃日志行) - 在所有重试尝试后仍无法投递的日志行总数。
  • Data Volume(数据量):显示已上传日志数据的总体积(以字节为单位),包括压缩和未压缩。

    • Uncompressed Data (raw)(未压缩数据(原始)) - 压缩前日志数据的总大小。
    • Compressed Data (uploaded)(已压缩数据(已上传)) - 压缩后日志数据的总大小,表示实际传输的字节数。

何时使用

从这里开始评估整体数据投递运行状况:

  • 高上传成功率和稳定的数据量表明 Logpush 作业运行状况良好。
  • 丢弃、尖峰或失败的上传表明存在投递问题——请前往 Upload Reliability(上传可靠性) 调查根本原因。

Upload Reliability(上传可靠性)

Upload Reliability(上传可靠性) 帮助您识别影响所有上传尝试(包括重试和失败)的可靠性、稳定性和延迟的因素。此视图回答的问题是:上传是否稳定且高效?

图表与指标

  • Uploaded Logs by Status Code(按状态码分类的已上传日志) 按状态码分类显示成功、失败或重试的批次数。

    • Success Rate(成功率) - 成功上传的批次百分比。
    • Successful Uploads(成功上传) - 成功完成的批次总数。
  • Upload Duration(上传持续时间):显示完成每批上传所需的平均时间,按状态码细分。

    • Destination Availability(目标可用性) - Cloudflare 成功连接到您的目标并完成上传的频率。
    • Average Upload Duration(平均上传持续时间) - 日志生成后上传所需的平均时间。
  • Retry Attempts(重试次数):显示失败上传后的重试次数,按状态码细分。

    • Retry Attempts(重试次数) - 在先前失败后进行的上传尝试总数(包括首次失败的尝试)。

何时使用

使用此视图排查可靠性问题:

  • 高延迟、频繁重试或低目标可用性表明目标端点或网络可能存在不稳定。
  • 结合 Upload Health(上传运行状况) 指标,将投递成功情况与潜在的可靠性模式关联起来。

故障排除指南

Logpush 运行状况仪表板可帮助您监控 Logpush 作业的状态、可靠性和性能。使用本指南解读每个图表、识别异常的根本原因并采取纠正措施。

图表名称 症状 含义 可能原因 建议操作
Batch Upload Success vs Failure(批次上传成功与失败) 上传失败 Cloudflare 在所有重试尝试后仍无法投递批次。这些批次被标记为 failed,其中的所有日志行都会被丢弃。 - 目标端点不可用或拒绝连接(凭据过期、停机)。
- 由于批次过大或网络延迟导致上传超时。
- 目标限流或速率限制。
- 验证目标凭据和端点运行状况。
- 在 Logpush 作业配置中减小批次大小。
- 确保目标能够处理预期的上传速率。
- 如果失败持续存在,请联系 Cloudflare 支持。
Log Lines Uploaded(已上传日志行) 丢弃的日志行或投递量减少 投递的日志少于预期,通常由于上传失败或批次丢弃。 - 失败上传激增。
- 目标摄入限制或部分上传。
- 比较 Log Lines Uploaded(已上传日志行)Data Volume(数据量) 图表中的下降。
- 检查目标是否有摄入错误或速率限制。
- 审查最近的 Logpush 作业配置更改。
Data Volume (Compressed & Uncompressed)(数据量(压缩与未压缩)) 数据量意外下降 已投递数据量低于预期,表明压缩效率低下或批次丢弃。 - 上传失败或不完整的投递。
- 目标因大小或配额限制拒绝上传。
- 审查压缩设置和批次大小。
- 验证目标存储容量。
- 检查失败上传或重试是否有尖峰。
Uploaded Logs by Status Code(按状态码分类的已上传日志) 大量重试或失败状态码 上传在首次尝试时失败,但在重试时成功。 - 目标临时停机或限流。
- Cloudflare 与目标之间的网络不稳定。
- 按状态码审查重试和失败分布。
- 与 Destination Availability(目标可用性) 比较以关联。
- 减小批次大小。
Retry Attempts(重试次数) 频繁的重试活动 上传反复失败并多次重试。 - 目标不稳定或瞬态错误。
- 高延迟或目标确认缓慢。
- 验证目标正常运行时间和摄入速率。
- 确保目标未对请求进行限流。
- 偶发重试是预期的;持续尖峰需要审查。
Avg. Upload Duration(平均上传持续时间) 上传时间过长 上传耗时超过预期,表明延迟或批次过大。 - 大批次或未压缩的负载。
- 网络或区域延迟。
- 目标处理延迟。
- 审查 Avg. Upload Duration(平均上传持续时间) 趋势。
- 减小批次大小以加快上传。
- 验证目标吞吐量和速率限制设置。
Destination Availability(目标可用性) 可用性低或不稳定 Cloudflare 无法持续连接到您的目标。 - 目标停机、DNS 错误或身份验证问题。
- 防火墙或网络限制阻止 Cloudflare。
- 检查 Destination Availability(目标可用性) 是否有下降。
- 确认目标凭据和端点正常运行时间。
- 审查允许列表或网络访问设置。

理解重试行为

Logpush 通过自动重试来处理目标的临时问题。当目标暂时不可用时,Logpush 大约会在五分钟内重试约五次。但是,如果 Cloudflare 持续从目标收到错误,且无法跟上传入的批次,Logpush 最终会丢弃日志。

如果错误持续较长时间,Logpush 会假定目标永久不可用,并禁用您的推送作业。目标问题解决后,您可以重新启用该作业。

要监控重试行为和目标可用性,请使用运行状况仪表板指标,特别是 Retry Attempts(重试次数)Destination Availability(目标可用性) 图表。

这篇文档对您有帮助吗?