Cloudflare Pipelines 可接入事件、使用 SQL 进行转换,并以 Iceberg 表或 Parquet 与 JSON 文件的形式投递到 R2。Logpush 可将数据写入 Pipelines,作为原生目标。
Logpush 无需将原始日志以 JSON 形式直接发送到存储桶,而是可以将其路由到 Pipeline,以筛选、丰富并转换数据,成为由 R2 Data Catalog 管理的 Parquet 或 Apache Iceberg 表。这样数据更紧凑,也更适合分析,例如使用 R2 SQL 进行查询。
Pipelines 目标支持以下 Logpush 数据集:
| 范围 | 数据集 |
|---|---|
| Zone | http_requests、firewall_events、dns_logs |
| 账户 | workers_trace_events |
有关每个数据集中可用字段的完整列表,请参阅 数据集。
- 在 Cloudflare 仪表板中,前往账户或域名(也称为 zone)级别的 Logpush(日志推送) 页面。
- 账户级别: Go to Logpush ↗
- 域名(也称为 zone)级别: Go to Logpush ↗
- 选择 Create a Logpush job(创建 Logpush 作业)。
- 将目标选择为 Pipelines。
- 在 Dataset(数据集) 步骤中,从下拉菜单选择数据集。
- Pipeline 名称会自动生成,但你可以编辑。
- 在 Destination(目标) 步骤中,配置目标:
- 选择现有 R2 存储桶,或输入新名称以便在设置过程中创建。
- 选择存储格式:Parquet、JSON 或 R2 Data Catalog (Apache Iceberg)。
- 如果选择 R2 Data Catalog,请输入 catalog 命名空间和表名。
- 可选:展开 Delivery settings(投递设置),配置 roll size、roll interval 及其他特定于目标的设置。有关这些设置的更多信息,请参阅 Pipelines Sinks 文档。
- 在 Transform(转换) 步骤中,选择在日志写入 Sink 之前如何处理:
- Simple(简单) 转发所有字段且不做修改(默认)。
- Custom SQL(自定义 SQL) 打开 SQL 编辑器,可筛选、转换并丰富数据。请参阅 Pipelines SQL 参考,了解完整的 SQL 函数列表。
- 在 Review(审核) 步骤中,核实配置并选择 Create(创建)。这会自动创建所有必需资源,包括 Stream、Sink、R2 凭据或 Data Catalog token、Pipeline 以及 Logpush 作业。