跳转到内容
搜索文档

发现收费内容

最后更新 查看 MarkdownAgent 设置
graph LR
A[设置您的<br>Cloudflare 账户] --> B[验证您的<br>AI 爬虫]
B --> C[发现<br>收费内容]:::highlight
C --> D[连接至<br>Stripe]
D --> E[爬取页面]
classDef highlight fill:#F6821F,color:white

单次爬网付费发现 API (Pay Per Crawl Discovery API) 允许已验证的 AI 爬虫发现哪些域名提供了付费内容访问。这使您的爬虫能够在发出爬网请求之前,主动识别参与单次爬网付费的网站。

先决条件

在开始使用单次爬网付费发现 API 之前,您必须:

使用 Web Bot Auth 进行身份验证

所有对发现 API (Discovery API) 的请求都必须使用带有 Web Bot Auth 标头的 HTTP 消息签名进行身份验证。这可以确保只有已验证的爬虫才能访问参与该计划的域名列表。

  1. 按照 对您的请求进行签名 中的步骤生成您的 Web Bot Auth 签名。

  2. 按照 构造必需的标头 中所述构造必需的标头:

    • Signature:请求的加密签名
    • Signature-Input:签名元数据和参数
    • Signature-Agent:关于签名代理的信息

发现参与的域名

API 端点

GET https://crawlers-api.ai-audit.cfdata.org/charged_zones

请求参数

  • cursor(可选):从上一次分页调用中返回的游标
  • limit(可选):每次请求返回的结果数量

请求标头

包含使用 Web Bot Auth 生成的 HTTP 消息签名标头:

Signature: <your-signature>
Signature-Input: <signature-metadata>
Signature-Agent: <agent-information>

请求示例

curl -X GET "https://crawlers-api.ai-audit.cfdata.org/charged_zones?limit=50" \
  -H "Signature: <your-signature>" \
  -H "Signature-Input: <signature-metadata>" \
  -H "Signature-Agent: <agent-information>"

响应格式

API 会返回一个已启用单次爬网付费并接受您的爬虫付款的区域(域名)列表。

{
	"result": {
		"zones": [
			{
				"domain": "example.com"
			},
			{
				"domain": "news-site.com"
			}
		]
	},
	"success": true,
	"errors": [],
	"messages": []
}

响应字段

  • result.zones:包含已启用单次爬网付费的域名的区域对象数组
  • result.zones[].domain:提供单次爬网付费内容的域名
  • success:指示请求是否成功的布尔值
  • errors:错误消息数组(如果成功则为空)
  • messages:参考信息消息数组

使用发现数据

发现 API (Discovery API) 返回的域名是网站所有者专门配置您的爬虫访问其内容需要收费的域名。如果响应中未出现某个域名,则表示该网站所有者没有为您的爬虫启用单次爬网付费。网站所有者也可能通过 WAF 规则或在其 robots.txt 文件中设置指令来阻止或允许您的爬虫,您应该对此进行检查并予以遵守。

在本地缓存发现结果并定期刷新,以保持与加入或退出单次爬网付费的域名同步更新。

附加资源

这篇文档对您有帮助吗?