跳转到内容
搜索文档

管理 AI 爬虫

最后更新 查看 MarkdownAgent 设置

AI Crawl Control 允许您对每个 AI 爬虫采取特定的操作。

要管理 AI 爬虫:

  1. 登录 Cloudflare 仪表板,然后选择您的账户和域名。

  2. 前往 AI Crawl Control(AI 爬网控制)

    Go to AI Crawl Control ↗
  3. 前往 **Crawlers(爬虫)**选项卡。

审查 AI 爬虫活动

**Crawlers(爬虫)**选项卡中显示了请求访问您的内容以及它们如何与您的页面进行互动的 AI 爬虫表格。该表格提供了以下信息。

列名 详细信息
Crawler(爬虫) AI 爬虫的名称及其所有者(运营商)。
Category(类别) AI 爬虫的类别。请参阅已验证的 Bot 类别
Requests(请求数) 允许的和不成功的请求总数,并附有趋势图。不成功的请求可能来自任何规则或响应错误,而不仅仅是 AI Crawl Control 中的阻止操作。
Robots.txt 违规 该 AI 爬虫违反您 robots.txt 文件的次数。
Action(操作) 您希望对该 AI 爬虫采取的操作。请参阅为每个 AI 爬虫采取操作

筛选 AI 爬虫数据

您可以使用筛选器来缩小结果范围:

  • Name(名称):搜索 AI 爬虫的名称。
  • Operator(运营商):按 AI 爬虫运营商进行筛选。
  • Category(类别):按 AI 爬虫的类别(例如,AI 爬虫、AI 助手或归档器)进行筛选。

表格中的值将根据您的筛选器进行更新。

为每个 AI 爬虫采取操作

对于每个 AI 爬虫,您可以选择允许或阻止访问。

允许访问

  • 摘要: 您可以允许 AI 爬虫抓取您的内容。
  • 适用场景: 允许那些通过引用、引流或现有协议提供价值的 AI 爬虫。
  • 执行方式: 在 **Action(操作)**列中,选择 Allow(允许)

请注意,您仍可选择强制执行 robots.txt

阻止访问

  • 摘要: 您可以阻止 AI 爬虫,以完全阻止该 AI 爬虫抓取您的网页。
  • 适用场景: 当 AI 爬虫的行为与您的内容策略不符或违反了您的政策时,将其阻止。
  • 执行方式: 在 **Action(操作)**列中,选择 Block(阻止)

请注意,您可以配置阻止 AI 爬虫时返回的响应。请参阅配置阻止响应

对于每个 AI 爬虫,您可以采取三种操作之一:允许、收费或阻止。

允许访问

  • 摘要: 您可以允许 AI 爬虫抓取您的内容。
  • 适用场景: 允许那些通过引用、引流或现有协议提供价值的 AI 爬虫。
  • 执行方式: 在 **Action(操作)**列中,选择 Allow(允许)。 请注意,您仍可选择强制执行 robots.txt

有关 Cloudflare 如何对 AI Bot 流量进行分类的详细信息,请参阅 AI Bot

阻止访问

  • 摘要: 您可以阻止 AI 爬虫,以完全阻止该 AI 爬虫抓取您的网页。
  • 适用场景: 当 AI 爬虫的行为与您的内容策略不符或违反了您的政策时,将其阻止。
  • 执行方式: 在 **Action(操作)**列中,选择 Block(阻止)

请注意,您可以配置阻止 AI 爬虫时返回的响应。请参阅配置阻止响应

单次爬取收费(私有测试版)

  • 摘要: 您可以为每一次成功的爬取请求,向该 AI 爬虫的所有者收费。
  • 适用场景: 当您的内容具有训练价值,并且您想探索变现选项时,对 AI 爬虫进行收费。
  • 执行方式: 在 **Action(操作)**列中,选择 Charge(收费)

有关详细信息,请参阅什么是单次爬网付费?

WAF 规则管理

当您在 AI Crawl Control 中阻止爬虫时,系统会在您的区域上创建或更新一条 WAF 自定义规则来执行该阻止。对于更高级的场景(例如添加基于路径的例外或额外的 User Agent),您可以直接在 WAF 中扩展此规则。

有关详细信息,请参阅 AI Crawl Control 与 Cloudflare WAF

配置阻止响应

Available on Paid plans

阻止 AI 爬虫时,您可以配置返回给该 AI 爬虫的响应细节。具体来说,您可以配置:

  • 响应状态码
  • 响应正文

这为您提供了与 AI 爬虫所有者开启对话的渠道,并通知 AI 爬虫如何对其内容进行适当的许可授权,从而创建一条从爬取尝试直接通往商业协议的路径。

要编辑这些值:

  1. 登录 Cloudflare 仪表板,然后选择您的账户和域名。

  2. 前往 AI Crawl Control(AI 爬网控制)

    Go to AI Crawl Control ↗
  3. 前往 **Settings(设置)**选项卡。

  4. 在 **Block response(阻止响应)**下,选择 Edit(编辑)

  5. 编辑好这些值后,选择 Save(保存)

编辑响应状态码

您可以选择在阻止 AI 爬虫时返回哪种 HTTP 响应状态码。

使用下拉菜单选择所需的响应码。您可以选择:

  • 403 Forbidden:如果您想表明您不希望该 AI 爬虫访问您的内容,请使用此选项。
  • 402 Payment Required:如果您想表明该 AI 爬虫必须付费才能访问您的内容,请使用此选项。

编辑响应正文

您可以编写一条自定义消息(HTTP 响应正文),在阻止 AI 爬虫时将其返回。

在 **Response body(响应正文)**文本框中,以纯文本形式输入您希望为 AI 爬虫显示的响应。

相关资源

这篇文档对您有帮助吗?