跳转到内容
搜索文档

控制 AI 如何爬取您的文档

最后更新 查看 MarkdownAgent 设置

允许 AI 爬虫爬取您的文档可以使用户能够从其首选的 AI 工具中提取有用的信息。例如,它使用户能够向 ChatGPT 或 Gemini 等工具提问有关您文档的问题,而不是阅读整个页面。然而,控制 AI 爬虫如何与您的网站进行交互以获得最佳结果至关重要。

指导 AI 爬虫爬取正确的页面

您首先应该考虑希望 AI 爬虫爬取哪些页面。您可能希望 AI 爬虫访问您的大部分页面,但可能会有一些例外。

使用 robots.txt 控制 AI 爬虫

您可以使用 robots.txt 文件来控制 AI 爬虫可以访问哪些页面。这是一个简单的文本文件,用于指导爬虫遵循某些规则。爬虫并非必须强制遵守这些规则,但由 Google 和 OpenAI 等大公司运营的许多爬虫都会遵守 robots.txt 文件。有关更多信息,请参阅 robots.txt 设置

例如,您可以将以下内容添加到您的 robots.txt 文件中,以阻止 AI 爬虫访问位于 /docs-site/product-a/ 的名为“Product A”的 Beta 产品:

/docs-site/robots.txt/txt
User-agent: *
Disallow: `/product-a/`

通过在 robots.txt 文件中指定显式的禁止条件,您可以允许访问大部分页面,仅保留少数例外情况。

请参阅 https://developers.cloudflare.com/robots.txt 作为示例。

使用安全控制来完全阻止访问

有时,您可能希望完全阻止爬虫访问某个页面。您不能仅仅依赖 robots.txt 来阻止访问,因为爬虫并非被强制要求遵守 robots.txt 文件。

为了确保完全阻止,您可以使用安全控制,例如 Cloudflare 的 AI Crawl Control机器人解决方案或其他一些安全工具。

案例研究:GitHub 预览网站

Cloudflare 的开发者文档公开托管在 cloudflare-docs GitHub 仓库中。每次创建 Git 拉取请求(pull request)时,我们都会生成一个临时预览网站,用于直观检查文档在合并到生产环境时的外观。由于这些预览网站是由正在评审的拉取请求生成的,因此它们有时包含不完整的信息。

在 2025 年 11 月,通过使用 AI Crawl Control,我们发现高达 80% 的 AI 爬取都在访问我们的预览网站,而不是我们的主网站。这意味着 AI 爬虫极易返回不准确的信息,这看起来可能像是幻觉。

在发现这一情况后,我们最初在预览网站上实施了 robots.txt 以禁止访问。这使这些网站上的爬取比例从 80% 降至 20%。

为了进一步减少爬虫访问不完整信息,我们迅速实施了一条安全规则,以完全阻止对我们预览网站的所有访问,从而将预览网站上的爬取比例从 20% 降至 0%(安全规则完全阻止了对我们预览网站的访问)。

这一改变可能显著提高了返回给用户的信息准确性,改善了他们的文档体验。

本案例研究强调了了解和控制 AI 爬虫如何与我们的文档网站进行交互的重要性,因为文档是影响 AI 准确性、相关性和客户体验的真实信源(即使它是通过第三方应用程序,如 ChatGPT、Gemini 或 Claude 进行的)。

行动要点

  • 确定您希望 AI 爬虫访问的页面。
  • 如果您希望引导 AI 爬虫,请使用 robots.txt 来指导 AI 爬虫。
  • 如果您希望完全阻止 AI 爬虫访问某些页面,请使用安全控制,例如 Cloudflare 的 AI Crawl Control机器人解决方案或其他安全工具来完全阻止对某些页面的访问。
  • 如果您的文档网站生成预览网站,请确保 AI 爬虫不会访问这些网站,以改善最终用户的体验。

这篇文档对您有帮助吗?