启用带 Internet Archive 集成的 Always Online 时,请遵循以下最佳实践。
- 允许来自 Internet Archive IP 地址的请求。 源站服务器会收到来自 Internet Archive IP 的请求。请确保未阻止来自 Internet Archive IP 范围的请求:
207.241.224.0/20和208.70.24.0/21。 - Internet Archive 不考虑源站服务器的 cache-control 标头。 Internet Archive 爬取网站时,无论 cache-control 如何都会爬取,因为 Internet Archive 不会缓存资源,而是归档它们。
- 考虑与转换 URI 的 Cloudflare 功能可能产生的冲突。 由于 Internet Archive 爬取页面进行归档的方式,带 Internet Archive 集成的 Always Online 可能与 Cache Rules 和其他转换 URI 的 Cloudflare 功能产生问题。具体来说,在边缘发生的一些重定向可能导致 Internet Archive 爬虫无法归档目标 URL。启用 Origin Cache Control 之前,请查看 Cloudflare 默认如何缓存资源以及您配置的任何 Cache Rules,以避免这些问题。如果遇到问题,请禁用 Always Online。
- 不要通过 WAF 自定义规则阻止 Known Bots 或 Verified Bots。 如果阻止这些 bot 列表,Internet Archive 将无法爬取。
请勿将 Always Online 用于:
- API 流量。
- 阻止美国或的 IP Access rule 或 WAF custom rule
- Bypass Cache cache rules。Always Online 忽略 Bypass Cache cache rules 并提供 Always Online 缓存资源。
Always Online 功能存在以下限制:
- 对于最近添加的网站,Always Online 不会立即生效,原因包括:
- DNS 记录传播可能需要 24-72 小时
- Always Online 尚未初始爬取网站
- 如果源站 Web 服务器离线,Cloudflare 无法显示登录后的私有内容或处理表单提交 (POSTs)。
Always Online 不会针对 404、503 或 500 等 HTTP 响应码触发,例如数据库连接错误或内部服务器错误。这是因为这些状态码表示源站可达且正在响应——Always Online 仅在 Cloudflare 完全无法连接到源站时激活(产生 Cloudflare 生成的 520–527 状态码)。如果源站返回 5xx 错误,按定义源站在线,Always Online 不会介入。
-
如何知道页面是否已被爬取?
- 您可以访问 Internet Archive ↗ 并搜索页面 URL,查看是否已被爬取。
- 您也可以通过 Internet Archive Availability API ↗ 检查。
-
为什么页面 x、y 和 z 未被爬取?
- 由于 Cloudflare 仅请求爬取网站上最受欢迎的页面,可能会有缺失页面。如果您确实想归档某个页面,可以访问 Internet Archive ↗ save page 并要求他们爬取特定页面。
-
我们需要 allowlist 哪些 IP 地址以确保爬取正常工作?
- IP 范围:
207.241.224.0/20和208.70.24.0/21。请注意,此 IP 范围属于 Internet Archive 而非 Cloudflare,因为是 Internet Archive 执行爬取。
- IP 范围:
-
源站应预期看到什么 user agent?
- 目前 Internet Archive 使用:
Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/605.1.15 (KHTML, like Gecko) Chrome/89.0.4389.82 Safari/605.1.15。
- 目前 Internet Archive 使用: