没有不值得去解决的问题,也没有不值得去学习的技术!

Cloudflare AI 爬虫新策略配置:保留 Google/AI 搜索,禁止内容用于模型训练

【图 5:Training 修改为 Disallow 后的最终配置】

作者:

2026 年 9 月 16 日,我收到了一封来自 Cloudflare 的邮件,标题是:

Updates to managing AI crawlers on your account

Cloudflare 正在调整网站管理员对 AI 爬虫的控制方式。原来相对笼统的 Block AI Bots,正在逐步迁移到更细粒度的三类策略:

  • Search
  • Agent
  • Training

其中最值得注意的是,Cloudflare 在 2026 年 9 月 15 日推出了新的 Disallow AI Training 设置。

它解决了一个比较现实的问题:

如果我不希望网站内容被用于 AI 模型训练,是否一定要连 Google、Bing 等正常搜索引擎一起阻止?

现在答案是不需要。

Cloudflare 新的控制方式允许网站继续被搜索引擎发现,同时声明内容不得用于 AI Training。Cloudflare 也明确表示,新的 BlockBlock on pages with ads 会覆盖同时承担搜索与训练用途的 mixed-use crawler,例如 Applebot、Bingbot 和 Googlebot;如果目标是“继续搜索收录,但不允许 AI 训练”,应该使用新的 Disallow AI Training。(Cloudflare Blog)

这篇文章记录一下我的实际配置过程。

一、Cloudflare 的 AI 爬虫控制发生了什么变化

Cloudflare 现在把 AI 相关自动程序按照实际行为划分成三类:

Search

用于抓取和索引网站内容,以便以后在搜索结果或问答结果中使用。

Agent

代表真实用户实时访问网站,例如 ChatGPT、Claude 等 AI 工具根据用户请求打开网页,或者 Browser Agent 执行网页操作。

Training

抓取网站内容用于模型训练或微调。

Cloudflare 官方特别说明,一个 Bot 可以拥有不止一种行为,因此不能简单地把所有“AI Bot”都视为相同用途。(Cloudflare Docs)

这也是新的控制方式比过去单纯的“Block AI Bots”更合理的地方。

【图 1:Cloudflare 安全性设置中的 AI 自动程序策略入口】
【图 1:Cloudflare 安全性设置中的 AI 自动程序策略入口】

二、AI Crawl Control 已经能够看到实际 AI 爬虫访问

Cloudflare 现在提供了独立的:

AI Crawl Control

在:

Cloudflare → AI Crawl Control → 概述

可以看到哪些 AI 服务正在访问网站。

我的站点上已经可以观察到包括:

  • Microsoft / BingBot
  • Google / Googlebot
  • Apple / Applebot
  • Perplexity
  • Anthropic
  • OpenAI
  • Baidu
  • DuckDuckGo
  • Mistral
  • Meta

等不同来源的爬虫。

Cloudflare 的 AI Crawl Control 不只是用来阻止 crawler,它也可以作为一个很直观的 AI crawler 流量观察工具。

官方文档也说明,它可以用于查看 crawler 活动、控制单独的 AI crawler、检查 robots.txt 遵守情况等。(Cloudflare Docs)

【图 2:AI Crawl Control 概览中的 AI 爬虫访问情况】
【图 2:AI Crawl Control 概览中的 AI 爬虫访问情况】

三、原来的设置是 Search、Agent、Training 全部允许

进入:

安全性 → 设置 → 配置 AI 自动程序策略

可以看到三个独立选项。

我检查时的初始状态是:

Plaintext
搜索:允许(不阻止)
代理:允许(不阻止)
训练:允许(不阻止)

同时:

Plaintext
Enable Bot Preference Sync:开启

也就是说,此时搜索、AI Agent 和模型训练三类用途全部允许。

【图 3:修改前 Search、Agent、Training 均为允许】
【图 3:修改前 Search、Agent、Training 均为允许】

如果从最大程度开放网站内容的角度看,这当然没有问题。

但我更希望实现的是:

搜索可以正常收录;AI 搜索和 AI Agent 可以发现、读取网站;但没有必要允许纯模型训练 crawler 大规模抓取内容。

因此我决定只修改 Training。

四、Training 不应该直接选择“阻止”

打开 Training 下拉菜单后,目前可以看到几个不同选项:

Plaintext
阻止
在有广告的页面上阻止
Disallow
允许(不阻止)

这里非常容易误解。

如果目标只是“不允许 AI Training”,不要简单地选择:

阻止

Cloudflare 从 2026 年 9 月 15 日开始改变了这部分行为。

对于同时承担 Search 和 Training 功能的 mixed-use crawler,例如:

  • Googlebot
  • Bingbot
  • Applebot

选择 BlockBlock on pages with ads 后,可能连它们的搜索访问一起阻止。

Cloudflare 官方对此说得很明确:如果仍然希望网站保持在搜索结果中,同时拒绝 AI Training,应使用 Disallow AI Training。(Cloudflare Blog)

【图 4:Training 策略中的 Block、广告页面 Block、Disallow 和 Allow】
【图 4:Training 策略中的 Block、广告页面 Block、Disallow 和 Allow】

五、我的最终配置:Search Allow + Agent Allow + Training Disallow

最终我采用:

Plaintext
Search:允许(不阻止)
Agent:允许(不阻止)
Training:Disallow
Bot Preference Sync:开启
【图 5:Training 修改为 Disallow 后的最终配置】
【图 5:Training 修改为 Disallow 后的最终配置】

为什么这样设置?

Search 保持 Allow

这一项没有什么争议。

我的网站仍然需要 Google、Bing、Apple 等正常搜索入口,因此没有必要为了限制 AI Training 牺牲传统搜索收录。

Agent 也保持 Allow

这一点是我结合自己的站点情况作出的选择。

Agent 指的是代表用户实时访问网站的 AI 自动程序。

例如有人向 AI 提问,然后 AI 为了回答这个问题实时打开我的网页。

对于内容网站而言,这类访问有可能带来:

  • AI 搜索曝光;
  • 来源引用;
  • 页面链接;
  • 潜在真实用户访问。

因此现阶段我并不准备阻止 AI Agent。

Training 使用 Disallow

这一项则不同。

纯训练 crawler 抓取页面,并不会直接给网站带来搜索展示或者用户访问。

因此我选择:

Disallow AI Training

Cloudflare API 里也把 Training 的几种模式明确区分为:

Plaintext
disabled
disallow
block
only_on_ad_pages

说明 disallow 本身就是一个独立于技术性 block 的配置状态。(Cloudflare Docs)

六、Bot Preference Sync 继续保持开启

我的 Enable Bot Preference Sync 原来已经处于开启状态,因此继续保持。

它会根据当前配置生成对应的 crawler preference,并加入 Cloudflare 提供的 robots.txt 内容。

需要注意的是:

robots.txt 本身只是表达网站所有者的偏好,并不能在网络层强制所有 crawler 遵守。

Cloudflare 官方也明确说明,robots.txt 的遵守属于自愿行为;如果真正需要强制阻止 crawler,还需要使用 AI Crawl Control 等技术控制。(Cloudflare Docs)

所以:

Bot Preference Sync 和 AI Crawl Control 并不是完全相同的东西。

一个更多用于表达策略,一个可以真正执行访问控制。

七、修改之后,再看 AI Crawl Control 就很有意思了

完成设置后,我重新进入:

AI Crawl Control → 安全性

可以明显看到 crawler 被分成了两组。

一些搜索、搜索增强和用户实时访问 crawler 仍然没有被阻止,例如:

Plaintext
BingBot
Googlebot
Applebot
PerplexityBot
Claude-SearchBot
OAI-SearchBot
ChatGPT-User
DuckAssistBot
MistralAI-User
Perplexity-User

与此同时,一些 AI Crawler 已经显示为阻止,例如:

Plaintext
ClaudeBot
GPTBot
Bytespider
Amazonbot
CCBot
【图 6:Training 设置为 Disallow 后 AI Crawl Control 中的 crawler 状态】
【图 6:Training 设置为 Disallow 后 AI Crawl Control 中的 crawler 状态】

这基本达到了我想要的结果:

搜索入口继续存在。

ChatGPT 等用户实时访问入口继续存在。

AI 搜索 crawler 继续存在。

纯 Training crawler 则受到限制。

与以前“AI Bot 要么全部放行、要么全部阻止”相比,这样明显更合理。

八、一个有意思的例外:Claude-User

检查过程中还发现了一个比较有意思的现象。

Claude-User 在当前 Cloudflare Dashboard 中显示为:

Plaintext
Claude-User
Anthropic
AI Crawler

并且它处于被阻止状态。

我原本想直接把这个 crawler 单独改为允许,但是 Cloudflare 并不允许直接修改。

鼠标放到对应开关后,会出现提示:

This crawler is being blocked by an existing AI bot policy.
Configure AI bot policies.

【图 7:Claude-User 被全局 AI Bot Policy 阻止,无法单独关闭】
【图 7:Claude-User 被全局 AI Bot Policy 阻止,无法单独关闭】

也就是说,这个状态来自前面的全局 AI 自动程序策略,而不是 AI Crawl Control 中单独设置的 crawler rule。

有趣的是,Cloudflare 当前文档对 AI bot 的分类强调的是“行为”,并明确说明同一个 Bot 可以拥有多种行为。(Cloudflare Docs)

因此我没有为了单独放行 Claude-User,重新把整个 Training 改回 Allow。

因为那样会同时重新放行很多真正用于模型训练的 crawler,代价明显更大。

而且目前:

Plaintext
Claude-SearchBot

仍然正常允许。

因此 Claude 的搜索发现入口并没有一起消失。

考虑到这套新 AI crawler policy 正是在 2026 年 9 月 15 日开始调整,而且 Dashboard 和策略仍处于 rollout 阶段,这个细节后续还有必要继续观察。

九、AI Crawl Control 不需要再逐个手工配置

完成这一轮设置后,我没有继续在 AI Crawl Control 中为几十个 crawler 单独创建规则。

原因是 Cloudflare 的全局 AI Bot Policy 本身会持续更新对应的 Bot 分类和处理方式。

官方文档也建议优先使用内置 Bot 设置处理标准场景;相比手工 WAF 规则,这些托管设置会随着 Cloudflare 识别新的 crawler 而更新。(Cloudflare Docs)

因此现在我的思路是:

Plaintext
全局策略:

Search   → Allow
Agent    → Allow
Training → Disallow

然后:

Plaintext
AI Crawl Control → 主要用于观察

只有以后发现某一个 crawler 明显存在问题,才考虑单独 Block。

这样配置更简单,也不容易由于规则越来越多而产生意外冲突。

十、这次 Cloudflare 更新真正解决的问题

我觉得 Cloudflare 这次变化最有价值的地方,并不是“又增加了几个 AI Bot 开关”。

真正解决的是:

网站管理员终于可以把搜索发现、AI Agent 和 AI 模型训练区分开来。

过去简单地阻止 AI Bot,很容易进入一个两难:

Plaintext
不阻止:
内容可能被用于 AI Training。

阻止:
又可能损失 Google、Bing 或 AI Search 的发现能力。

现在可以更细地设置:

Plaintext
搜索:允许
AI Agent:允许
模型训练:拒绝

对于依赖公开内容、SEO 和搜索发现的网站,我认为这种控制方式明显更实用。

至少对我自己的站点而言,目前选择的是:

尽可能保持内容可发现,但没有必要无条件允许内容被用于模型训练。

这应该也会成为我接下来一段时间观察 AI crawler 流量时的默认策略。


参考资料

Cloudflare 官方于 2026 年 9 月 15 日发布了关于 mixed-use AI crawler 和 Disallow AI Training 的说明,并明确介绍了 Search、Agent、Training 三类控制以及旧设置的迁移方式。(Cloudflare Blog)

Cloudflare AI Crawl Control 官方文档则介绍了 crawler 监控、单独 Allow/Block、robots.txt compliance 以及与 WAF/Bot Management 的关系。(Cloudflare Docs)

Linux 服务器运维、部署与线上故障排查

如果你的网站或后端服务部署在 Linux 服务器上,遇到访问异常、Nginx 配置问题、MySQL / Redis 异常、Docker 服务不可用、磁盘占满、CPU / 内存过高等问题,可以联系我做一次远程排查。

适合以下场景:
✅ 网站打不开或访问不稳定
✅ Nginx / PHP-FPM 配置异常
✅ MySQL / Redis 性能或连接问题
✅ Docker 服务部署与维护
✅ 服务器迁移与环境配置
✅ CPU / 内存 / 磁盘异常排查

服务内容:
✅ Linux 环境检查
✅ 网站部署与迁移
✅ Nginx / PHP-FPM / MySQL / Redis 排查
✅ Docker 配置与维护
✅ 服务器性能分析
✅ 长期远程运维支持

如需咨询,请联系我,并注明:Linux 运维咨询

联系方式:
Telegram:@shuijingwan
微信:13980074657
邮箱:shuijingwanwq@gmail.com