2026 年 9 月 16 日,我收到了一封来自 Cloudflare 的邮件,标题是:
Updates to managing AI crawlers on your account
Cloudflare 正在调整网站管理员对 AI 爬虫的控制方式。原来相对笼统的 Block AI Bots,正在逐步迁移到更细粒度的三类策略:
- Search
- Agent
- Training
其中最值得注意的是,Cloudflare 在 2026 年 9 月 15 日推出了新的 Disallow AI Training 设置。
它解决了一个比较现实的问题:
如果我不希望网站内容被用于 AI 模型训练,是否一定要连 Google、Bing 等正常搜索引擎一起阻止?
现在答案是不需要。
Cloudflare 新的控制方式允许网站继续被搜索引擎发现,同时声明内容不得用于 AI Training。Cloudflare 也明确表示,新的 Block 和 Block on pages with ads 会覆盖同时承担搜索与训练用途的 mixed-use crawler,例如 Applebot、Bingbot 和 Googlebot;如果目标是“继续搜索收录,但不允许 AI 训练”,应该使用新的 Disallow AI Training。(Cloudflare Blog)
这篇文章记录一下我的实际配置过程。
一、Cloudflare 的 AI 爬虫控制发生了什么变化
Cloudflare 现在把 AI 相关自动程序按照实际行为划分成三类:
Search
用于抓取和索引网站内容,以便以后在搜索结果或问答结果中使用。
Agent
代表真实用户实时访问网站,例如 ChatGPT、Claude 等 AI 工具根据用户请求打开网页,或者 Browser Agent 执行网页操作。
Training
抓取网站内容用于模型训练或微调。
Cloudflare 官方特别说明,一个 Bot 可以拥有不止一种行为,因此不能简单地把所有“AI Bot”都视为相同用途。(Cloudflare Docs)
这也是新的控制方式比过去单纯的“Block AI Bots”更合理的地方。

二、AI Crawl Control 已经能够看到实际 AI 爬虫访问
Cloudflare 现在提供了独立的:
AI Crawl Control
在:
Cloudflare → AI Crawl Control → 概述
可以看到哪些 AI 服务正在访问网站。
我的站点上已经可以观察到包括:
- Microsoft / BingBot
- Google / Googlebot
- Apple / Applebot
- Perplexity
- Anthropic
- OpenAI
- Baidu
- DuckDuckGo
- Mistral
- Meta
等不同来源的爬虫。
Cloudflare 的 AI Crawl Control 不只是用来阻止 crawler,它也可以作为一个很直观的 AI crawler 流量观察工具。
官方文档也说明,它可以用于查看 crawler 活动、控制单独的 AI crawler、检查 robots.txt 遵守情况等。(Cloudflare Docs)

三、原来的设置是 Search、Agent、Training 全部允许
进入:
安全性 → 设置 → 配置 AI 自动程序策略
可以看到三个独立选项。
我检查时的初始状态是:
搜索:允许(不阻止)
代理:允许(不阻止)
训练:允许(不阻止)同时:
Enable Bot Preference Sync:开启也就是说,此时搜索、AI Agent 和模型训练三类用途全部允许。

如果从最大程度开放网站内容的角度看,这当然没有问题。
但我更希望实现的是:
搜索可以正常收录;AI 搜索和 AI Agent 可以发现、读取网站;但没有必要允许纯模型训练 crawler 大规模抓取内容。
因此我决定只修改 Training。
四、Training 不应该直接选择“阻止”
打开 Training 下拉菜单后,目前可以看到几个不同选项:
阻止
在有广告的页面上阻止
Disallow
允许(不阻止)这里非常容易误解。
如果目标只是“不允许 AI Training”,不要简单地选择:
阻止
Cloudflare 从 2026 年 9 月 15 日开始改变了这部分行为。
对于同时承担 Search 和 Training 功能的 mixed-use crawler,例如:
- Googlebot
- Bingbot
- Applebot
选择 Block 或 Block on pages with ads 后,可能连它们的搜索访问一起阻止。
Cloudflare 官方对此说得很明确:如果仍然希望网站保持在搜索结果中,同时拒绝 AI Training,应使用 Disallow AI Training。(Cloudflare Blog)

五、我的最终配置:Search Allow + Agent Allow + Training Disallow
最终我采用:
Search:允许(不阻止)
Agent:允许(不阻止)
Training:Disallow
Bot Preference Sync:开启
为什么这样设置?
Search 保持 Allow
这一项没有什么争议。
我的网站仍然需要 Google、Bing、Apple 等正常搜索入口,因此没有必要为了限制 AI Training 牺牲传统搜索收录。
Agent 也保持 Allow
这一点是我结合自己的站点情况作出的选择。
Agent 指的是代表用户实时访问网站的 AI 自动程序。
例如有人向 AI 提问,然后 AI 为了回答这个问题实时打开我的网页。
对于内容网站而言,这类访问有可能带来:
- AI 搜索曝光;
- 来源引用;
- 页面链接;
- 潜在真实用户访问。
因此现阶段我并不准备阻止 AI Agent。
Training 使用 Disallow
这一项则不同。
纯训练 crawler 抓取页面,并不会直接给网站带来搜索展示或者用户访问。
因此我选择:
Disallow AI Training
Cloudflare API 里也把 Training 的几种模式明确区分为:
disabled
disallow
block
only_on_ad_pages说明 disallow 本身就是一个独立于技术性 block 的配置状态。(Cloudflare Docs)
六、Bot Preference Sync 继续保持开启
我的 Enable Bot Preference Sync 原来已经处于开启状态,因此继续保持。
它会根据当前配置生成对应的 crawler preference,并加入 Cloudflare 提供的 robots.txt 内容。
需要注意的是:
robots.txt 本身只是表达网站所有者的偏好,并不能在网络层强制所有 crawler 遵守。
Cloudflare 官方也明确说明,robots.txt 的遵守属于自愿行为;如果真正需要强制阻止 crawler,还需要使用 AI Crawl Control 等技术控制。(Cloudflare Docs)
所以:
Bot Preference Sync 和 AI Crawl Control 并不是完全相同的东西。
一个更多用于表达策略,一个可以真正执行访问控制。
七、修改之后,再看 AI Crawl Control 就很有意思了
完成设置后,我重新进入:
AI Crawl Control → 安全性
可以明显看到 crawler 被分成了两组。
一些搜索、搜索增强和用户实时访问 crawler 仍然没有被阻止,例如:
BingBot
Googlebot
Applebot
PerplexityBot
Claude-SearchBot
OAI-SearchBot
ChatGPT-User
DuckAssistBot
MistralAI-User
Perplexity-User与此同时,一些 AI Crawler 已经显示为阻止,例如:
ClaudeBot
GPTBot
Bytespider
Amazonbot
CCBot
这基本达到了我想要的结果:
搜索入口继续存在。
ChatGPT 等用户实时访问入口继续存在。
AI 搜索 crawler 继续存在。
纯 Training crawler 则受到限制。
与以前“AI Bot 要么全部放行、要么全部阻止”相比,这样明显更合理。
八、一个有意思的例外:Claude-User
检查过程中还发现了一个比较有意思的现象。
Claude-User 在当前 Cloudflare Dashboard 中显示为:
Claude-User
Anthropic
AI Crawler并且它处于被阻止状态。
我原本想直接把这个 crawler 单独改为允许,但是 Cloudflare 并不允许直接修改。
鼠标放到对应开关后,会出现提示:
This crawler is being blocked by an existing AI bot policy.
Configure AI bot policies.

也就是说,这个状态来自前面的全局 AI 自动程序策略,而不是 AI Crawl Control 中单独设置的 crawler rule。
有趣的是,Cloudflare 当前文档对 AI bot 的分类强调的是“行为”,并明确说明同一个 Bot 可以拥有多种行为。(Cloudflare Docs)
因此我没有为了单独放行 Claude-User,重新把整个 Training 改回 Allow。
因为那样会同时重新放行很多真正用于模型训练的 crawler,代价明显更大。
而且目前:
Claude-SearchBot仍然正常允许。
因此 Claude 的搜索发现入口并没有一起消失。
考虑到这套新 AI crawler policy 正是在 2026 年 9 月 15 日开始调整,而且 Dashboard 和策略仍处于 rollout 阶段,这个细节后续还有必要继续观察。
九、AI Crawl Control 不需要再逐个手工配置
完成这一轮设置后,我没有继续在 AI Crawl Control 中为几十个 crawler 单独创建规则。
原因是 Cloudflare 的全局 AI Bot Policy 本身会持续更新对应的 Bot 分类和处理方式。
官方文档也建议优先使用内置 Bot 设置处理标准场景;相比手工 WAF 规则,这些托管设置会随着 Cloudflare 识别新的 crawler 而更新。(Cloudflare Docs)
因此现在我的思路是:
全局策略:
Search → Allow
Agent → Allow
Training → Disallow然后:
AI Crawl Control → 主要用于观察只有以后发现某一个 crawler 明显存在问题,才考虑单独 Block。
这样配置更简单,也不容易由于规则越来越多而产生意外冲突。
十、这次 Cloudflare 更新真正解决的问题
我觉得 Cloudflare 这次变化最有价值的地方,并不是“又增加了几个 AI Bot 开关”。
真正解决的是:
网站管理员终于可以把搜索发现、AI Agent 和 AI 模型训练区分开来。
过去简单地阻止 AI Bot,很容易进入一个两难:
不阻止:
内容可能被用于 AI Training。
阻止:
又可能损失 Google、Bing 或 AI Search 的发现能力。现在可以更细地设置:
搜索:允许
AI Agent:允许
模型训练:拒绝对于依赖公开内容、SEO 和搜索发现的网站,我认为这种控制方式明显更实用。
至少对我自己的站点而言,目前选择的是:
尽可能保持内容可发现,但没有必要无条件允许内容被用于模型训练。
这应该也会成为我接下来一段时间观察 AI crawler 流量时的默认策略。
参考资料
Cloudflare 官方于 2026 年 9 月 15 日发布了关于 mixed-use AI crawler 和 Disallow AI Training 的说明,并明确介绍了 Search、Agent、Training 三类控制以及旧设置的迁移方式。(Cloudflare Blog)
Cloudflare AI Crawl Control 官方文档则介绍了 crawler 监控、单独 Allow/Block、robots.txt compliance 以及与 WAF/Bot Management 的关系。(Cloudflare Docs)
Linux 服务器运维、部署与线上故障排查
如果你的网站或后端服务部署在 Linux 服务器上,遇到访问异常、Nginx 配置问题、MySQL / Redis 异常、Docker 服务不可用、磁盘占满、CPU / 内存过高等问题,可以联系我做一次远程排查。
适合以下场景:
✅ 网站打不开或访问不稳定
✅ Nginx / PHP-FPM 配置异常
✅ MySQL / Redis 性能或连接问题
✅ Docker 服务部署与维护
✅ 服务器迁移与环境配置
✅ CPU / 内存 / 磁盘异常排查
服务内容:
✅ Linux 环境检查
✅ 网站部署与迁移
✅ Nginx / PHP-FPM / MySQL / Redis 排查
✅ Docker 配置与维护
✅ 服务器性能分析
✅ 长期远程运维支持
如需咨询,请联系我,并注明:Linux 运维咨询。
联系方式:
Telegram:@shuijingwan
微信:13980074657
邮箱:shuijingwanwq@gmail.com
