Cloudflare 屏蔽 AI 爬虫:保留搜索,拒绝训练
Cloudflare 已重新定义 Training 下的 Block:它可能连 Googlebot、Applebot 和 Bingbot 的搜索抓取一并拦截。本文说明如何允许 Search、选择 Disallow AI Training,核对迁移设置、robots.txt 与爬虫活动,在拒绝模型训练的同时保留搜索收录。

要用 Cloudflare 屏蔽 AI 爬虫的训练用途、又不影响搜索抓取,安全做法是:把 Search 设为 Allow,把 Training 设为 Disallow AI Training,然后同时核对迁移后的设置,以及 Cloudflare 实际提供的 robots.txt。现在尤其需要复查,因为 Cloudflare 在 2026 年 9 月 15 日改变了 Block 的含义。启用 Block 后,Googlebot、Applebot、Bingbot 这类混合用途爬虫也可能无法访问网站,搜索收录会一并受影响。
Cloudflare 屏蔽 AI 爬虫的安全配置
对大多数依赖搜索流量的网站来说,正确选择很明确:允许 Search,禁止 Training,再单独决定如何处理 Agent。
Cloudflare 在 9 月 15 日发布的说明写得很清楚:如果目标是停止训练但保留搜索,应选择 Disallow AI Training。不要再照着旧指南选择 Training: Block。改动前,混合用途爬虫不在这项屏蔽范围内;现在已经纳入。
这项控制向 Cloudflare 所有套餐开放,无需另购功能升级。成本重点也因此从购买另一套屏蔽产品,转向确认政策设置与实际行为一致。作为参考,Screaming Frog SEO Spider 在美国的单席位价格是每年 $279,一款专用 robots.txt 监控产品则标出了每月 $129 的套餐。Cloudflare 提供了控制能力,但你仍然需要一套验证闭环。
Disallow AI Training 到底会做什么
Disallow 是一项偏好声明,并配合选择性执行;Block 则像把门直接锁上。
可以把混合用途爬虫想成一辆同时带着两张任务单的配送车。一张写着“为搜索索引这个页面”,另一张写着“用这个页面训练模型”。拦下整辆车,两项任务都会停止。Disallow AI Training 的作用,是让具备问责机制的运营方继续执行搜索任务,同时拒绝训练任务。
Cloudflare 把自动化流量分成三类:
- Search:构建搜索索引。
- Training:训练或微调模型。
- Agent:代表用户访问网站,例如聊天工具的内容抓取器或操作浏览器的智能体。
新的 Training 选项会让 Bot Preference Sync 在 robots.txt 中发布对应的禁止训练指令。具备问责机制的混合用途爬虫仍可获得搜索访问权限。Amazon、Anthropic、Meta 和 OpenAI 的训练专用爬虫会被屏蔽,但这些公司的独立搜索爬虫不会被连带阻止。

Cloudflare 表示,屏蔽 Search 爬虫的站点不到 1%,而启用某种 Training 屏蔽机制的站点占 17%。这一差距正是产品重新设计的原因:单一的 Block AI 开关太粗糙,无法满足站长真正的需求。
这里有一个重要区别:robots.txt 指令不是力场。它本身既不能识别访问者是谁,也不能判断其抓取目的,更无法阻止无视指令的爬虫。对于不符合问责通道条件的爬虫,Cloudflare 会把公开发布的偏好与网络层分类和屏蔽结合起来。
Accountable 标签不代表功能今天就全部可用
应把 Cloudflare 的 Accountable 标签理解为有路线图承诺支撑的状态,而不是每项承诺功能都已经上线的证明。
运营方要获得这一资格,必须满足或承诺满足多项要求,包括提供训练退出机制、AI 摘要退出机制、URL 级可见性,并保证拒绝训练不会损害传统搜索。这里的措辞很关键。
- Google: 可以在 robots.txt 中禁止 Google-Extended,Google 也明确表示,这项选择不会影响搜索排名。Google 还提供生成式搜索的站长控制和报告功能。至于更细的 URL 级 Google-Extended 透明度,公告发布时仍称将在随后几周内推出。
- Apple: Applebot-Extended 支持通过 robots.txt 退出训练。Apple 也支持使用
nosnippet控制 AI 摘要,并支持付费墙标记。公告当天尚无 URL 级检查能力,Cloudflare 称这项工作将在下一年推进。 - Microsoft: Bing 目前走的是另一条路径。站长可以结合
NOARCHIVE与 Bing 的 Block URLs 或 Content Removal 工具。Microsoft 的目标是让 Bingbot 在 2027 年初遵循 robots.txt 中的域名级禁止训练偏好。在此之前,Cloudflare 的 Disallow AI Training 设置不会自动通过 robots.txt 向 Bing 传达该偏好。
因此,准确的承诺范围比“一个开关管住所有平台的所有用途”要窄。新设置确实让搜索与训练之间的安全选择清晰得多,但目前仍需单独检查 Bing。
检查 Cloudflare 如何迁移旧设置
大多数设置会自动迁移,但标签和效果的变化足以影响结果,因此必须审计迁移后的状态。
如果某个域名从未使用细分的 Search、Training 和 Agent 控制,Cloudflare 会按下表映射旧版 Block AI Bots 设置:
如果域名已经使用细分控制,Search 和 Agent 会保留其实际状态。Training: Allow 仍为 Allow;Training: Block 和 Training: Block on pages with ads 都会变为 Disallow AI Training。
按以下步骤检查迁移结果:
- 在 Cloudflare 中打开对应域名,进入 Security Settings,再选择 Configure AI bot policies。
- 在修改前,记录当前的 Search、Training 和 Agent 值。
- 如果自然搜索曝光对业务很重要,把 Search 设为 Allow。
- 如果希望退出训练、但不想让具备问责机制的混合用途爬虫退出搜索,把 Training 设为 Disallow AI Training。
- 根据 Agent 本身的利弊单独制定策略。Cloudflare 没有为 Agent 提供 Disallow 偏好,因为目前互联网尚无对应的通用指令。
- 如果希望 Cloudflare 在 robots.txt 中发布类别级策略,确认 Bot Preference Sync 已启用。
- 保存策略后,再检查公开可见的结果,不要把控制台标签本身当作生效证明。
对于新接入且靠广告变现的域名,Cloudflare 推荐的预设已经采用这套组合:开启 Preference Sync,允许 Search,禁止 Training,并在有广告的页面屏蔽 Agent。新接入但不通过广告变现的域名,初始状态则是允许全部三类行为。
改动后如何验证搜索访问不受影响
开关看起来正确,只是第一道检查。还要从站外视角验证整套策略。

验证分为四部分:
- 设置: 确认 Search 显示 Allow,Training 显示 Disallow AI Training;Agent 要单独审查。
- robots.txt: 从公开域名获取实时
/robots.txt文件。Bot Preference Sync 会把生成的规则添加到现有文件开头,因此原来的 Disallow 指令仍会保留。两个部分都要检查是否存在冲突。 - 搜索行为: 使用搜索服务商的站长工具和报告检查代表性 URL。不要只看到“Disallow”一词就推断搜索访问已被禁止;它针对的是训练身份或训练偏好,而不是具备问责机制的混合用途爬虫所承担的传统搜索任务。
- 爬虫活动: 在 AI Crawl Control 中观察请求、robots.txt 遵守情况和异常屏蔽。Cloudflare 可以针对单个爬虫执行操作并记录活动,因此这里最适合发现“实际效果与策略意图不一致”的问题。
自定义规则尤其需要留意。Bot Preference Sync 反映的是类别级策略,不会把复杂的单独规则写入生成的文件。如果某个爬虫享有授权例外、你设置了路径级逻辑,或使用了自定义 WAF 规则,就要手动对照这些层级。若类别级策略过于粗放,Cloudflare 也允许关闭 Sync 并自行维护文件。
谁最能从新的策略拆分中获益
最大受益者,是那些依赖真人访问页面来获得收入、却不希望自有内容库被纳入训练数据的企业。
零售商案例也暴露了一个限制:这些控制以域名为单位,并不是内置的文章级授权系统。不同 Zone 可以采用不同策略,但同一个 Zone 只有一套 Search、Training 和 Agent 立场,除非自行增加更具体的规则。
哪些产品值得做
最值得做的是爬虫策略回归监控器,而不是又一个 robots.txt 生成器。
1. 爬虫策略回归监控器
面向服务商和多站点团队构建监控工具:读取 Cloudflare 策略,获取实际提供的 robots.txt,检查代表性页面的搜索访问,并在各层状态发生偏移时发出告警。
围绕这项工作的需求已经很明确:robots.txt generator 在美国每月约有 1,000 次搜索,google indexing checker 约有 110 次。现有工具也证明市场确实有预算:一款 robots.txt 监控产品的五域名套餐价格是每月 $129,一款桌面 SEO 变更监控工具则标价为一次性 $179。
最小可售版本只需四项能力:导入 Cloudflare Zone、对比策略与 robots.txt、定时检查,以及通过邮件或 Slack 发送包含具体变更的告警。待核心偏移检测获得信任后,再接入爬虫活动和站长数据。
难点在于证据边界。配置和观测到的请求,可以证明网站发布了什么、屏蔽了什么;它们无法证明模型厂商已经删除此前收集的数据。真正的壁垒应是跨大量域名提供可靠证据,而不是把开关做得更漂亮。
2. Cloudflare 迁移审计工具
打造一款聚焦迁移的审计工具,找出仍在使用高风险迁移后组合的 Zone,并为服务商、出版集团或连锁网络生成整改报告。
cloudflare block ai bots 在美国每月约有 50 次搜索,CPC 为 $13.19;围绕最令人担心的后果,google indexing checker 另有 110 次月度搜索。这类需求规模小于生成器市场,但付费点击价格说明,主动搜索的人往往正面临实际运营问题。
MVP 可以读取 Search、Training、Agent 和 Bot Preference Sync 的 API 字段,获取公开 robots.txt,并把每个 Zone 分类为“搜索安全”“有意屏蔽”或“状态不一致”。再把设置与实际观测到的文件并排展示,导出可直接交付客户的证据包。
风险在于平台依赖。Cloudflare 可以自行增加同类组合报告,而且需求会在迁移前后集中爆发。更好的商业模式,是用审计工具获客,再销售覆盖 Cloudflare 和其他边缘服务商的持续回归监控。
这项控制解决不了什么
这是更清晰的策略边界,但并不能彻底解决 AI 使用内容的问题。
- 它不会删除已经被收集的材料。Cloudflare 描述的是爬虫偏好和请求控制,而不是追溯删除。
- 它无法保证每个运营方都遵守 robots.txt。Cloudflare 会对问责通道之外的爬虫增加网络层执行,但混合用途通道仍依赖运营方遵守偏好。
- 它不会让你退出所有 AI 摘要。摘要控制是另一套机制,Cloudflare 将更广泛的集中式摘要控制描述为未来工作。
- 它没有为 Agent 提供 Disallow 状态。
- 它不会把复杂的单爬虫自定义规则转换进 Bot Preference Sync。
- 目前,它不会通过 robots.txt 自动向 Bing 表达禁止训练偏好。需要单独检查 Bing 当前的
NOARCHIVE和站长控制。 - 它不是 Cloudflare 面向 R2 文件的 AI Search 索引功能。那是另一款产品,也是另一套工作流程。
如果确实希望爬虫完全离开,就选择 Block;如果业务仍然依靠搜索触达用户,就选择 Disallow AI Training。两者的区别,正是 9 月这次改动的核心。
下周一要做什么
下周选择三个有代表性的域名:一个广告支持的站点、一个依赖搜索的站点,以及一个使用自定义爬虫规则的域名。记录迁移后的 Search、Training 和 Agent 值,只修改业务目标明确的站点,然后把实时 robots.txt 和爬虫报告与变更工单保存在一起。如果这三个域名全部通过,再把同一套基于证据的检查扩展到整个域名组合。
如何禁止 AI 训练?
对于由 Cloudflare 管理的域名,如果希望发布禁止训练偏好,同时保留具备问责机制的混合用途爬虫用于搜索,请把 Training 设为 Disallow AI Training。只有在也能接受混合用途爬虫影响搜索时,才使用 Block。
能否屏蔽所有 AI 内容?
可以屏蔽某一类爬虫或单个爬虫,但“所有 AI 内容”混合了多种不同任务。Cloudflare 把流量拆分为 Search、Training 和 Agent,让你决定允许哪些自动化用途。屏蔽 Training 不会移除搜索产品中的 AI 生成内容,也不会删除已经收集的数据。
如何关闭搜索中的 AI 模式?
Cloudflare 的爬虫设置不会为用户关闭 AI 搜索体验,它控制的是对你域名的访问。Google 等运营方另行提供生成式摘要控制,而传统索引与训练偏好仍是彼此独立的决策。
如果希望为你的业务搭建这类爬虫策略审计与监控层,请查看 AI 生产系统。
- 最近更新
- 2026年9月16日
- 分类
- Build







