Cloudflare 屏蔽 AI 爬虫:保留搜索,拒绝训练

Cloudflare 已重新定义 Training 下的 Block:它可能连 Googlebot、Applebot 和 Bingbot 的搜索抓取一并拦截。本文说明如何允许 Search、选择 Disallow AI Training,核对迁移设置、robots.txt 与爬虫活动,在拒绝模型训练的同时保留搜索收录。

Wednesday, September 16, 2026Omid Saffari
Cloudflare 屏蔽 AI 爬虫:保留搜索,拒绝训练

要用 Cloudflare 屏蔽 AI 爬虫的训练用途、又不影响搜索抓取,安全做法是:把 Search 设为 Allow,把 Training 设为 Disallow AI Training,然后同时核对迁移后的设置,以及 Cloudflare 实际提供的 robots.txt。现在尤其需要复查,因为 Cloudflare 在 2026 年 9 月 15 日改变了 Block 的含义。启用 Block 后,Googlebot、Applebot、Bingbot 这类混合用途爬虫也可能无法访问网站,搜索收录会一并受影响。

Cloudflare 屏蔽 AI 爬虫的安全配置

对大多数依赖搜索流量的网站来说,正确选择很明确:允许 Search,禁止 Training,再单独决定如何处理 Agent。

你的目标SearchTrainingAgent实际结果
保留搜索,拒绝模型训练AllowDisallow AI Training单独选择具备问责机制的混合用途爬虫仍可为搜索建立索引;专门用于训练的爬虫会被屏蔽。
彻底阻止混合用途爬虫Allow 或更严格Block单独选择包括混合用途 Applebot、Bingbot 和 Googlebot 在内的训练爬虫都会被屏蔽,搜索可能受到影响。
只在展示广告的页面限制爬虫AllowBlock on pages with ads如有需要,选择 Block on pages with adsCloudflare 检测到页面正在展示广告时,会屏蔽混合用途爬虫。

Cloudflare 在 9 月 15 日发布的说明写得很清楚:如果目标是停止训练但保留搜索,应选择 Disallow AI Training。不要再照着旧指南选择 Training: Block。改动前,混合用途爬虫不在这项屏蔽范围内;现在已经纳入。

这项控制向 Cloudflare 所有套餐开放,无需另购功能升级。成本重点也因此从购买另一套屏蔽产品,转向确认政策设置与实际行为一致。作为参考,Screaming Frog SEO Spider 在美国的单席位价格是每年 $279,一款专用 robots.txt 监控产品则标出了每月 $129 的套餐。Cloudflare 提供了控制能力,但你仍然需要一套验证闭环。

Disallow AI Training 到底会做什么

Disallow 是一项偏好声明,并配合选择性执行;Block 则像把门直接锁上。

可以把混合用途爬虫想成一辆同时带着两张任务单的配送车。一张写着“为搜索索引这个页面”,另一张写着“用这个页面训练模型”。拦下整辆车,两项任务都会停止。Disallow AI Training 的作用,是让具备问责机制的运营方继续执行搜索任务,同时拒绝训练任务。

Cloudflare 把自动化流量分成三类:

  • Search:构建搜索索引。
  • Training:训练或微调模型。
  • Agent:代表用户访问网站,例如聊天工具的内容抓取器或操作浏览器的智能体。

新的 Training 选项会让 Bot Preference Sync 在 robots.txt 中发布对应的禁止训练指令。具备问责机制的混合用途爬虫仍可获得搜索访问权限。Amazon、Anthropic、Meta 和 OpenAI 的训练专用爬虫会被屏蔽,但这些公司的独立搜索爬虫不会被连带阻止。

对比 Cloudflare 网站屏蔽搜索与训练占比的建筑风格信息图
屏蔽 Search 的 Cloudflare 网站不到 1%,而 17% 的网站会通过某种机制屏蔽 Training。将两类控制拆开,正好对应了这种意图差异。

Cloudflare 表示,屏蔽 Search 爬虫的站点不到 1%,而启用某种 Training 屏蔽机制的站点占 17%。这一差距正是产品重新设计的原因:单一的 Block AI 开关太粗糙,无法满足站长真正的需求。

这里有一个重要区别:robots.txt 指令不是力场。它本身既不能识别访问者是谁,也不能判断其抓取目的,更无法阻止无视指令的爬虫。对于不符合问责通道条件的爬虫,Cloudflare 会把公开发布的偏好与网络层分类和屏蔽结合起来。

Accountable 标签不代表功能今天就全部可用

应把 Cloudflare 的 Accountable 标签理解为有路线图承诺支撑的状态,而不是每项承诺功能都已经上线的证明。

运营方要获得这一资格,必须满足或承诺满足多项要求,包括提供训练退出机制、AI 摘要退出机制、URL 级可见性,并保证拒绝训练不会损害传统搜索。这里的措辞很关键。

  • Google: 可以在 robots.txt 中禁止 Google-Extended,Google 也明确表示,这项选择不会影响搜索排名。Google 还提供生成式搜索的站长控制和报告功能。至于更细的 URL 级 Google-Extended 透明度,公告发布时仍称将在随后几周内推出。
  • Apple: Applebot-Extended 支持通过 robots.txt 退出训练。Apple 也支持使用 nosnippet 控制 AI 摘要,并支持付费墙标记。公告当天尚无 URL 级检查能力,Cloudflare 称这项工作将在下一年推进。
  • Microsoft: Bing 目前走的是另一条路径。站长可以结合 NOARCHIVE 与 Bing 的 Block URLs 或 Content Removal 工具。Microsoft 的目标是让 Bingbot 在 2027 年初遵循 robots.txt 中的域名级禁止训练偏好。在此之前,Cloudflare 的 Disallow AI Training 设置不会自动通过 robots.txt 向 Bing 传达该偏好。

因此,准确的承诺范围比“一个开关管住所有平台的所有用途”要窄。新设置确实让搜索与训练之间的安全选择清晰得多,但目前仍需单独检查 Bing。

检查 Cloudflare 如何迁移旧设置

大多数设置会自动迁移,但标签和效果的变化足以影响结果,因此必须审计迁移后的状态。

如果某个域名从未使用细分的 Search、Training 和 Agent 控制,Cloudflare 会按下表映射旧版 Block AI Bots 设置:

旧版设置新 Search新 Training新 Agent
DisabledAllowAllowAllow
BlockAllowDisallow AI TrainingBlock on pages with ads
Block on pages with adsAllowDisallow AI TrainingBlock on pages with ads

如果域名已经使用细分控制,Search 和 Agent 会保留其实际状态。Training: Allow 仍为 Allow;Training: Block 和 Training: Block on pages with ads 都会变为 Disallow AI Training。

按以下步骤检查迁移结果:

  1. 在 Cloudflare 中打开对应域名,进入 Security Settings,再选择 Configure AI bot policies
  2. 在修改前,记录当前的 Search、Training 和 Agent 值。
  3. 如果自然搜索曝光对业务很重要,把 Search 设为 Allow
  4. 如果希望退出训练、但不想让具备问责机制的混合用途爬虫退出搜索,把 Training 设为 Disallow AI Training
  5. 根据 Agent 本身的利弊单独制定策略。Cloudflare 没有为 Agent 提供 Disallow 偏好,因为目前互联网尚无对应的通用指令。
  6. 如果希望 Cloudflare 在 robots.txt 中发布类别级策略,确认 Bot Preference Sync 已启用。
  7. 保存策略后,再检查公开可见的结果,不要把控制台标签本身当作生效证明。

对于新接入且靠广告变现的域名,Cloudflare 推荐的预设已经采用这套组合:开启 Preference Sync,允许 Search,禁止 Training,并在有广告的页面屏蔽 Agent。新接入但不通过广告变现的域名,初始状态则是允许全部三类行为。

改动后如何验证搜索访问不受影响

开关看起来正确,只是第一道检查。还要从站外视角验证整套策略。

从 Cloudflare 设置到爬虫日志的四阶段建筑风格验证流程
把设置、实际提供的 robots.txt、代表性页面的搜索访问,以及最终的爬虫活动串成一条链进行验证。

验证分为四部分:

  1. 设置: 确认 Search 显示 Allow,Training 显示 Disallow AI Training;Agent 要单独审查。
  2. robots.txt: 从公开域名获取实时 /robots.txt 文件。Bot Preference Sync 会把生成的规则添加到现有文件开头,因此原来的 Disallow 指令仍会保留。两个部分都要检查是否存在冲突。
  3. 搜索行为: 使用搜索服务商的站长工具和报告检查代表性 URL。不要只看到“Disallow”一词就推断搜索访问已被禁止;它针对的是训练身份或训练偏好,而不是具备问责机制的混合用途爬虫所承担的传统搜索任务。
  4. 爬虫活动: 在 AI Crawl Control 中观察请求、robots.txt 遵守情况和异常屏蔽。Cloudflare 可以针对单个爬虫执行操作并记录活动,因此这里最适合发现“实际效果与策略意图不一致”的问题。

自定义规则尤其需要留意。Bot Preference Sync 反映的是类别级策略,不会把复杂的单独规则写入生成的文件。如果某个爬虫享有授权例外、你设置了路径级逻辑,或使用了自定义 WAF 规则,就要手动对照这些层级。若类别级策略过于粗放,Cloudflare 也允许关闭 Sync 并自行维护文件。

谁最能从新的策略拆分中获益

最大受益者,是那些依赖真人访问页面来获得收入、却不希望自有内容库被纳入训练数据的企业。

排名适用对象具体做法商业价值
1广告支持的内容发布商允许 Search、禁止 Training、在广告页面屏蔽 Agent,然后监控爬虫活动。搜索仍可带来页面浏览量,同时对训练和无人值守的 Agent 访问执行更严格策略。
2以 SEO 获客、拥有公开文档的软件公司保持 Search 开放以便用户发现文档,禁止 Training,并通过站长报告检查重要文档。产品答案仍然可被找到,同时不必把整个支持内容库都视为训练材料。
3管理多个 Cloudflare Zone 的代理机构导出每个 Zone 的三项值,标记 Training: Block,把需要保障搜索的 Zone 改为 Disallow,并保留证据。一个过时设置就可能让客户页面退出混合用途搜索抓取。批量检查能把它转化为可发现的配置风险。
4付费研究或新闻简报内容库发布类别级禁止训练偏好,屏蔽不具备问责机制的训练爬虫,并把任何授权合作方设为明确例外。默认策略可以保护订阅内容,同时为协商后的访问路径留出空间。
5商店域名与编辑内容域名分开的零售商在商店域名开放更广泛的发现能力;在编辑内容 Zone 禁止 Training,同时继续允许 Search。域名级策略可以匹配商品发现与原创编辑内容不同的商业逻辑。
6已备案 AI 使用政策的受监管企业保存 Zone 设置、实际提供的 robots.txt 与爬虫报告,形成证据链。团队可以证明发布了什么偏好、配置了什么执行方式,而不是只指向一个没有记录的开关。
7提供公开参考文档的开发者平台保持 Search 开放,判断 Training 是否有助于扩大生态覆盖,并为用户指令驱动的工具单独设置 Agent 访问。团队可以分别做出三项业务决策,不必把搜索、训练和 Agent 访问硬塞进同一个答案。

零售商案例也暴露了一个限制:这些控制以域名为单位,并不是内置的文章级授权系统。不同 Zone 可以采用不同策略,但同一个 Zone 只有一套 Search、Training 和 Agent 立场,除非自行增加更具体的规则。

哪些产品值得做

最值得做的是爬虫策略回归监控器,而不是又一个 robots.txt 生成器。

1. 爬虫策略回归监控器

面向服务商和多站点团队构建监控工具:读取 Cloudflare 策略,获取实际提供的 robots.txt,检查代表性页面的搜索访问,并在各层状态发生偏移时发出告警。

围绕这项工作的需求已经很明确:robots.txt generator 在美国每月约有 1,000 次搜索google indexing checker 约有 110 次。现有工具也证明市场确实有预算:一款 robots.txt 监控产品的五域名套餐价格是每月 $129,一款桌面 SEO 变更监控工具则标价为一次性 $179

最小可售版本只需四项能力:导入 Cloudflare Zone、对比策略与 robots.txt、定时检查,以及通过邮件或 Slack 发送包含具体变更的告警。待核心偏移检测获得信任后,再接入爬虫活动和站长数据。

难点在于证据边界。配置和观测到的请求,可以证明网站发布了什么、屏蔽了什么;它们无法证明模型厂商已经删除此前收集的数据。真正的壁垒应是跨大量域名提供可靠证据,而不是把开关做得更漂亮。

2. Cloudflare 迁移审计工具

打造一款聚焦迁移的审计工具,找出仍在使用高风险迁移后组合的 Zone,并为服务商、出版集团或连锁网络生成整改报告。

cloudflare block ai bots 在美国每月约有 50 次搜索CPC 为 $13.19;围绕最令人担心的后果,google indexing checker 另有 110 次月度搜索。这类需求规模小于生成器市场,但付费点击价格说明,主动搜索的人往往正面临实际运营问题。

MVP 可以读取 Search、Training、Agent 和 Bot Preference Sync 的 API 字段,获取公开 robots.txt,并把每个 Zone 分类为“搜索安全”“有意屏蔽”或“状态不一致”。再把设置与实际观测到的文件并排展示,导出可直接交付客户的证据包。

风险在于平台依赖。Cloudflare 可以自行增加同类组合报告,而且需求会在迁移前后集中爆发。更好的商业模式,是用审计工具获客,再销售覆盖 Cloudflare 和其他边缘服务商的持续回归监控。

这项控制解决不了什么

这是更清晰的策略边界,但并不能彻底解决 AI 使用内容的问题。

  • 它不会删除已经被收集的材料。Cloudflare 描述的是爬虫偏好和请求控制,而不是追溯删除。
  • 它无法保证每个运营方都遵守 robots.txt。Cloudflare 会对问责通道之外的爬虫增加网络层执行,但混合用途通道仍依赖运营方遵守偏好。
  • 它不会让你退出所有 AI 摘要。摘要控制是另一套机制,Cloudflare 将更广泛的集中式摘要控制描述为未来工作。
  • 它没有为 Agent 提供 Disallow 状态。
  • 它不会把复杂的单爬虫自定义规则转换进 Bot Preference Sync。
  • 目前,它不会通过 robots.txt 自动向 Bing 表达禁止训练偏好。需要单独检查 Bing 当前的 NOARCHIVE 和站长控制。
  • 它不是 Cloudflare 面向 R2 文件的 AI Search 索引功能。那是另一款产品,也是另一套工作流程。

如果确实希望爬虫完全离开,就选择 Block;如果业务仍然依靠搜索触达用户,就选择 Disallow AI Training。两者的区别,正是 9 月这次改动的核心。

下周一要做什么

下周选择三个有代表性的域名:一个广告支持的站点、一个依赖搜索的站点,以及一个使用自定义爬虫规则的域名。记录迁移后的 Search、Training 和 Agent 值,只修改业务目标明确的站点,然后把实时 robots.txt 和爬虫报告与变更工单保存在一起。如果这三个域名全部通过,再把同一套基于证据的检查扩展到整个域名组合。

如何禁止 AI 训练?

对于由 Cloudflare 管理的域名,如果希望发布禁止训练偏好,同时保留具备问责机制的混合用途爬虫用于搜索,请把 Training 设为 Disallow AI Training。只有在也能接受混合用途爬虫影响搜索时,才使用 Block。

能否屏蔽所有 AI 内容?

可以屏蔽某一类爬虫或单个爬虫,但“所有 AI 内容”混合了多种不同任务。Cloudflare 把流量拆分为 Search、Training 和 Agent,让你决定允许哪些自动化用途。屏蔽 Training 不会移除搜索产品中的 AI 生成内容,也不会删除已经收集的数据。

如何关闭搜索中的 AI 模式?

Cloudflare 的爬虫设置不会为用户关闭 AI 搜索体验,它控制的是对你域名的访问。Google 等运营方另行提供生成式摘要控制,而传统索引与训练偏好仍是彼此独立的决策。

如果希望为你的业务搭建这类爬虫策略审计与监控层,请查看 AI 生产系统

最近更新
2026年9月16日
分类
Build

在 Google 中优先显示本站

将 omidsaffari.com 添加为 Google 搜索的优先来源

把 omidsaffari.com 设为优先来源,Google 会在 Top Stories、AI Overviews 和 AI Mode 中为您优先展示。

Murmure 语音转文字实测:离线听写值不值得用?

Murmure 语音转文字实测:离线听写值不值得用?

实测 Murmure 1.11.3:免费、离线的桌面语音转文字工具如何用 Parakeet、词典和格式化规则处理技术术语与文件路径。本文还对比 Windows、macOS、Linux 的安装限制,本地与远程 LLM 的隐私边界、速度表现、API 能力和 $0 定价,帮你判断它是否适合日常听写与开发工作流。2026年9月14日Build
RenderIO FFmpeg API 定价拆解:套餐、积分与升级临界点

RenderIO FFmpeg API 定价拆解:套餐、积分与升级临界点

RenderIO FFmpeg API 每月 $12 起。本文完整拆解 Starter、Growth 与 Business 的命令积分、链式任务、视频下载计费、运行时、存储及 webhook 限制,并算清 838、2,201 等关键升级临界点,帮助你判断何时继续支付超额费、何时换档更省钱。2026年9月14日Build
Dictare 价格拆解:这款语音转文字软件真的零成本吗?

Dictare 价格拆解:这款语音转文字软件真的零成本吗?

Dictare 是面向编程智能体的免费本地语音转文字软件。本文拆解其 $0 定价、安装与硬件隐性成本,并与 Spokenly 和 Wispr Flow 的免费及付费方案逐项比较,还提供一套可直接套用的成本公式,帮你判断本地运行的所有权成本与托管订阅的跨平台便利,哪一个更适合你的开发工作流。2026年9月13日Build
Claude Code 插件评测实战:用原生 Evals 验证行为变化

Claude Code 插件评测实战:用原生 Evals 验证行为变化

Claude Code 2.1.269 已原生支持插件评测。本文从创建行为用例、配置确定性 grader、读取 WITH/W/OUT/Δ 报告,到故意制造回归、控制成本并接入 CI,完整演示如何证明插件确实改变了 Claude 的行为,而不只是通过文件校验,并给出最值得优先测试的场景和两类产品机会。2026年9月12日Build
Cloudflare 语音代理延迟排查:用 turnmetrics 找到真正卡点

Cloudflare 语音代理延迟排查:用 turnmetrics 找到真正卡点

Cloudflare 的 turnmetrics 能把每轮语音与文本交互拆成可定位的阶段,并标记 completed、no_output 等结果。本文详解如何读取重叠 timing、设计受控测试,并判断延迟来自转写、模型、TTS 还是浏览器播放,避免凭感觉更换供应商或购买超出需求的语音 QA 工具。2026年9月12日Build
SRT字幕烧录实战:用 Rendi 自动生成带字幕 MP4

SRT字幕烧录实战:用 Rendi 自动生成带字幕 MP4

用 Rendi 把审核通过的 SRT字幕永久烧录进 MP4。本文从 FFmpeg API 提交、字幕样式和异步任务状态讲到输出验收与字节计费,解释硬字幕与可选字幕轨该怎么选,并给出可直接运行的 Node.js 示例、轮询与 webhook 做法,以及批量处理前的必做检查,适合把字幕渲染接入自动化流程的内容团队与机构。2026年9月11日Build
OpenAI Agent SDK 与 Agents API 怎么选:控制权、成本与迁移

OpenAI Agent SDK 与 Agents API 怎么选:控制权、成本与迁移

OpenAI Agent SDK 和托管式 Agents API 到底该选哪个?本文从会话归属、运行时控制、沙箱成本、数据驻留、故障恢复与迁移工作量逐项比较,并用统一的成本模型拆解两条路线。你将看清精简平台团队、受监管企业和已有成熟基础设施的开发者分别适合哪一种方案,以及什么时候不该迁移。2026年9月11日Build
Rendi 定价详解(2026):先算处理字节,再选套餐

Rendi 定价详解(2026):先算处理字节,再选套餐

全面拆解 Rendi 定价:Free 与 $25 起的 Pro 套餐如何按输入加输出字节计费,存储、命令时长和 vCPU 又怎样限制选档;并用同一工作负载对比 Very Good FFmpeg 与 RenderIO,帮你找出自动化视频管线真正需要的最低套餐,避免只看视频时长或标价而多花钱。2026年9月11日Build
订阅通讯

每周日,一封信。写运转中的系统,不写热评。

每周一期。无垃圾邮件。随时退订。