完成这套流程后你会得到什么
走完这套流程后,你的 Cloudflare 域名会有一套明确、刻意设定的三类 AI 机器人流量策略——搜索(Search)、代理(Agent)、训练(Training)——而不是被动继承域名上的默认值。你会确切知道哪些爬虫被允许、哪些被屏蔽、以及作用在哪些页面上,而且你的 robots.txt 与边缘强制执行规则会真正彼此一致。
这份指南适合谁: 任何通过 Cloudflare 代理网站的人——媒体出版方、SaaS 营销站、电商店铺、博客——希望自己决定 AI 系统能否训练、摘要或代理浏览你的内容,而不是继承平台默认值。
前置条件:
- 一个通过 Cloudflare 代理的域名(任何套餐均可,包括 Free;以下部分步骤为付费套餐专属,会另行标注)
- 至少具备域名级安全设置权限的仪表盘访问权
- 审计与配置约需 20 到 30 分钟;之后每天或每周花几分钟监控
完成定义: 你的域名安全设置中,搜索、代理、训练三类都显示出刻意做出的选择(而非默认值);线上 /robots.txt 反映该选择;并且你已在 AI Crawl Control 中确认,原本打算屏蔽的机器人确实被屏蔽。
为什么这件事突然变得重要:9 月 15 日改了什么
Cloudflare 从 2025 年 9 月在 robots.txt 中加入 Content Signals Policy,以及 2026 年 7 月 1 日「Content Independence Day」上线开始,分阶段构建 AI 流量控制能力。后者首次把原本粗糙的「是 AI/不是 AI」单一开关,拆成三个有名字的类别:
- 搜索(Search)——建立搜索索引、之后返回链接或简短摘要的爬取。Cloudflare 的说法是:这类流量应该为你带来推荐流量。
- 代理(Agent)——正在代替某个人实时行动的自动化活动,例如聊天助理抓取页面,或浏览器代理完成一项任务。
- 训练(Training)——为训练或微调模型而爬取,你的内容会被永久吸收进模型权重,而不是以链接回馈给你。
2026 年 9 月 15 日,Cloudflare 改变了自动套用的内容。对于在这一天之后新加入 Cloudflare 的域名,如果网站被标记为广告变现,默认设置变成:
类别 | 广告变现页面上的默认值 |
|---|---|
搜索(Search) | 允许 |
代理(Agent) | 在含广告的页面上屏蔽 |
训练(Training) | 不允许 AI 训练(Disallow AI Training) |
未以广告变现的新域名,三类默认都是允许。既有客户并未被悄悄切换——Cloudflare 在 15 日之前提供了一段可通过仪表盘退出的窗口期,而且实际的逐域名迁移规则比单一新默认值更细致(下文会说明)。
广告页面会套用更严格默认值的原因在于:页面上的广告代表「本来预期会有人看到这一页」。根据 Cloudflare 自家数据,2026 年 6 月时,把搜索索引、代理抓取与训练混在同一个用户代理后面的「混合用途爬虫」,占已核实爬虫流量的 超过 36%,是最大的单一类别。而在 Cloudflare 网络上,AI 训练占全部爬虫请求的比例,从 2025 年春季的约 22% 增长到 2026 年 6 月的 52%。这次变更锁定的就是这类流量。
开始之前:关于类别必须理解的三件事
1. 有些爬虫是「混合用途」,在屏蔽与不允许 AI 训练之下的行为并不相同。 Googlebot、Bingbot 与 Applebot 各自身兼两职——用同一个用户代理同时为搜索与训练爬取。Cloudflare 把 Apple、Google、Microsoft 称为「Accountable(可问责)」运营方,因为它们符合四项条件:尊重 robots.txt 中关于训练的偏好设置、提供退出 AI 摘要的机制、能提供 URL 级别的可见性说明哪些内容被用于训练,以及能证明退出训练不会损害你的搜索曝光。
2.「不允许 AI 训练」与「屏蔽」不是同一个设置,而这个差别正是重点。 不允许 AI 训练会在 robots.txt 中发布针对训练专用用户代理(例如 Google-Extended、Applebot-Extended)的 Disallow 偏好。可问责的混合用途爬虫会读取该偏好,自愿跳过训练、继续为搜索而爬取——因此你的搜索曝光得以保留。其他不属于可问责运营方的训练爬虫,会在边缘被直接屏蔽,而这不影响搜索,因为那些运营方另外运行独立的训练专用机器人。相对地,单纯的屏蔽在 9 月 15 日之后也会直接屏蔽 Googlebot、Bingbot 与 Applebot,意味着你的内容同样会从它们的搜索结果中消失。如果你想要训练消失但搜索留存,该选的是「不允许 AI 训练」,不是屏蔽。
3. Bing 目前还不遵守 robots.txt 的训练偏好。 Applebot 与 Googlebot 今天都会遵循训练专用的 Disallow 指令。Microsoft 表示正在为 Bingbot 构建对应机制,目标是 2027 年初。在那之前,选择「不允许 AI 训练」会把你的偏好写进 robots.txt,但 Bing 为了训练而爬取的行为不会仅因这个信号而改变——若你特别在意通过 Bing 的训练曝光,Bing 自家的 NOARCHIVE meta 标签或 Content Removal 工具是过渡期的杠杆。
步骤 1:查出你的网站实际上落在哪里
不要以为你知道当前的设置——去验证它。
操作: 在 Cloudflare 仪表盘中打开你的域名,前往 Security → Settings,找到 AI 机器人策略控制项(较新的三类别界面已取代旧的单一「Block AI Bots」开关,但尚未迁移的账号仍可能显示旧开关)。另外,用浏览器或 curl https://yourdomain.com/robots.txt 获取线上 robots.txt,寻找以 Cloudflare 管理的注释标记开头的区块;你也可以用 Auspia 的 Robots.txt AI 爬虫检查工具 交叉比对,看看当前规则对 AI 爬虫读起来是什么样子。
预期输出: 三个设置,分别对应搜索、代理、训练,各自为「允许/在含广告的页面上屏蔽/屏蔽」其中之一(「不允许 AI 训练」是训练专属的第四个选项)。若 Bot Preference Sync 或托管 robots.txt 已启用,你的线上 robots.txt 应该会出现一段 Cloudflare 管理的区块,列出特定机器人用户代理与 Disallow/Content-Signal 行。
质量检查: 确认这三个设置符合你真正的意图,而不是迁移机制替你假设的结果。Cloudflare 说明的既有客户迁移逻辑是:如果你先前开启了旧版的「Block AI」开关,你会被移到训练=不允许 AI 训练、搜索维持允许、代理=在含广告的页面上屏蔽。如果你先前把训练本身设为屏蔽或在含广告的页面上屏蔽,你会被移到不允许 AI 训练。这两条迁移路径都假设你想保留搜索——如果你其实想让混合用途爬虫完全消失(连搜索也算在内),那并不是你现在的状态,你必须明确选择屏蔽。
恢复路径: 若安全设置只显示单一旧版「Block AI Bots」开关、没有三类别细分,说明你的账号还没迁移到新控制项。请寻找「Configure AI bot policies」这个独立且较新的设置界面;过渡期间,细致的控制项与旧开关并存,而未来就在那里。
步骤 2:针对每个类别分别决定策略,不要一个笼统答案
这才是真正的决策步骤。请逐一处理每个类别。
搜索。 几乎没人屏蔽这一项——Cloudflare 指出不到 1% 的网站选择屏蔽搜索机器人——因为失去搜索曝光很少值得。除非你有特定理由(例如测试环境、付费墙后的存档内容)要把它排除在搜索索引之外,否则默认选允许。
代理。 这些是当下正在替某个人实时行动的机器人——查价格、完成预订、把一项事实拉进聊天回答。在变现或广告页面上屏蔽代理流量之所以成为新的默认逻辑,是因为代理访问不会产生人类访问那样的广告曝光。如果你的商业模式依赖那份人类注意力(媒体、带展示广告的内容网站),在含广告的页面上屏蔽是站得住脚的。如果你反而希望代理即使是在广告页面也能完成任务——例如代理带来的流量在你这里仍会转化——请选允许。
训练。 真正的决定在这里,也是术语最容易让人混淆的地方:
- 如果你想阻止内容被用于训练模型,同时维持在 Google、Bing、Apple 搜索产品中的曝光,请选不允许 AI 训练(考虑到 Bing 目前的落后,请理解为「今日对 Google 与 Apple 有效,对 Bing 待补」)。这是 Cloudflare 建议的中间路线,也是专为搜索与训练之间的取舍而设计的设置。
- 只有在你愿意以失去 Googlebot、Bingbot、Applebot 的搜索爬取为代价,来同时屏蔽它们的训练模式行为时,才选屏蔽。这现在是严格选项——自 9 月 15 日起,屏蔽也适用于混合用途爬虫,这是以往没有的。
- 只有在你刻意接受内容被用来训练 AI 模型时才选允许,例如你想把 AI 回答中的引用曝光最大化,并把被用于训练当成可接受的代价。
操作: 在 Security → Settings → Configure AI bot policies 中,把三个下拉菜单各自设为你的决定。
预期输出: 仪表盘应反映你对每个类别的明确选择,并且(若 Bot Preference Sync 已开启)开始自动发布相符的 robots.txt 区块——不需要手动编辑文件。
质量检查: 用这句话重新检视你对训练的选择:「我要不要保留搜索曝光?」若要保留,那就是不允许 AI 训练,不是屏蔽,无论「屏蔽」这个词在阻止 AI 训练上听起来多么诱人。
恢复路径: 如果你选了某个设置之后搜索流量下滑,请检查是不是误选了屏蔽而不是不允许 AI 训练——这是这个配置中最常见的自伤错误,因为命名会让「屏蔽」听起来像「做得更多」的选项,但对训练而言,它实际上做了你可能不想要的事(连搜索也一起失去)。

步骤 3:开启 Bot Preference Sync,让 robots.txt 与你的设置一致
仪表盘设置与 robots.txt 文件是两套不同的系统,当两者不一致时,某些爬虫会拿这个落差当借口无视你的偏好。Cloudflare 的 Bot Preference Sync 直接从你的安全设置生成 robots.txt,补上这个缺口。
操作: 在同一个 AI 机器人策略设置区块中启用 Bot Preference Sync(对新客户默认为开启;使用较旧托管 robots.txt 功能的既有客户,会在迁移期间被提示审阅并确认)。
预期输出: Cloudflare 会在你的 robots.txt 开头加上一段托管区块,以 # BEGIN Cloudflare Bot Preference Sync / # END 注释包住,列出受影响的特定用户代理与其 Disallow 规则——而且不会删除你原本 robots.txt 中已有的自定义规则,它们会保留在托管区块下方。
质量检查: 启用后再次获取 /robots.txt,确认托管区块出现且与步骤 2 的选择相符——例如你若把训练设为不允许 AI 训练,应该会看到训练专用的用户代理(如 Google-Extended、Applebot-Extended)带有 Disallow 规则,而通用型的 Googlebot/Applebot/Bingbot 用户代理为了搜索仍未被屏蔽。
恢复路径: 如果你与某个特定爬虫运营方有一次性特殊安排,而类别层级的策略会破坏它(例如付费内容授权合同),请关闭 Bot Preference Sync,改为手动编辑你自己的 robots.txt——类别开关是为整个域名的策略设计的,不是为个别运营方的例外设计的。

步骤 4:确认策略是真的被强制执行,而不只是被请求
robots.txt 是一个请求,它在技术层面挡不住无视它的爬虫。这是大家最常跳过的一步,也是能告诉你步骤 2 的决定是真实还是理论的一步。
操作: 打开你域名的 AI Crawl Control(所有套餐皆可使用,包括 Free——在含 Bot Management 的套餐上检测质量更好,但可见性功能到处都能用)。查看 Crawlers 标签页,其中列出所有访问过你网站的机器人,以及一栏 Robots.txt violations。
预期输出: 一张列出各机器人请求数与违规数的表。你设为不允许或屏蔽的机器人若违规数不为零,代表它目前正在无视你的 robots.txt。
质量检查: 对任何显示违规的机器人,查看「Most popular paths」(筛选到被标记的路径),看它实际访问的内容是否真的是你在意、想保护的内容。
恢复路径: 如果某个机器人无视你声明的偏好,单靠 robots.txt 挡不住它。使用 AI Crawl Control 中的「Enforce robots.txt rules」操作(有时以内部名称 Robotcop 称之),把你声明的规则转换成实际的 WAF 规则,让不服从的机器人在抵达你的源站服务器之前,就先在 Cloudflare 边缘被屏蔽——把你从「请求对方配合」推进到「强制对方配合」。这个步骤使用 WAF,因此可用性取决于你套餐中的 WAF 访问权。
步骤 5:决定是单纯屏蔽,还是收费变现
如果你对训练的决定是「不给训练访问」,除了一律屏蔽,你还有第二个选项:收费。
操作: 如果你有兴趣,申请 Cloudflare 的 Pay Per Crawl 私人测试(通过 Cloudflare 的申请页面,或 Enterprise 客户可通过客户经理)。在账号层级启用后(Manage Account → Settings → Pay Per Crawl → 把域名的 Visibility 设为 Visible),你可以为整个域名设置单一固定的一次请求价格,并针对每个爬虫选择允许(免费)、收费(按你的价格计费)或屏蔽。
预期输出: 当一个通过 Web Bot Auth(带有 Ed25519 签名、用以识别爬虫的请求)认证的爬虫请求你设为收费的页面时,会收到附带 crawler-price 头的 HTTP 402 Payment Required;若它同意付费后重试,或事先附上足以覆盖你价格的 crawler-max-price 头,就会取得内容,并附上确认计费金额的 crawler-charged 头。Cloudflare 作为 merchant of record 处理结算。
质量检查: 这只对已向 Cloudflare 注册付款信息并支持 402 流程的爬虫有效,不是对所有机器人都通用的开关。对其他对象而言,你的收费设置实质上等同屏蔽——Cloudflare 指出,这仍可作为你未来愿意建立付费关系的信号。
恢复路径: 这项功能仍在私人测试阶段;若你未获录取或不想等待,对同样这些爬虫,目前可用的选项仍是不允许 AI 训练或屏蔽。
处理例外:如果有特定 AI 运营方要求访问
你可能会收到主动联系——合作提案、引用协议、授权洽谈——来自想在整站策略之外取得明确访问的 AI 公司。
有两种方式可以在不重新打开整个类别的前提下给予狭窄的例外:
- 在 Manage AI crawlers 中逐爬虫覆盖: 把该特定机器人的行从屏蔽/收费改为允许,独立于你类别层级的训练或代理设置。
- 直接手动编辑 robots.txt: 如果你已关闭 Bot Preference Sync(或把例外放在托管区块之外),可以在 Cloudflare 管理区块下方,为那一个用户代理加上针对性的 Allow。
无论采用哪一种,请把域名层级的类别策略维持为默认,并把指名例外当成刻意、有记录的决定——而不是反过来。
验证完成的结果
配置上线后,跑一遍这份检查清单:
- [ ] 安全设置对搜索、代理、训练都显示明确、刻意的值——不是未经审阅的默认值
- [ ] 线上域名的
/robots.txt显示与这些设置相符的 Cloudflare 托管区块 - [ ] AI Crawl Control 的 Crawlers 标签页显示你预期的机器人,且你设为屏蔽/不允许的项目违规数为零或接近零
- [ ] 若你选择不允许 AI 训练,你已确认(通过 Search Console/Bing Webmaster Tools,或单纯观察自然流量)Googlebot/Applebot 的搜索爬取仍正常进行
- [ ] 若你启用了 robots.txt 强制执行(Robotcop),生成的 WAF 规则已部署并生效,而不只是生成后留在草稿
- [ ] 你已记录选择了哪个设置与原因,让未来的检视不必从零开始
维持成果
这不是设置完就能忘的配置。请用轻量的节奏重新检视:
- 每月: 查看 AI Crawl Control 的 Metrics 标签页,找出你还没决定策略的新机器人,并重新检查违规数。
- 当 Bing 为 Bingbot 推出训练偏好支持时(据 Microsoft 说法目标为 2027 年初):重新评估你当前的设置是否仍能达到你想要的「保留搜索、屏蔽训练」结果,因为那正是 Bing 追上 Google 与 Apple 现行行为的时间点。
- 每当你的广告变现状态改变时:新增或移除展示广告会改变你的页面落在哪一条默认轨道上,值得重新确认你的明确设置在那种情况下仍合理。
常见问题
屏蔽训练爬虫会伤害我的 SEO 排名吗?如果你用的是不允许 AI 训练而不是屏蔽,就不会。不允许 AI 训练是专为让可问责的混合用途爬虫(Google、Apple,以及将来的 Bing)在跳过训练的同时继续为搜索爬取而设计的。相对地,单纯的屏蔽现在也会屏蔽这些爬虫的搜索行为,这会损害你在它们搜索产品中的曝光。
我在 9 月 15 日之前就已经开启「Block AI Bots」,我的设置后来怎么样了? Cloudflare 自动迁移了它:旧版 Block AI Bots 变成训练=不允许 AI 训练、搜索=允许、代理=在含广告的页面上屏蔽。请用上面的步骤 1 验证实际结果是否符合预期,而不是假设迁移符合你的意图。
这些功能在 Free 套餐上可用吗?可以。AI Crawl Control、搜索/代理/训练的类别设置,以及 Bot Preference Sync 都可在所有套餐使用,包括 Free。部分强制执行细节因套餐而异——例如 robots.txt 强制执行通过 WAF 运作,而 Free 套餐的机器人检测依赖用户代理字符串,而非更高级的 Bot Management 检测 ID。
AI Crawl Control 与 AI 机器人安全设置有什么不同?安全设置是你决定策略的地方(每个类别的允许/广告页面屏蔽/屏蔽/不允许 AI 训练)。AI Crawl Control 是你审计实际状况的地方——各机器人的请求数、robots.txt 违规、路径级别细节——也是你可以把已声明的 robots.txt 策略转换成强制执行的 WAF 规则的地方。
设置这些之后,我需要手动编辑 robots.txt 吗?若 Bot Preference Sync 已启用就不需要——它会依你的仪表盘设置写入并维护适当的 robots.txt 区块。只有在托管类别之外需要自定义的个别运营方例外时,才需要手动编辑。
作者:Julian Mercer,Auspia 的 14 年资历技术 SEO 实务工作者。他撰写关于可爬取性、结构化数据、渲染,以及让内容可被 AI 读取的技术基础。




