2026 年 7 月 1 日,Cloudflare 宣布了一项会改变内容站流量结构的默认设置:从 2026 年 9 月 15 日起,带广告的页面将默认拦截「混合用途」AI 爬虫。同时,此前的 Pay Per Crawl(按抓取付费)实验将升级为更宽的 Pay Per Use(按使用付费)模式。

它到底拦谁、不拦谁

Cloudflare 把爬虫行为拆成了三类,这个分类是理解新规的关键:

  • Search(检索):抓取并建立索引,用于以后回答问题——仍然放行
  • Agent(代理):AI 代理实时代表某个用户去访问页面——在带广告页面上默认拦截
  • Training(训练):抓内容去训练或微调模型——在带广告页面上默认拦截

新默认值适用于新客户、老客户新加的站点,以及所有现存的免费版用户。也就是说,很多个人站长什么都不做,9 月 15 日之后行为就变了。站点所有者可以自行调整设置覆盖默认值。Pay Per Use 的首批合作方包括 Ceramic.ai(内容出现在搜索结果时付费)和 You.com(代理访问付费内容时付费)。

对自建站意味着什么

如果你的站挂了广告,且流量里有相当比例来自 AI 摘要与 AI 代理,这条默认值可能同时减少你的服务器负载和你的曝光。带宽账单会好看一些,但被 AI 答案引用的机会也会下降——而「被引用」正在成为新的流量入口。反过来,如果你的站没有广告、靠自有产品或服务变现,默认值不会自动改变你的处境,你需要主动决定放行谁。

四件现在就能做的事

  • 先量化再决策:从 Nginx/Apache 日志里按 User-Agent 统计 GPTBot、ClaudeBot、PerplexityBot、CCBot、Bytespider 的请求数与带宽占比,看清 AI 爬虫到底占你多少资源、又带回多少引荐访问。
  • 分级而不是一刀切:允许检索型爬虫(它们仍是曝光来源),限制纯训练型;后台、会员区、重复筛选页统一 Disallow。
  • 在服务器侧留一道自己的闸:robots.txt 是君子协定。用 Nginx 的 limit_req / limit_conn 按 UA 或 IP 限速,必要时直接返回 403,别把控制权全部交给上游平台的默认值。
  • 盯住引荐数据:9 月 15 日前后各留一段基线,观察 AI 来源的引荐访问变化,再决定是继续拦还是放开。

为什么这轮变化让 VPS 更有价值

当「谁能抓我的内容」变成一个需要主动经营的决策时,你需要能改到服务器配置的那一层。共享主机里你改不了限速规则、看不到完整日志、也无法按 UA 做细粒度策略;独立 VPS 上这些全部由你决定。SharkCloud 各套餐提供独立 IP 与明确资源规格,香港、日本、美国等节点可就近部署,让你在 AI 抓取新秩序里自己掌握开关。