2026 年 7 月 1 日,Cloudflare 宣布了一項會改變內容站流量結構的預設設定:從 2026 年 9 月 15 日起,帶廣告的頁面將預設攔截「混合用途」AI 爬蟲。同時,此前的 Pay Per Crawl(按抓取付費)實驗將升級為更寬的 Pay Per Use(按使用付費)模式。
它到底攔誰、不攔誰
Cloudflare 把爬蟲行為拆成了三類,這個分類是理解新規的關鍵:
- Search(檢索):抓取並建立索引,用於以後回答問題——仍然放行。
- Agent(代理):AI 代理即時代表某個使用者去存取頁面——在帶廣告頁面上預設攔截。
- Training(訓練):抓內容去訓練或微調模型——在帶廣告頁面上預設攔截。
新預設值適用於新客戶、老客戶新加的站台,以及所有現存的免費版使用者。也就是說,很多個人站長什麼都不做,9 月 15 日之後行為就變了。站台擁有者可以自行調整設定覆蓋預設值。Pay Per Use 的首批合作方包括 Ceramic.ai(內容出現在搜尋結果時付費)和 You.com(代理存取付費內容時付費)。
對自建站意味著什麼
如果你的站掛了廣告,且流量裡有相當比例來自 AI 摘要與 AI 代理,這條預設值可能同時減少你的伺服器負載和你的曝光。頻寬帳單會好看一些,但被 AI 答案引用的機會也會下降——而「被引用」正在成為新的流量入口。反過來,如果你的站沒有廣告、靠自有產品或服務變現,預設值不會自動改變你的處境,你需要主動決定放行誰。
四件現在就能做的事
- 先量化再決策:從 Nginx/Apache 日誌裡按 User-Agent 統計 GPTBot、ClaudeBot、PerplexityBot、CCBot、Bytespider 的請求數與頻寬佔比,看清 AI 爬蟲到底佔你多少資源、又帶回多少引薦存取。
- 分級而不是一刀切:允許檢索型爬蟲(它們仍是曝光來源),限制純訓練型;後台、會員區、重複篩選頁統一 Disallow。
- 在伺服器側留一道自己的閘:robots.txt 是君子協定。用 Nginx 的
limit_req/limit_conn按 UA 或 IP 限速,必要時直接回傳 403,別把控制權全部交給上游平台的預設值。 - 盯住引薦資料:9 月 15 日前後各留一段基線,觀察 AI 來源的引薦存取變化,再決定是繼續攔還是放開。
為什麼這輪變化讓 VPS 更有價值
當「誰能抓我的內容」變成一個需要主動經營的決策時,你需要能改到伺服器設定的那一層。共享主機裡你改不了限速規則、看不到完整日誌、也無法按 UA 做細粒度策略;獨立 VPS 上這些全部由你決定。SharkCloud 各方案提供獨立 IP 與明確資源規格,香港、日本、美國等節點可就近部署,讓你在 AI 抓取新秩序裡自己掌握開關。