2026 年網際網路出現了一個歷史性拐點:自動化請求首次超過真人存取。產業統計顯示,抓取網頁 HTML 的請求中約 57.5% 來自機器人,真人只佔 42.5%。其中成長最猛的是 AI 訓練與索引類爬蟲——八個月內份額從 2.6% 竄升到 10.1%,OpenAI 的 GPTBot 單項成長超過 300%。

站長的帳單為什麼變貴了

很多人發現自己的網站出現了怪現象:真人訪客沒漲,頻寬和 CPU 卻明顯上升,頁面回應變慢。這往往不是被攻擊,而是 AI 爬蟲在做深度抓取。一次訓練類爬蟲的深抓週期,可能吃掉站台相當比例的月度頻寬;對內容量大的站台,AI 爬蟲每月帶來的額外流量可以達到 TB 級別。

最扎心的是投入產出比

傳統搜尋引擎抓你的頁面,會用排名和點擊「還」給你流量。但 AI 爬蟲不一定。有統計發現,某些主流 AI 爬蟲每為網站帶來 1 個訪客,就要抓取數十萬個頁面。也就是說,你在為一份幾乎不產生回訪的抓取買單。

四個務實的因應動作

  • 先看清楚是誰在抓:分析 Nginx/Apache 存取日誌裡的 User-Agent,統計 GPTBot、ClaudeBot、PerplexityBot、CCBot、Bytespider 等各自的請求量和流量佔比,別憑感覺下結論。
  • 用 robots.txt 做分級而不是一刀切:允許能帶來曝光的檢索型爬蟲,限制純訓練型爬蟲;對你不希望被訓練的目錄(後台、會員區、重複的篩選頁)單獨 Disallow。
  • 在伺服器層加限速:robots.txt 只是君子協定,不守規矩的爬蟲要靠 Nginx 的 limit_req、limit_conn 按 User-Agent 或 IP 限速,必要時直接 return 403。
  • 把爬蟲開銷和真人體驗隔離:開啟頁面快取與 CDN,讓爬蟲命中快取而不是每次都打到應用和資料庫。

這輪變化對主機選型的影響

在機器人佔多數的流量結構下,共享主機的脆弱性被放大了:鄰居站台被爬爆,你的站台跟著變慢;流量超標還可能觸發限速或額外計費。獨立的 VPS 有專屬的 CPU、記憶體與頻寬,遇到爬蟲洪峰時你能自己動手限速、封鎖、調快取,而不是等客服回覆。

SharkCloud 各方案提供獨立 IP 與明確的資源規格,香港、日本、美國等節點可就近部署,方便你在 AI 爬蟲時代把成本和體驗都握在自己手裡。