2026 年、インターネットに歴史的な転換点が訪れました。自動化された要求が初めて人間の訪問を上回ったのです。業界の統計では、ウェブページの HTML を取得する要求のうち約 57.5% がボットによるもので、人間は 42.5% にとどまります。なかでも伸びが激しいのは AI の学習と索引付けのクローラーで、8 か月で 2.6% から 10.1% へ跳ね上がり、OpenAI の GPTBot は単独で 300% を超える伸びを示しました。

サイト運営者の請求額はなぜ上がったのか

自分のサイトで妙なことが起きていると気づく人は少なくありません。人間の訪問者は増えていないのに、帯域と CPU は明らかに増え、ページの応答が遅くなる。これは攻撃ではなく、たいてい AI クローラーが深く取得しているのです。学習用クローラーの一巡は、サイトの月間帯域のかなりの割合を食うことがあり、内容量の多いサイトでは AI クローラーがもたらす追加の流入が月あたりテラバイト規模に達することもあります。

最も痛いのは費用対効果

従来の検索エンジンはページを取得する代わりに、順位と流入という形で「返して」くれます。しかし AI クローラーは必ずしもそうではありません。ある調査では、主要な AI クローラーの一部が訪問者 1 人を送り返すごとに数十万ページを取得していることが分かりました。つまり、ほとんど戻ってこない取得のために支払っているのです。

四つの現実的な対応

  • 誰が取得しているかをまず把握する:Nginx や Apache のアクセスログの User-Agent を分析し、GPTBot、ClaudeBot、PerplexityBot、CCBot、Bytespider などの要求数と帯域の割合を測ってください。感覚で結論を出さないことです。
  • robots.txt は一律遮断ではなく段階付けに使う:露出をもたらす検索型クローラーは許可し、純粋な学習型は制限します。学習されたくないディレクトリ(管理画面、会員領域、重複する絞り込みページ)は個別に Disallow します。
  • サーバー側で速度を制限する:robots.txt は紳士協定にすぎません。守らないクローラーには Nginx の limit_req と limit_conn を User-Agent か IP で効かせ、必要なら 403 を返します。
  • クローラーの負荷と人間の体験を切り離す:ページキャッシュと CDN を有効にし、クローラーが毎回アプリとデータベースに届くのではなくキャッシュに当たるようにします。

この変化がホスティング選びに与える影響

ボットが多数を占める流入構造では、共用ホスティングの脆さが際立ちます。隣のサイトが取得攻めに遭えば自分も遅くなり、流入が上限を超えれば速度制限や追加課金が起こりえます。専用の VPS なら CPU、メモリ、帯域が自分のもので、クローラーの波が来たときに自分で速度制限、遮断、キャッシュ調整ができます。サポートの返信を待つ必要はありません。

SharkCloud の各プランは専用 IP と明確な資源の仕様を備え、香港、日本、米国などのノードで近接配置できます。AI クローラーの時代に、費用と体験を自分の手に握るための土台です。