実行環境と通信の制限

AIクローラーからサイトを守る|robots.txtの限界とCloudflareでの制御

AIクローラーは、学習用・検索/回答用・ユーザー代理用の3種類に分かれ、robots.txtだけでは止められません。
AI学習は止めたいが、AI検索からの流入は残したい、情シスやWeb担当の方の悩みに向けた記事です。
robots.txtの限界と、Cloudflareで何を制御できるか、ブロックする前の判断軸が分かります。

古野光太朗古野光太朗·2026.08.09·最終更新 2026.10.03·読了 13分
AIクローラーをrobots.txtの先で制御する。学習の許可と検索流入を別々に決める。

robots.txtだけで、AIクローラーを止められますか?

止められません。robots.txtはアクセス認可の仕組みではありません。学習用と検索用の方針を分け、必要な遮断はサーバー側で行います。

robots.txtは1994年に生まれ、2022年9月にIETFがRFC 9309として標準化しました。主要なAIクローラーは、いずれも公式ドキュメントでrobots.txtの尊重を明言しています。対象は、GPTBot、ClaudeBot、Google-Extended、PerplexityBotなどです。

ただし、標準化されていることと、強制力があることは別の問題です。robots.txtは、クローラーが自分でファイルを取得し、自分の意思で従って初めて機能します。サーバー側が技術的に遮断しているわけではありません。

さらに、判定に使うUser-Agentは自己申告の文字列です。送信側が自由に書けるため、「GPTBot」と名乗るリクエストが本物とは限りません。Cloudflareが検証済みボット(Verified Bots)の仕組みを用意しているのは、このためです。IPアドレス帯の照合や、Web Bot Authと呼ぶ暗号署名による検証を使います。

もう一つ見落としやすいのが、利用者の代理で動くボットです。ChatGPT-User、Claude-User、Perplexity-Userがその例です。利用者が質問した瞬間に、ページを取得します。OpenAIは、この種のリクエストにはrobots.txtのルールが適用されない場合があると明記しています。

Anthropicは、3種のボットすべてがrobots.txtを尊重するとしています。同時に、IPアドレスでのブロックには注意が必要だとしています。robots.txtを読む能力を妨げるため、適切または永続的に機能しない場合があるためです。

RFC 9309は、robots.txtの規則をアクセス認可の仕組みではないと明記します。悪意あるクローラーや、指示を無視するクローラーを止めるには、別の仕組みが必要です。ネットワークやサーバー側で、技術的に強制します。

学習利用と検索で見つけてもらうことを、別の判断にします。公開情報を広く読んでほしい会社と、会員向けコンテンツを守る会社では、許可する対象が異なります。検索用を止める場合は流入への影響をログで確かめます。

AIクローラーの制御は、どんな手順で進めますか?

現状把握、方針決定、設定、検証の4つを、影響範囲を確認しながら段階的に進めます。

AIクローラーの方針で確認する対象と、拒否または次の工程へ渡す条件を示した設計例です。
TechWorker作成:本文の手順を図にした設計例です。製品の公式画面や導入効果の実測ではありません。画像を押すと拡大できます。
  1. 現状を把握します。既存のrobots.txtを棚卸しします。Cloudflareを使っているなら、AI Crawl Controlのダッシュボードを開きます。どのクローラーがどれだけアクセスしているかを確認します。意図せず許可・ブロックされているクローラーがないかも見ます。
  2. 方針を決めます。次の3つの軸を分けて、情シス・広報・Web担当・経営で合意を取ります。
    • 学習利用への抵抗感:無断でモデルの学習データにされることに、コンプライアンス・著作権・競争優位の面で抵抗があるか。
    • AI検索・AI回答からの流入価値:ChatGPT検索、Perplexity、Gemini経由の参照を、集客に使うか。
    • コンテンツの性質:広告収益のページか、会員限定・有償か、採用情報やプレスリリースのように広く読まれてほしいページか。
  3. 設定します。robots.txtを整えます。Cloudflareを使っているなら、AI Crawl Controlで設定します。クローラーごとに、許可とブロックを設定します。必要に応じて、Super Bot Fight ModeやAI Labyrinthを併用します。全体ブロックになっていないかを確認します。
  4. 検証します。設定後は、アクセスログで反映を確認します。AI Crawl Controlの遵守状況の追跡機能で、指示に従わないクローラーがいないかも見ます。いれば、Bot ManagementやWAF側での遮断に切り替えます。

手順3の設定例を示します。robots.txtで、学習用は拒否し、検索用とユーザー代理用は許可する書き方です。

User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Allow: /

編集部による記載例です。Cloudflareの実画面や自動生成結果ではありません。クローラーの最新のトークンは、提供元の公式資料で確認してください。

CloudflareのAI Crawl Controlは、全プランでクローラーのアクセス状況、個別の許可・ブロック、robots.txtへの遵守状況を確認できます。2026年10月3日に公式の概要と管理手順を再確認しました。料金を得るPay Per Crawlは非公開ベータで、通常の遮断機能と分けて扱います。

設定例では、学習用のGPTBotと検索用のOAI-SearchBotを別に指定します。設定文字列だけで送信元の本人性は確認できません。User-Agentの条件と、提供元の公式IP情報や利用するCDNのボット判定を照合します。機微な情報をrobots.txtだけで守らず、認証された領域へ移してください。

AIクローラー対策がうまくいかない例には、どんなものがありますか?

robots.txtだけで終える、一律にブロックする、設定して放置する、の3つが典型です。

Web Bot Authのような暗号鍵ベースの検証が広がる前提なら、鍵の管理も設計の対象になります。この点はシークレット管理で扱っています。LLMを使った自社アプリ側の防御は、LLMアプリのガードレールで扱っています。管理画面の防御は、管理画面をVPNなしで守るも参考になります。

主要なAIクローラーは、何をしているのですか?

主要4社は、学習用・検索/回答用・ユーザー代理用でクローラーを使い分けています。

次の表は、各社の公式ドキュメント(2026年8月時点)に基づく整理です。robots.txtの指定には、表内のトークンで足ります。

提供元クローラー名(robots.txtトークン)種別用途
OpenAIGPTBot学習モデル学習用データの収集
OpenAIOAI-SearchBot検索・回答ChatGPT検索機能の検索結果への表示
OpenAIChatGPT-Userユーザー代理利用者がChatGPT等で質問した際のその場でのアクセス
AnthropicClaudeBot学習モデル学習用データの収集
AnthropicClaude-SearchBot検索・回答検索結果の品質向上のための分析
AnthropicClaude-Userユーザー代理利用者がClaudeに質問した際のその場でのアクセス
GoogleGoogle-Extended学習Gemini Apps・Vertex AI向けモデルの学習・グラウンディング
PerplexityPerplexityBot検索・回答検索結果への表示(学習データ収集には不使用と明記)
PerplexityPerplexity-Userユーザー代理利用者がPerplexityに質問した際のその場でのアクセス

Google-Extendedは、Googlebotとは別のトークンです。Google検索のインデックス作成やランキングには関与しません。ブロックしても検索順位には影響しないと、Google自身が公式ドキュメントで明記しています。

学習利用だけを止めたいなら、GPTBot・ClaudeBot・Google-Extendedをブロックします。検索・回答用とユーザー代理用のクローラーは許可します。この切り分けは、Search・Agent・Trainingの3分類で、そのまま扱えます。

よくある質問

robots.txtに書けば、法的にAI学習を禁止できますか?

RFC 9309が示すrobots.txtはアクセス認可の仕組みではありません。技術的に取得を拒否するには、サーバー側の認証や遮断が必要です。法的な効力は、国・契約・利用状況で異なるため、技術仕様だけから一律に断定しません。

Cloudflareを使っていない場合、AIクローラーは制御できませんか?

robots.txtは、Cloudflareを使わなくても設置できます。自社サーバーに設置するだけで、意思表示ができます。ただし「お願い」止まりである点は変わりません。実効性を持たせるには、自社のWebサーバーやCDN側でUser-Agent・IPアドレスによるアクセス制御を組みます。Cloudflare以外のボット対策製品を組み合わせる方法もあります。

AI学習をブロックすると、ChatGPTやPerplexityの検索・回答に自社サイトが出てこなくなりますか?

クローラーを区別せず一律にブロックした場合は、そうなります。ただし主要各社は、学習用と検索・回答用でクローラーを分けています。例は、OpenAIのGPTBotとOAI-SearchBotです。AnthropicのClaudeBotとClaude-SearchBotも同様です。学習用だけを止めて、検索・回答用は許可できます。Google-Extendedをブロックしても、通常のGoogle検索の掲載順位には影響しないと公式に明記されています。

一度設定すれば、あとは安心ですか?

いいえ。新しいAIクローラーは今後も増えますし、既存クローラーのUser-Agentや各社のポリシーも変わっていきます。robots.txtに従わないクローラーがいないかを、定期的にログで確認します。Cloudflareを使っているなら、AI Crawl Controlの遵守状況の追跡機能が使えます。実際の状況を定点観測する運用が欠かせません。

次の一歩は何から始めればよいですか?

まずアクセスしているクローラーを把握し、学習と検索で方針を分けてから設定します。

  1. robots.txtを棚卸しし、どのクローラーが来ているかを確認します。
  2. 学習利用、AI検索の流入価値、ページの性質の3軸で方針を決めます。
  3. 決めた方針に沿って許可・ブロックを設定し、実際のアクセスログで反映を確認します。

少なくとも学習用クローラーの扱いは、会社としての方針を持っておく必要があります。四半期に一度などの見直しを、運用に組み込んでください。

この記事は、どの資料をもとにしていますか?

2026年10月3日に上記3資料を確認しました。主要各社のボット表は2026年8月に確認した既存の掲載情報で、全社の最新仕様を今回再検証したものではありません。設定前に対象ボットの公式資料を確認してください。

古野光太朗
古野光太朗 / 株式会社TechWorker 代表取締役 CEO兼CTO

上場企業を含む37社・2,500名の生成AI導入・活用を支援。「AIはエンジンだ。コンテキストは燃料だ。」を掲げ、企業の業務文脈をAIが扱える形に整える「コンテキスト整理」を専門とする。

AIガバナンス・利用ルールの整備も、導入支援の一部としてご相談いただけます。

自社コンテンツをAIにどこまで使わせるかは、robots.txtの一行だけでは決まりません。クローラー種別ごとの方針整理から、Cloudflareなど既存インフラでの実装、情シス・広報・法務が合意できるルールづくりまで。上場企業を含む37社・2,500名の生成AI導入支援の知見をもとに、TechWorkerが技術と運用の両面から伴走します。

無料セキュリティ診断を見る →

関連サービス:生成AI法人研修 / 無料相談 / 事例集(無料DL)

← AIセキュリティ・ラボに戻る