「AI に勝手に学習されたくない。でも ChatGPT や Claude で自社が紹介されるのは困らない」。サイト運営者の相談で、この2つは同時に出てきます。
答えは robots.txt の書き方で両立できます。ただし、各社のクローラーが「学習用」「検索用」「利用者の操作」のどれなのかを取り違えると、学習を止めたつもりで AI 検索からも消える、という事故が起きます。
この記事では、OpenAI・Anthropic・Google・Apple・Meta の公式ドキュメントを開いて確認できた範囲だけで、クローラーの一覧・止めたときに起きること・BtoB サイトの推奨設定を整理します。Bing など一次出典を今日開けなかった会社は、あえて載せていません。仕様は 2026年10月時点のものです。
結論 — 先に要点だけ
- AI クローラーは3区分で考える。学習用(止めても検索表示に影響しない)、検索用(止めると AI 検索に出なくなる)、利用者操作(robots.txt が効かない場合がある)。
- 問い合わせを取りたい BtoB サイトは、学習用だけ止めて検索用は許可するのが出発点。全部止めると、AI 検索経由の接点も消える。
- Google の AI Overviews・AI モードは robots.txt のトークンでは制御しない。nosnippet・max-snippet と Search Console の除外設定が担当。
- robots.txt は「お願い」であり、強制ではない。利用者が起点のフェッチは各社とも robots.txt を無視しうると明記している。確実に止めるなら CDN・WAF 側の制御と組み合わせる。
- 変更の反映には1日かかる。Google・OpenAI・Meta のいずれも 24 時間前後のキャッシュを記載している。
※ 出典: Google — robots.txt の仕様の解釈/OpenAI — Overview of OpenAI Crawlers/Meta — Meta Web Crawlers(いずれも取得 2026-10)
3区分の定義 — 何を止めると何が起きるか
各社のクローラーは名前が似ていても役割が違います。まず区分を固定します。
| 区分 | 役割 | 止めたときに起きること | robots.txt の効き方 |
|---|---|---|---|
| 学習用 | 将来のモデルの学習データを集める | 以後の学習から除外される。検索や回答の表示は変わらない | 各社とも尊重すると記載 |
| 検索用 | AI 検索・回答の引用元として索引を作る | その AI の検索結果・回答に出なくなる | 各社とも尊重すると記載 |
| 利用者操作 | 利用者が URL を指定したときに取りに来る | 利用者の求めに応じた取得が止まる(場合による) | 「適用されない場合がある」「一般に無視する」と記載する会社がある |
この区分は OpenAI・Anthropic・Google・Apple・Meta の各文書で共通して読み取れます。以下、会社ごとに一次出典を示します。
各社のクローラー一覧【2026年10月時点】
OpenAI(ChatGPT)
| ユーザーエージェント | 区分 | 止めると起きること |
|---|---|---|
| GPTBot | 学習用 | 生成 AI 基盤モデルの学習に使わない意思表示になる。検索への表示は変わらない |
| OAI-SearchBot | 検索用 | ChatGPT 検索の回答に出なくなる。ナビゲーション用リンクとしては出る場合がある |
| ChatGPT-User | 利用者操作 | 利用者起点の操作のため robots.txt のルールが適用されない場合がある。検索の掲載可否にも使われない |
| OAI-AdsBot | 広告検証 | ChatGPT の広告として提出されたページだけを訪問。学習には使わないと記載 |
OpenAI の文書は、GPTBot と OAI-SearchBot の robots.txt 設定は互いに独立だと明記しています。検索の反映には robots.txt の更新から約 24 時間かかると書かれています。IP アドレスの一覧は各クローラーごとに JSON で公開されています。
※ 出典: OpenAI — Overview of OpenAI Crawlers(取得 2026-10)
Anthropic(Claude)
| ユーザーエージェント | 区分 | 止めると起きること |
|---|---|---|
| ClaudeBot | 学習用 | 以後の公開内容を AI モデルの学習データから除外する意思表示になる |
| Claude-SearchBot | 検索用 | 検索用の索引から外れ、利用者の検索結果での表示や正確さが下がりうる |
| Claude-User | 利用者操作 | 利用者の質問に応じた取得ができなくなり、利用者主導の Web 検索での表示が下がりうる |
Anthropic は3つとも robots.txt の標準的な指示を尊重すると記載しています。IP での遮断は確実な除外にならない場合があるとして、クローラーの IP 一覧を JSON で公開しています。
※ 出典: Anthropic ヘルプ — Does Anthropic crawl data from the web, and how can site owners block the crawler?(取得 2026-10)/IP 一覧: claude.com/crawling/bots.json(取得 2026-10)
Google(Gemini・AI Overviews・AI モード)
Google は「学習用のトークン」と「検索用のクローラー」が同じ Googlebot の訪問を共有する構造です。ここを取り違える相談が最も多い部分です。
| トークン/ユーザーエージェント | 区分 | 制御する範囲 |
|---|---|---|
| Google-Extended | 学習用(トークンのみ) | Gemini モデルの学習と、Gemini アプリ・Vertex AI でのグラウンディング。専用のユーザーエージェント文字列は持たない |
| Googlebot | 検索用 | Google 検索(Discover・画像・動画・ニュースを含む) |
| Google-CloudVertexBot | 依頼型 | サイト所有者の依頼で Vertex AI エージェント向けに取得。検索には影響しない |
| Google-Agent | 利用者操作 | Google 基盤上のエージェントが利用者の依頼で Web を閲覧・操作する |
| Google-GeminiNotebook | 利用者操作 | 利用者がソースとして追加した URL を取得する |
Google の文書は、Google-Extended は「Google 検索への掲載に影響せず、ランキングシグナルにも使わない」と明記しています。一方で AI Overviews・AI モードは Google-Extended の説明に登場しません。利用者起点のフェッチャー(Google-Agent など)については「一般に robots.txt のルールを無視する」と書かれています。
※ 出典: Google Search Central — Google の共通クローラー(取得 2026-10)/ユーザー トリガー フェッチャー(取得 2026-10)
Apple(Siri・Spotlight・Apple Intelligence)
| ユーザーエージェント | 区分 | 止めると起きること |
|---|---|---|
| Applebot | 検索用 | Spotlight・Siri・Safari の検索機能に使われるデータから外れる |
| Applebot-Extended | 学習用(トークンのみ) | Applebot が取得済みのデータを基盤モデルの学習に使わない。ページ自体はクロールしない |
Apple の文書には、Applebot-Extended を拒否しても検索結果には残り、ランキングにも使われないと書かれています。robots.txt に Applebot の記述が無く Googlebot の記述がある場合、Applebot は Googlebot 向けの指示に従います。Googlebot だけを厳しく絞っているサイトは、Apple の検索からも同じ範囲が外れる点に注意が要ります。
※ 出典: Apple サポート — About Applebot(取得 2026-10)
Meta(Meta AI・Facebook・Instagram)
| ユーザーエージェント | 区分 | 止めると起きること |
|---|---|---|
| meta-externalagent | 学習用 | 基盤モデルの学習や索引化による製品改善に使わない |
| meta-webindexer | 検索用 | Meta AI の回答で引用・リンクされにくくなる |
| meta-externalfetcher | 利用者操作 | 利用者の依頼で個別リンクを取得する。robots.txt を迂回しうると記載 |
| facebookexternalhit | リンクプレビュー | 共有リンクのタイトル・説明・サムネイルを取得。安全性確認では robots.txt を迂回しうる |
| meta-externalads | 広告 | 広告・ビジネス関連製品向けに Web コンテンツを収集 |
Meta の文書は、クローラーが robots.txt を最大 24 時間キャッシュするため、変更の反映に最大1日かかると記載しています。
※ 出典: Meta for Developers — Meta Web Crawlers(取得 2026-10)
Google の AI 機能は robots.txt では制御しない — 3つの手段の使い分け
Google 検索の AI Overviews・AI モードへの表示を調整したい場合、担当する設定は robots.txt の外にあります。
| やりたいこと | 使う設定 | 影響しないもの |
|---|---|---|
| Gemini の学習・グラウンディングに使わせない | robots.txt の Google-Extended | 検索の掲載・順位・AI Overviews の表示 |
| AI Overviews・AI モードへの直接入力をやめさせる | robots メタタグの nosnippet | インデックス登録・通常の掲載 |
| AI Overviews・AI モードに使われる分量を絞る | robots メタタグの max-snippet | インデックス登録・通常の掲載 |
| 生成 AI 機能にリンクと内容を出さない | Search Console の除外設定 | AI の学習(別の話) |
Google の robots メタタグの文書は、nosnippet が「AI Overviews と AI モードへの直接入力としての利用も防ぐ」こと、max-snippet が「直接入力として使える分量も制限する」ことを明記しています。
※ 出典: Google Search Central — robots メタタグ、data-nosnippet、X-Robots-Tag(取得 2026-10)
Search Console の除外設定は、生成 AI レポートと除外設定の記事で手順を扱っています。
もう1点、Google の生成 AI 向けガイド(2026-07-10 更新)は「Google 検索に出るために新しい機械可読ファイルや AI 向けテキストファイル、マークアップ、Markdown を作る必要はない」と明記しています。llms.txt を置いても Google 検索では無視されるという意味で、llms.txt の記事で扱った用途は Google 以外のサービス向けだと読み替えてください。
※ 出典: Google Search Central — Optimizing your website for generative AI features(2026-07-10 更新・取得 2026-10)
robots.txt の仕様で押さえる5点(Google の実装基準)
書き方を間違えると、意図と逆の結果になります。Google が公開している仕様から、事故につながりやすい点を抜き出します。
| 項目 | 仕様 |
|---|---|
| 置き場所 | サイトのホストのルート直下。プロトコル・ホスト・ポートごとに別の robots.txt が必要 |
| 文字コード・サイズ | UTF-8。Google は 500 KiB を上限とし、超えた分は無視する |
| グループの一致 | ユーザーエージェントは「最も具体的に一致する1グループ」だけが適用される。* のグループは、名指しされたエージェントには適用されない |
| ルールの優先 | パスが長い(より具体的な)ルールが勝つ。競合したら制限が緩い側 |
| キャッシュ | 通常 24 時間までキャッシュ。4xx(429 を除く)は「制限なし」扱い。5xx は最初の 12 時間クロール停止、その後 30 日は最後の正常版を使う |
※ 出典: Google Search Central — Google による robots.txt の仕様の解釈(取得 2026-10)/robots.txt の書き方(取得 2026-10)
「最も具体的な1グループだけ」の仕様は、AI クローラー設定で特に効きます。User-agent: GPTBot のグループを作った瞬間、User-agent: * に書いた Disallow は GPTBot には適用されなくなります。管理画面や検索結果ページを * で止めているサイトは、AI クローラーのグループにも同じ Disallow を書き直す必要があります。
もう1つ、robots.txt は「クロールのお願い」であり、インデックスからの除外手段ではありません。Google は、他のページからリンクされていれば Disallow した URL でも索引に載りうると明記し、検索結果から外したいなら noindex かパスワード保護を使うよう案内しています。
※ 出典: Google Search Central — robots.txt の概要(取得 2026-10)
サイト類型別の判断表
| サイトの型 | 学習用 | 検索用 | 利用者操作 | 考え方 |
|---|---|---|---|---|
| BtoB のリード獲得サイト(会社サイト・サービス紹介) | 止めてよい | 許可 | 許可 | AI 検索での言及・引用が見込み客との接点になる。学習だけ止めれば十分 |
| 有料会員向けメディア・データベース | 止める | 要検討 | 要検討 | 要約で価値が失われるなら、まず max-snippet・nosnippet で抜粋を絞る |
| EC サイト | 止めてよい | 許可 | 許可 | 商品情報が AI の回答に出る価値が大きい。在庫・価格が古く引用されないよう構造化データを整える |
| 採用サイト・IR | 止めてよい | 許可 | 許可 | 求職者・投資家が AI に質問する場面が増えている |
| 社内向け・限定公開ページ | 止める | 止める | 止める | そもそも robots.txt で守らない。認証をかける |
学習用を「止めてよい」としているのは、各社の文書が一致して「学習の拒否は検索・回答の表示に影響しない」と書いているためです。逆に、学習用を許可する判断も間違いではありません。自社の情報が将来のモデルに正しく学ばれることを望む会社もあります。ここは経営判断で、技術的な正解はありません。
コピペで使える robots.txt の例
例1 — BtoB サイトの標準形(学習用だけ止める)
User-agent: *
Disallow: /admin/
Disallow: /search
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: Applebot-Extended
Disallow: /
User-agent: meta-externalagent
Disallow: /
Sitemap: https://www.example.co.jp/sitemap.xml
検索用(OAI-SearchBot・Claude-SearchBot・meta-webindexer・Googlebot・Applebot)には何も書かないため、* のグループが適用されて通常どおり取得されます。/admin/ と /search の Disallow は、* のグループにいるクローラーにだけ効く点に注意してください。
例2 — 検索用も含めて AI 系を止める(有料メディア向け)
User-agent: GPTBot
User-agent: OAI-SearchBot
User-agent: ClaudeBot
User-agent: Claude-SearchBot
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: meta-externalagent
User-agent: meta-webindexer
Disallow: /
User-agent: *
Disallow: /admin/
Disallow: /search
Sitemap: https://www.example.co.jp/sitemap.xml
この形でも、ChatGPT-User・Claude-User・Google-Agent・meta-externalfetcher のような利用者操作のフェッチは止まらない場合があります。Googlebot と Applebot は止めていないので、通常の検索には残ります。
例3 — 特定ディレクトリだけ AI の引用から外す
User-agent: OAI-SearchBot
User-agent: Claude-SearchBot
Disallow: /members/
Disallow: /pricing-internal/
Google 検索の AI 機能に対しては、同じディレクトリのページに <meta name="robots" content="nosnippet"> を入れるか、max-snippet で分量を絞ります。
設定前のセルフチェック(10項目)
- 自社サイトの目的は「問い合わせ・購入」か「コンテンツ課金」か。前者なら検索用は許可が出発点
- 現在の robots.txt に
User-agent: *の Disallow があるか。あるなら AI クローラーのグループにも書き直したか - robots.txt は UTF-8 で、Google の上限サイズ(上の仕様表)を超えていないか
- サブドメイン(例: blog.・help.)ごとに robots.txt を置いたか
- Google-Extended を「AI Overviews 対策」だと思って書いていないか(担当が違う)
- AI Overviews・AI モードの抜粋を絞りたいなら、nosnippet か max-snippet を対象ページに入れたか
- Search Console の「生成 AI」の除外設定の現在値を確認したか
- CDN(Cloudflare など)側の AI クローラー設定と robots.txt が矛盾していないか
- 変更の翌日以降にアクセスログで各ユーザーエージェントの来訪を確認する予定を入れたか
- robots.txt を「非公開ページの防御」に使っていないか(認証で守る)
Cloudflare を使っているサイトは、AI Crawl Control がすべてのプランで使え、クローラー単位の許可・ブロックと、robots.txt の指示に従っているかの追跡ができると文書に書かれています。設定の考え方はCloudflare の AI クローラー新デフォルトの記事で扱いました。
※ 出典: Cloudflare Docs — AI Crawl Control(取得 2026-10)
よくある失敗5パターン
- 学習を止めたつもりで AI 検索から消える。OAI-SearchBot や Claude-SearchBot まで Disallow してしまい、ChatGPT・Claude の回答から自社が出なくなる。学習用と検索用の表を見て、名前を1つずつ確認する。
*の Disallow が AI クローラーに効いていると思い込む。AI クローラー用のグループを作った時点で*は適用されない。管理画面・検索結果ページの Disallow を各グループに複製する。- Google-Extended で AI Overviews を止めようとする。Google-Extended は Gemini の学習とグラウンディングの制御で、AI Overviews・AI モードの表示は nosnippet・max-snippet・Search Console の除外設定の担当。
- 変更直後にログを見て「効いていない」と判断する。各社とも robots.txt をキャッシュしている(上の仕様表と各社の出典を参照)。翌日以降に確認する。
- robots.txt で非公開ページを守ろうとする。robots.txt は公開ファイルで、Disallow したパスの一覧がそのまま「見られたくない場所の地図」になる。認証で守る。
設定から確認までの手順
- 現状を取る。
https://自社ドメイン/robots.txtをブラウザで開き、現在の内容を保存する。サブドメインも同様。 - 方針を決める。上の判断表で学習用・検索用・利用者操作の3つに答えを出し、社内で記録する。
- 書く。例1か例2を土台に、
*の Disallow を各グループへ複製してから保存する。 - 検証する。Search Console の robots.txt レポートで構文エラーを確認する。Google はオープンソースの robots.txt ライブラリも公開している。
- 翌日以降にログを見る。GPTBot・OAI-SearchBot・ClaudeBot・Claude-SearchBot・Google-Extended などのユーザーエージェント別に、意図どおりの応答(許可したものは 200、止めたものは来訪が減る)になっているかを確認する。
- 四半期ごとに見直す。クローラーの名前と役割は年に何度も変わる。各社の公式ページ(下の資料集)を見直す日を決める。
公式資料集
- OpenAI — Overview of OpenAI Crawlers
- Anthropic — クローラーとブロック方法のヘルプ
- Google — 共通クローラー一覧(Google-Extended を含む)
- Google — robots.txt の仕様の解釈
- Google — robots メタタグ(nosnippet・max-snippet)
- Apple — About Applebot
- Meta — Meta Web Crawlers
よくある質問
Q. AI クローラーは全部ブロックしたほうが安全ですか?
目的によります。学習用(GPTBot・ClaudeBot・Google-Extended・Applebot-Extended・meta-externalagent)を止めても、各社の文書では検索や AI の回答での表示には影響しないと書かれています。一方で検索用(OAI-SearchBot・Claude-SearchBot・meta-webindexer)を止めると、ChatGPT 検索や Claude の検索結果に出なくなります。問い合わせを増やしたい BtoB サイトは、学習用だけ止めて検索用は許可する形が出発点です。
Q. robots.txt を直したら、すぐに反映されますか?
すぐには反映されません。Google は robots.txt を通常 24 時間までキャッシュし、OpenAI も検索の反映に約 24 時間かかると記載しています。Meta もクローラーが最大 24 時間キャッシュすると書いています。変更から1日は様子を見てから、アクセスログで確かめてください。
※ 出典: Google — robots.txt の仕様の解釈/OpenAI — Overview of OpenAI Crawlers/Meta — Meta Web Crawlers(いずれも取得 2026-10)
Q. Google-Extended をブロックすると AI Overviews に出なくなりますか?
Google の文書では、Google-Extended は Gemini モデルの学習と Gemini アプリ・Vertex AI でのグラウンディングを制御するトークンで、Google 検索への掲載や順位には影響しないと書かれています。AI Overviews・AI モードへの表示は Google-Extended の対象として挙げられておらず、nosnippet や max-snippet、Search Console の除外設定で制御します。
Q. ChatGPT-User や Claude-User は robots.txt で止められますか?
確実には止められません。OpenAI は ChatGPT-User について「利用者が起点の操作なので robots.txt のルールが適用されない場合がある」と記載し、Google も利用者起点のフェッチャーは一般に robots.txt を無視すると書いています。Anthropic の Claude-User は robots.txt を尊重すると記載されています。止めたい場合は CDN や WAF 側の制御を組み合わせます。
Q. 今の設定で、自社が AI 検索に出る状態になっているか分かりますか?
robots.txt の確認は上の手順でできます。加えて、自社の会社名やサービス名が AI の回答でどう扱われているかは、LLMO 無料チェックで確かめられます。クローラーを許可していても、引用される構造になっていなければ回答には出ません。その整え方は LLMO(AI 検索最適化)のハブにまとめています。
次の一歩
まず、自社の robots.txt を開いて、上の判断表に沿って「学習用・検索用・利用者操作」の3つに答えを出してください。例1をそのまま使える会社が大半です。
「* のルールが複雑で複製の影響が読めない」「Cloudflare や WAF の設定と重なっていて、どこで止まっているか分からない」「AI 検索に出したいが、引用される形になっていない」という場合は、現在の robots.txt とサイト構成を添えてお問い合わせください。確認結果と、優先順位を付けた実装ステップを書面でお戻しします。契約前提ではありません。
更新履歴
- 2026-10-11: 初版公開