AIエージェントは実際にどのようにWebをブラウズするのか
前提を疑う
ほとんどのWebサイト最適化は、訪問者がHTTP経由でページを取得し、ヘッダーを見て、リダイレクトをたどり、HTMLをレンダリングするという前提に立っています。AIエージェントはこれらの前提を一つ残らず崩します。
ChatGPT
ChatGPTのブラウジングツールはHTTP経由でページをライブで取得しますが、モデルは生のレスポンスを一切見ません:
- テキスト抽出のみ — HTMLは上限付きのプレーンテキスト抽出に削減されてからモデルに渡されます(正確な上限は非公開。コミュニティの計測では数千トークン程度)
- ヘッダーなし — モデルはContent-Type、ステータスコード、リダイレクトを把握しません
- SearchGPTの中間処理 — メインモデルにコンテンツが届く前に、二次モデルがプロンプトインジェクションをチェックします
- Agent Mode はChromeのUA(
Chrome/138.0.0.0)を装い、User-AgentではなくRFC 9421の暗号署名で識別します
これが意味すること: コンテンツネゴシエーションは内部的に動作しますが(ツールレイヤーが処理します)、モデルは抽出されたテキストのみを見ます。クリーンで構造化されたテキストを配信すれば、コンテンツはChatGPTにとってより有用になります。
Perplexity
Perplexityは多段階の取得パイプラインを使用しています:
- ステルスクローラー —
PerplexityBotではなく、汎用ChromeのUAとIPローテーションで1日300〜600万件のリクエストを送信 - ハイブリッドランキング — 関連するパッセージを見つけるためのBM25キーワードマッチング + ベクトル類似度
- アトミックスパン取得 — ページ全体ではなく、特定のテキストスパンを抽出
- 独自インデックス — Web検索結果と並行して独自のクロール済みインデックスを保持
これが意味すること: PerplexityBot 向けの robots.txt ルールは、彼らのステルスクローラーを止められない場合があります。明確な見出しを持つ構造化されたコンテンツは、彼らのスパン抽出が正しいパッセージを見つけるのに役立ちます。
Gemini
Geminiの最も一般的なブラウジングモードは、あなたのサーバーに一切到達しません:
- インデックスベース —
url_contextはライブHTTPではなく、Googleの内部インデックスから読み取ります。テスト時、サーバーログにリクエストは現れませんでした - スクリーンショットベース — Geminiのエージェント的ブラウジングモードは、必要なタスクではページを視覚的にレンダリングします(報道によれば、Project MarinerのプロトタイプはGeminiのエージェント機能に統合されました)
- markdownを拒否 — Gemini CLIは初期テストで
Accept: text/markdownレスポンスを拒否しました
これが意味すること: GeminiがあなたのサイトをみるためにはGooglebotでインデックスされている必要があります。HTMLに <link rel="alternate" href="/llms.txt"> を追加すれば、Googleがllms.txtの関係をインデックスすることが保証されます。JSON-LDの構造化データもインデックスパイプラインで生き残ります。
何をすべきか
| アクション | 効果のある対象 |
|---|---|
クリーンなmarkdownで llms.txt を配信 | ChatGPT、Perplexity |
<link rel="alternate" href="/llms.txt"> を追加 | Gemini(Googleインデックス経由) |
| JSON-LD構造化データを追加 | Gemini(Googleインデックス経由) |
robots.txtで Google-Extended をブロックしない | Gemini |
| ボット認証にRFC 9421署名を使用 | ChatGPT Agent Modeの検証 |
| 明確な見出しを持つ構造化コンテンツを配信 | Perplexityのスパン抽出 |
詳細情報
- Dejan.ai: Google's URL Context Tool
- Dejan.ai: AI Mode Is Not Live Web
- Cloudflare: Perplexity Stealth Crawlers
- SeatGeek: Chasing Signature
関連
アシスタントの背後にあるクローラー階層
上記の各アシスタントは、別々のrobots.txtトークンを持つ複数のボットから供給されています:学習クローラー(GPTBot、ClaudeBot)、検索インデックスクローラー(OAI-SearchBot、Claude-SearchBot、PerplexityBot)、ユーザー起点フェッチャー(ChatGPT-User、Claude-User、Perplexity-User)。1つの階層をブロックしても他には影響しません。AIエージェントUser-Agentリファレンスは各ボットの正確なUA文字列、robots.txtの挙動、IP検証を記載しています。robots.txtガイドは階層モデルとコピー&ペースト可能な許可/ブロックのパターンを解説しています。