robots.txtチェックとサイトマップ確認
このrobots.txtチェックでは、入力したURLをGooglebot、Bingbot、GPTBotやClaudeBotなどのAIクローラーが取得できるかどうかと、その判断を決めたルールを表示します。書式の誤りも指摘し、サイトマップのURL数、別ホストのURL、lastmodの形式も確認します。
計算方法
クローラーはrobots.txtをこう読む
robots.txtは必ずホストのルート(https://example.com/robots.txt)に置き、そのホストとプロトコルにだけ適用されます。書式は2022年にRFC 9309として標準化されました。
- グループ:1行以上の
User-agentの下にAllowとDisallowを書きます。クローラーは自分の名前のグループだけに従い、なければUser-agent: *のグループに従います。 - 長いルールが優先:
Disallow: /shopとAllow: /shop/saleがあれば、/shop/sale/1 は許可です。同じ長さならAllowが優先です。 - ワイルドカード:
*は任意の文字列、$はURLの末尾を表します。Disallow: /*.pdf$ですべてのPDFをブロックできます。 - ファイルがない(404)場合はすべてクロール可能です。5xxエラーのときはGoogleがクロールを止めます。
Googleが読むのは user-agent・allow・disallow・sitemap だけで、読み込むのは最大500 KiBです。Crawl-delay と Noindex はGoogleでは無視されるため、このツールで注意を表示します。
クロールを止めてもインデックスは止まらない
ブロックしたURLでも、ほかのページからリンクされていれば説明文なしで検索結果に出ることがあります。確実にインデックスから外すには noindex(メタタグまたはX-Robots-Tag)を使い、クロールは許可したままにします。ブロックしているとGoogleはnoindexを読めません。
AIクローラーの拒否とサイトマップ
GPTBot(OpenAI)、ClaudeBot(Anthropic)、Google-Extended(GoogleのAIモデルでの利用)、CCBot(Common Crawl)も判定します。拒否したいボットごとに User-agent: GPTBot と Disallow: / のグループを書けばAI拒否ができます。続けて、robots.txtに書かれた最初のサイトマップ(なければ /sitemap.xml)を確認します。上限は1ファイル50,000 URL・50 MBで、同じホストのURLだけを入れ、lastmod はW3C形式で書きます。新しく作るならサイトマップ作成ツールが便利です。gzip圧縮(.xml.gz)のサイトマップは展開せず、大きなファイルは2 MBまで読み込みます。
よくある質問
robots.txtとは何ですか?
サイトのルートに置くテキストファイルで、検索エンジンなどのクローラーにどの範囲を巡回してよいかを伝えます。アクセス制限の仕組みではないため、悪意のあるボットは無視しますし、パスワードの代わりにもなりません。
robots.txtの確認方法を教えてください。
サイト内のページのURLを入力して「robots.txtをチェック」を押してください。Googlebot、Bingbot、AIクローラー、その他のクローラーごとに、そのURLが許可されているかと決め手のルールが表に表示されます。Search Consoleのrobots.txtレポートでも確認できます。
「Disallow: /」はどういう意味ですか?
スラッシュはすべてのパスを表し、そのグループのクローラーは何も取得できません。User-agent: * の下に書くとサイト全体がすべてのクローラーからブロックされるため、テスト環境以外では使わないようにしましょう。
AIの学習を拒否するにはどう書けばいいですか?
拒否したいクローラーごとにグループを作り、User-agent: GPTBot の次の行に Disallow: / と書きます。GoogleのAIモデルでの利用を止めるには Google-Extended、Anthropicなら ClaudeBot を指定します。
「robots.txtによりブロックされました」と出たページが検索結果に出るのはなぜですか?
robots.txtが止めるのは取得だけです。ほかのページからリンクされていると、Googleは説明文なしでURLを表示することがあります。検索結果から外すには、noindexを設定してクロールを許可してください。
出典・根拠
- RFC 9309 – Robots Exclusion Protocol
- Google Search Central – How Google interprets the robots.txt specification (500 KiB, supported fields, 5xx handling)
- sitemaps.org – Sitemaps XML format (50,000 URLs, 50 MB, single host, W3C Datetime)
- W3C – Date and Time Formats (W3C Datetime)
- OpenAI – Overview of OpenAI crawlers (GPTBot)
- Google – Overview of Google common crawlers (Google-Extended)
更新日:
関連ツール
- サイトマップXML作成:URL一覧からsitemap.xmlを生成サイトマップXMLをURL一覧から作成。Sitemapsプロトコルに沿ったsitemap.xmlを生成し、エラーチェックとダウンロードまで対応。登録不要、ブラウザ内で完結します。
- SEOチェック:URLを入れて無料診断URLを入れるだけの無料SEOチェック。title・ディスクリプションの幅、H1、canonical、hreflang、noindex、OGP、構造化データ、altを点数と改善策で表示。
- リダイレクトチェックツールURLのリダイレクトチェックを無料で。301・302・307・308のステータスコード、転送先、応答時間を1段ずつ表示し、チェーンやループ、HTTPSの問題を見つけます。
- HTTPヘッダー確認とセキュリティ評価URLのHTTPヘッダー確認ツール。すべてのレスポンスヘッダーを一覧表示し、HSTS・CSP・X-Frame-Options・Referrer-PolicyなどのセキュリティヘッダーをA〜Fで評価します。
- HTTPステータスコード一覧HTTPステータスコード一覧。200、301、404、500など40以上のコードの意味と原因を解説し、コードやキーワードでの検索、クラス別の絞り込みにも対応しています。
- ASCIIコード表(10進・16進・8進・2進)とUnicode検索ASCIIコード表(0〜127)とLatin-1(128〜255)を10進・16進・8進・2進・HTML実体参照つきで一覧。制御文字も掲載。任意のUnicode文字も検索でき、UTF-8も確認できます。