検索エンジンクローラー用のrobots.txtは何ができるのか

robots.txtは何を制御でき、何を制御できないのか

robots.txtはクローラーへ巡回ルールを伝える仕組みですが、非公開化、検索結果からの削除、情報保護を保証するものではありません。SEOやAIクローラー対策で誤解しやすい役割を解説します。

robots.txtは入口の案内であり、鍵ではない

robots.txtは、サイトを巡回するクローラーに対し、どのURLへアクセスしてよいかを伝える公開ファイルです。通常はドメイン直下の /robots.txt に置きます。

誰でも閲覧でき、協力するクローラーがルールを解釈する仕組みです。会員ページや社内資料を守る認証機能ではありません。

できること

クローラーごとに、特定のパスを巡回対象から外したり、一部だけ許可したりできます。検索結果、カート、管理用URLなど、巡回させる必要がない領域の負荷調整に使われます。

User-agent: *
Disallow: /internal-search/
Disallow: /cart/

Sitemap: https://example.com/wp-sitemap.xml

できないこと

  • URLを知っている人からページを隠すこと
  • パスワードの代わりに情報を保護すること
  • すべてのクローラーが必ずルールを守ると保証すること
  • すでに検索結果へ出ているURLを即座に削除すること
  • ページ内の古い情報や誤情報を直すこと

検索結果から消したい場合は別の対応が必要

検索結果に表示させたくないページは、状況に応じてnoindex、削除後の適切なHTTPステータス、検索エンジンの削除ツールなどを検討します。robots.txtで巡回を止めると、検索エンジンがページ内のnoindexを確認できなくなる場合があります。

個人情報や機密情報は、robots.txtではなく認証、アクセス制御、公開停止で守ります。

AIクローラーも名前と目的を確認する

AI関連のクローラーは一種類ではなく、検索用、回答用、学習用など事業者によって役割が分かれる場合があります。インターネット上の一覧だけをコピーせず、各サービスの公式情報でUser-agentと目的を確認します。

制御方針は、検索で見つけてもらいたいのか、回答へ利用してよいのか、学習利用をどう考えるのかを社内で決めてから記述します。

WordPressでは実際の出力を確認する

WordPressやSEOプラグインが仮想的なrobots.txtを出力している場合があります。管理画面の設定だけで判断せず、ブラウザで /robots.txt を開いて本番の内容を確認します。

サイトをリニューアルした後は、開発中のDisallowが残っていないか、サイトマップURLが正しいかも確認します。

変更理由と確認日を残す

短いファイルでも、なぜそのクローラーやパスを制御したのかを記録します。サービス名やサイト構成が変わると、古いルールが意味を失うことがあります。

robots.txtは一度置いて終わりではなく、検索方針、AI利用方針、サイト構成と一緒に見直す運用ファイルです。

まとめ

robots.txtで制御できるのは、協力するクローラーの巡回です。非公開化、検索結果削除、情報保護とは役割が違います。目的を明確にし、公式のUser-agent情報と本番出力を確認して運用します。