BlueprintLab Guide

robots.txt・noindex・sitemap・canonical、何が違う?

SEOまわりは似た名前の設定が多いですが、役割は別です。「止める」「載せない」「正規を示す」「見つけてもらう」に分けると整理しやすくなります。

4つとも検索エンジン向け。でも、やっていることは別なんです

robots.txt、noindex、sitemap、canonical。SEOを触り始めると一気に出てくる言葉です。しかも全部「Googleに何か伝えるもの」に見えるので、混ざりやすいんですよ。

ざっくり分けると、robots.txtはクロール制御、noindexは検索結果への掲載可否、canonicalは正規URLのヒント、sitemapはURL発見の補助です。まず役割を分けます。

robots.txtは「ここを取りに来ないで」のお願い

クローラーが特定パスへアクセスするかを制御します。ただし、これはパスワードではありません。秘密ページを守る用途には使えません。

さらに、Disallowしたから検索結果から必ず消えるわけでもありません。外部リンクなどからURLだけ知られていると、内容を読まずURLが表示される場合があります。

検索結果へ載せたくないならnoindex。ただし読みに来てもらう必要があります

noindexはページを読んだクローラーへ「検索結果には載せないで」と伝える仕組みです。ここでrobots.txtでも同時にブロックすると、クローラーがnoindex自体を読めないことがあります。

「クロールさせたくない」と「インデックスさせたくない」は似ていますが、目的が違うんです。

canonicalは、似たURLの代表を伝えるもの

同じ商品や同じ内容がパラメータ違いで複数URLに出るとき、「できればこちらを正規として扱ってください」と示すのがcanonicalです。

リダイレクトの代わりではなく、検索エンジンへのシグナルです。自分自身をcanonicalにする自己参照canonicalもよく使われます。

sitemapは「このURLがあります」の一覧

サイトマップは、インデックスさせたい正規URLを見つけてもらうための補助です。だから404、リダイレクト、noindex URLを大量に混ぜるより、公開中のcanonical URLを中心にした方が管理しやすいです。

4つを一度に覚えようとせず、「止める・載せない・代表・一覧」と覚えるとかなり楽になります。

設定が矛盾していないか、最後に1URLで確認します

サイト全体の設定を眺めるより、代表URLを1つ選んで「クロールしてほしい? 検索結果へ載せたい? 正規URLはどれ?」と順番に答える方が整理しやすいです。

たとえば公開記事なら、robots.txtで止めない、noindexを付けない、canonicalは正規URL、sitemapにも正規URLを入れる。この4つが同じ方向を向いているかを見ます。

関連するツール・早見表

関連する分野

参考情報