BlueprintLab Guide
robots.txt・noindex・sitemap・canonical、何が違う?
SEOまわりは似た名前の設定が多いですが、役割は別です。「止める」「載せない」「正規を示す」「見つけてもらう」に分けると整理しやすくなります。
4つとも検索エンジン向け。でも、やっていることは別なんです
robots.txt、noindex、sitemap、canonical。SEOを触り始めると一気に出てくる言葉です。しかも全部「Googleに何か伝えるもの」に見えるので、混ざりやすいんですよ。
ざっくり分けると、robots.txtはクロール制御、noindexは検索結果への掲載可否、canonicalは正規URLのヒント、sitemapはURL発見の補助です。まず役割を分けます。
robots.txtは「ここを取りに来ないで」のお願い
クローラーが特定パスへアクセスするかを制御します。ただし、これはパスワードではありません。秘密ページを守る用途には使えません。
さらに、Disallowしたから検索結果から必ず消えるわけでもありません。外部リンクなどからURLだけ知られていると、内容を読まずURLが表示される場合があります。
検索結果へ載せたくないならnoindex。ただし読みに来てもらう必要があります
noindexはページを読んだクローラーへ「検索結果には載せないで」と伝える仕組みです。ここでrobots.txtでも同時にブロックすると、クローラーがnoindex自体を読めないことがあります。
「クロールさせたくない」と「インデックスさせたくない」は似ていますが、目的が違うんです。
canonicalは、似たURLの代表を伝えるもの
同じ商品や同じ内容がパラメータ違いで複数URLに出るとき、「できればこちらを正規として扱ってください」と示すのがcanonicalです。
リダイレクトの代わりではなく、検索エンジンへのシグナルです。自分自身をcanonicalにする自己参照canonicalもよく使われます。
sitemapは「このURLがあります」の一覧
サイトマップは、インデックスさせたい正規URLを見つけてもらうための補助です。だから404、リダイレクト、noindex URLを大量に混ぜるより、公開中のcanonical URLを中心にした方が管理しやすいです。
4つを一度に覚えようとせず、「止める・載せない・代表・一覧」と覚えるとかなり楽になります。
設定が矛盾していないか、最後に1URLで確認します
サイト全体の設定を眺めるより、代表URLを1つ選んで「クロールしてほしい? 検索結果へ載せたい? 正規URLはどれ?」と順番に答える方が整理しやすいです。
たとえば公開記事なら、robots.txtで止めない、noindexを付けない、canonicalは正規URL、sitemapにも正規URLを入れる。この4つが同じ方向を向いているかを見ます。