アクセス・案内・インデックスを分けて考える
robots.txtはクローラーに対するアクセス指示で、対応するクローラーへ取得してよいパス/避けてほしいパスを伝えます。ただし認証や強制的なセキュリティ境界ではありません。llms.txtは言語モデル系ツールへサイト内の有用な情報を案内するための新しい慣行として提案されているもので、標準化されたアクセス制御として扱うものではありません。X-Robots-TagはHTTPレスポンスでnoindex、nofollow、スニペット制限などを伝えるための指示です。
何を制御したいかで選ぶ
- 「このパスを取得してよいか」を決めたいならrobots.txtと各クローラー提供元の仕様を確認します。
- 「サイトの主要情報を簡潔に案内したい」ならllms.txtを補助的な案内として検討します。
- 「取得されたレスポンスをインデックスさせるか、スニペットに出すか」を扱うならX-Robots-Tagやmeta robotsを使います。
ベンダー固有ルールは見直せる形にする
AIクローラーのUser-agent名やサービス方針は変更される可能性があります。User-agentごとのブロックを分け、なぜその設定を入れたかを記録し、方針変更時には提供元ドキュメントを再確認します。クロール・検索インデックス・学習利用を1つのファイルだけで一括制御できると考えないことが重要です。