# AI クローラ(ClaudeBot / GPTBot 等)も含めて許可する方針(2026-07-29 の判断)。 # 無名の新設サイトにとっては、学習に使われる不利より、AI の回答から # 参照される露出のほうが価値が大きい。守りはレート制限で行う # (nginx 側。docs/SERVER.md を参照)。 # # 拒否に転じる場合は User-agent: ClaudeBot のようにブロックを足す。 # # 絞り込みは全てリンク(GET)にしてある。JS に頼らないための設計だが、 # カテゴリ・サイズ・こだわり条件・エリア・並び順を掛け合わせると URL は # 無限に近く増える。中身は同じスポットの並べ替えでしかないので、 # クロールさせる意味がなく、重複コンテンツにもなる。 # 「/」自体(絞り込みの入口)だけは Allow で読ませる。 # # 実測1: 2026-07-29、ClaudeBot が 228,242 件のうち 227,381 件を # 「/」+ クエリに費やし、サーバーの CPU が6時間 94〜97% で張り付いた。 # 実測2: 2026-08-04、meta-externalagent が 125 IP に分散して約 180req/分。 # 当時の robots.txt は User-agent 行とルールの間に空行・コメントを挟んでいて、 # 厳格なパーサーには「ルールなしグループ=全許可」と読めた。 # だから今の形にしてある: **User-agent 行とルールの間に空行やコメントを入れない**。 # # スポット詳細(/spots/…)とエリア別ガイド(/areas/…)はクエリを # 持たないので Disallow に当たらない。sitemap.xml から辿れる。 User-agent: * Disallow: /*? Disallow: /admin Allow: /$ # Meta の AI 学習クローラ。念のため名指しでも同じルールを与える # (名指しグループがあると * は適用されないので、全ルールを書く)。 # Crawl-delay は Meta 公式には未サポートだが、害はないので置いておく。 User-agent: meta-externalagent Disallow: /*? Disallow: /admin Allow: /$ Crawl-delay: 10 Sitemap: https://pochica.jp/sitemap.xml