クローラーとは何か
クローラーとは、検索エンジンがWeb上のページを自動で巡回し、内容を読み取って集めるためのプログラムのことです。「ボット」「スパイダー」とも呼ばれます。GoogleのクローラーはGooglebotという名前で知られています。
クローラーが行う巡回の動作そのものを「クローリング」と呼びます。クローリングは、検索エンジンが世界中のページを把握するための最初のステップです。人間が手作業で全ページを見て回るのは不可能なので、プログラムが自動で延々と巡回し続けています。
重要なのは、クローリングは「ページの存在と内容を知る」段階であって、検索結果に載せる段階とは別物だという点です。集めたページをどう扱うかは、後段のインデックス登録という別の工程で決まります。
クローラーはどうやってページを見つけるか
クローラーは主にリンクをたどってページを発見します。あるページからリンクされていれば、そのリンク先へ移動して内容を読み取り、さらにそのページにあるリンクをたどる、という連鎖でWeb全体を巡っていきます。
リンク以外の入り口としては、サイト運営者が用意するXMLサイトマップがあります。サイトマップにページのURL一覧を書いておくと、クローラーが巡回先を効率よく把握しやすくなります。新しいサイトや、内部リンクが少ないページでは特に役立ちます。
実務ではどこで関係する?
クローラーは言葉の意味だけ覚えても、HTML共有の判断にはつながりません。実務では「表示に関係する話か」「検索に関係する話か」「アクセス制限に関係する話か」を分けて考えると整理しやすくなります。
クローラー・クローリングについて迷ったら、相手が安全に開けるか、検索に出してよいか、ブラウザや環境差で壊れないかを順番に確認します。用語理解は、その判断を早くするための道具として使います。手順が決まったら、HTML/ZIPをアップロードして共有URLを発行し、相手に確認してほしい観点と期限を添えて送ります。
- 表示の話: HTML/CSS/JS、パス、ブラウザ互換性を確認する
- 検索の話: noindex、canonical、sitemap、robots.txtの役割を分ける
- 制限の話: URL共有、パスワード、メール認証、会社ドメイン認証を混同しない
- 運用の話: 期限、差し替え、削除、共有メッセージまで決める
クローラーが巡回する流れ
クローラーがページを処理する大まかな順序は次のとおりです。実際の検索エンジンの内部はもっと複雑ですが、基本の流れをつかんでおくと挙動を理解しやすくなります。
- 巡回対象のURLを発見する(リンクやサイトマップ経由)
- そのページにアクセスしてHTMLを取得する
- robots.txt などのルールでアクセス可否を確認する
- ページ内のテキストやリンクを読み取る
- 見つけた新しいリンクを次の巡回候補に追加する
クロールを制御する仕組み
サイト運営者はクローラーの動きをある程度コントロールできます。代表的なのが robots.txt というファイルで、ここに「このディレクトリは巡回しないでほしい」といった指示を書けます。ただしこれはあくまでクローラーへのお願いであり、すべてのボットが従うとは限りません。
また、サーバーの負荷を避けるため、クローラーはアクセス頻度を調整しながら巡回します。大量のページがあるサイトでも一度に全部を読み込むわけではなく、時間をかけて少しずつ回ることが多いです。
よくある誤解と確認の場面
「サイトを公開すればすぐクローラーが来る」と思われがちですが、実際は発見されるまでに時間がかかることがあります。逆に「クロールされた=検索結果に出た」とも限りません。クロールとインデックスは別の段階だからです。
なお、まだ公開前の確認用ページや、関係者だけに見せたいページにクローラーを来させたくない場面もあります。ギガサイト便で発行する一時公開ページには noindex が付与され検索結果に出ませんが、noindex はアクセス制御ではないため、関係者以外に見せたくないときはパスワードやメール認証などを併用するのが安全です。
よくある質問
クローラーとクローリングの違いは何ですか?
クローラーは巡回を行うプログラムそのもの、クローリングはそのプログラムがページを巡回・収集する動作を指します。道具と作業の関係と考えると分かりやすいです。
クロールされれば検索結果に表示されますか?
必ずしも表示されません。クロールはページの内容を知る段階で、検索結果に載せるかはその後のインデックス登録で判断されます。クロールされても載らないケースはあります。
robots.txt でブロックすれば絶対にクロールされませんか?
robots.txt は巡回への指示であり、行儀のよいクローラーは従いますが、すべてのボットが守るとは限りません。確実に見せたくない場合は認証などのアクセス制御を使うべきです。
公開前のページをクローラーに見られたくないときは?
noindex で検索結果に出さない方法がありますが、URLを知っていればアクセスできてしまいます。ギガサイト便のような一時共有では認証を併用すると、関係者以外の閲覧を防げます。
実務ではどこで関係する?はHTML共有で必ず理解しておく必要がありますか?
細かな仕様を暗記する必要はありません。ただし、検索に出るか、閲覧者を制限できるか、表示が崩れないかに関わる用語は、共有前の判断材料として押さえておくと安全です。