ボット・クローラー(Bot / Crawler)とは
ボット(bot)は、人の代わりに自動でウェブサイトにアクセスするプログラムです。そのうち、リンクをたどってページを次々に集めるものをクローラー(crawler)と呼びます。
ひとことで言えば「人ではなく、プログラムが見に来ているアクセス」です。役に立つものも、害のあるものも、同じ入口から来ます。
何をしに来るかで分かれる
インターネットの技術の決まりを定めた文書 RFC 9309 は、クローラーを自動で動くクライアントとし、検索エンジンがリンクをたどって索引を作る例を挙げています。 出典を開く確認 2026-09-26IETF(RFC 9309・Robots Exclusion Protocol・2022-09)原文
Crawlers are automated clients. Search engines, for instance, have crawlers to recursively traverse links for indexing
Cloudflare は 2026 年 7 月から、ボットをサイトで何をするかで 11 種類に分けています。 出典を開く確認 2026-09-26Cloudflare(Bots のドキュメント・Verified bots、2026-07-01 からの分類)原文
Cloudflare classifies each tracked bot by its behavior — what the bot may do on your site. A single bot can have one or more of the following behaviors: Behavior Description Search Crawling to build search indexes or RAG databases. Agent User-directed agents visiting a page on behalf of a human. Training Crawling to train or fine-tune models. Transact Checkout or other transaction actions on behalf of users. Data Collection Price scraping, competitive intelligence gathering, and third-party analytics. Security Testing Vulnerability scanning and penetration testing. SEO SEO crawling, site auditing, and accessibility checks. Ads Verification Ad placement verification and ad fraud detection. Social / Link Preview Link previews for social platforms and messaging apps. Feed Fetching RSS readers, podcast aggregators, and news feed bots. Monitoring & Operations Uptime monitoring, webhooks, and health checks.
| 種類 | 何をしに来るか |
|---|---|
| 検索 | 検索の索引や、AI が参照するデータベースを作る |
| AI の学習 | AI モデルの学習用にページを集める |
| エージェント | 人の指示で動くエージェントが、その人の代わりにページを見る |
| 監視・運用 | サイトが動いているかの確認、ほかのサービスからの自動の通知(webhook) |
| リンクのプレビュー | SNS やチャットに貼られたリンクの見出しを作る |
| SEO(検索エンジン最適化) | サイトの点検、アクセシビリティの確認 |
| セキュリティ検査 | 脆弱性のスキャン、侵入テスト |
この分類は Cloudflare が追跡しているボットについてのもので、1 つのボットが複数に当てはまることもあります。ほかに、利用者の代わりに購入などの操作をするもの、価格や競合の情報を集めるもの、広告の表示を確かめるもの、ニュースやポッドキャストの配信を取りに来るものがあります。
図は、このうち主なものに、最後の「一覧に無いもの」を加えて並べています。「一覧に無いもの」はこの分類の 1 つではなく、確認済みのボットの一覧に載っていない自動のアクセスです。身元を明かさずに来るアクセスが実際に何を探しているかは、私たちのサイトの 1 週間のアクセスを分けた 「自動トラフィック急増」の警告の読み方 で扱っています。
ボットが通信に占める割合も小さくありません。数え方と時期が出典ごとに違うので、数字は足し合わせたり比べたりせず、出典ごとに読みます。
| 出典 | 対象と時期 | ボットの量 |
|---|---|---|
| Cloudflare | 同社のネットワーク、2023 年 4 月〜2024 年 3 月 | 通信の約 3 分の 1 が自動化。そのうち 93% は確認済みのボットの一覧に無く、悪意がある可能性がある Cloudflare(2024-07-11・Application Security Report 2024 update、対象 2023-04-01〜2024-03-31)原文about a third of all traffic we observe is automated, and of that, the vast majority (93%) is not generated by bots in Cloudflare’s verified list and is potentially malicious.出典を開く確認 2026-09-26 |
| Thales(Imperva) | 同社の年次報告(2026 年 4 月発表)、2025 年 | ウェブの通信の 53% 超。前年は 51% Thales(Imperva・2026-04-29・2026 Bad Bot Report の発表)原文In 2025, bots made up more than 53% of all web traffic, up from 51% the previous year, while human activity fell to 47%.出典を開く確認 2026-09-26 |
各社がそれぞれの基準で数えた数字の読み方は 「AI 攻撃が急増」で増えたのは何か にまとめています。
名乗りは偽れる
ボットも人のブラウザも、アクセスのたびに User-Agent という名乗りを送ります。ただし名乗りは送る側が自由に書けます。Google は、迷惑な送り手(スパマーなど)が Google を名乗ってサイトにアクセスしていないかを確かめたいときのために、本物の Google かを確かめる方法を案内しています。 出典を開く確認 2026-09-26Google(Google のクローラーとフェッチャーのドキュメント・Google からのリクエストの確認)原文
この方法は、スパマーなどのトラブルメーカーがGoogleであると称してサイトにアクセスしていないかを確認する必要がある場合に活用できます。
Cloudflare は、確認済みのボットの条件を 2 つ挙げています。 出典を開く確認 2026-09-26Cloudflare(Bots のドキュメント・Verified bots)原文
Being Verified means a bot or agent meets two bars: Honest self-identification — it declares who it is deterministically, through a cryptographic Web Bot Auth signature, a published IP list with a stable user-agent, or reverse DNS. Non-abusive behavior — it obeys robots.txt and crawl directives, maintains reasonable request rates, and has not been observed evading website owner preferences or attacking sites.
- 身元を正直に示すこと。方法は、暗号の署名、公開された IP アドレスの一覧と変わらない名乗り、逆引き DNS(IP アドレスから持ち主のドメイン名を調べる仕組み)のどれかです。
- 迷惑をかけないこと。robots.txt などの指示に従い、無理のない頻度でアクセスし、サイトの持ち主の意向をすり抜けたり、サイトを攻撃したりしていないことです。
| 見分け方 | 確かめられること | 偽れるか |
|---|---|---|
| User-Agent(名乗り) | 自分で名乗った名前 | 偽れる |
| 公開された IP アドレスの一覧・逆引き DNS | その会社の設備から来たか | 偽りにくい |
| 暗号の署名 | 署名した本人か | 偽りにくい |
この条件にならえば、良いボットと悪いボットの境目は名乗る名前ではなく、身元を明かしているか、決まりを守っているかです。
robots.txt は「お願い」
robots.txt は、サイトの持ち主がクローラーに、取りに来てほしくない場所を伝えるファイルです。RFC 9309 は、その決まりはアクセスを許可・拒否する仕組みではないと書いています。 出典を開く確認 2026-09-26IETF(RFC 9309・Robots Exclusion Protocol・2022-09)原文
These rules are not a form of access authorization.
| したいこと | 使うもの |
|---|---|
| 検索や AI の学習のクローラーに、取りに来てほしくない場所を伝える | robots.txt |
| 秘密のファイルや管理画面を守る | ログイン、アクセス制限 |
| 名乗りを確かめられない大量のアクセスを絞る | WAF(Web Application Firewall)やボット対策の機能 |
WAF の仕組みと、WAF でも止められないものは WAF とは にまとめています。ボット対策を強める前に確かめることは、「自動トラフィック急増」の警告の読み方 に私たちの例を載せています。