本記事では、ITとインターネット分野の法律問題を専門とする戸田総合法律事務所の中澤弁護士の監修のもと、スクレイピングが違法になる7つのケースと、2026年の法改正・生成AIをめぐる最新動向、企業が安全にデータ収集するための対策を解説します。
皆様はじめまして、弊所は埼玉、東京、福岡の三拠点を設け、全国のお客様に対してインターネットやITに関する法律問題に関するアドバイス、紛争解決を提供しております。事務所の代表である私自身は特にインターネット関係の法律問題を専門としています。
どうぞ、よろしくお願いします。
Webスクレイピングについて調査しているレイコです。
中澤先生、よろしくおねがいします!
目次
結論:スクレイピングは「方法」と「データの使い方」次第で違法になる
まず気になるのは、スクレイピングについて調査を行っていると「スクレイピング 違法」というキーワードにたどり着くことがあります。なぜスクレイピングが違法じゃないか、という議論がなされるのでしょうか。
Webスクレイピングは他のサイトからデータを収集してくるので、まるで人のものを奪っているようなイメージが先行してしまっているからではないでしょうか?スクレイピングそのものは日本の法律で禁止されておらず、違法ではありません。 ただし、サーバーに過度な負荷をかける、ログイン制限を突破する、著作物や個人情報を無断で公開・販売する、利用規約に違反するといった行為をすると、刑事責任や損害賠償責任を問われる可能性があります。
| 判断のポイント | 合法の目安 | 違法リスクが高い例 |
|---|---|---|
| アクセス方法 | 間隔をあけた常識的な頻度 | 短時間の大量リクエストでサイトを停止させる |
| アクセス範囲 | 誰でも閲覧できる公開ページ | 他人のID・パスワードでログインして取得 |
| 取得データ | 価格・企業情報などの事実データ | 要配慮個人情報、有料記事の全文 |
| 利用目的 | 社内分析・統計・AIの情報解析 | 記事や画像をそのまま自社サイトで公開 |
| サイトのルール | 利用規約・robots.txtを確認し遵守 | 規約で禁止された会員サイトで収集 |
Webスクレイピングが違法になる7つのケース

大きく分けてどんな場合にWebスクレイピングが違法になるのでしょうか?
Webスクレイピングを行う際に違法になってしまう場合は大きく分けて以下の7つあります。
| # | ケース | 関係する法律 | 責任の種類 |
|---|---|---|---|
| 1 | サーバーに過度な負荷をかけ業務を妨害した | 刑法233条・234条の2 | 刑事 |
| 2 | ログイン認証を不正に突破した | 不正アクセス禁止法 | 刑事 |
| 3 | 著作物を無断で複製・公開した | 著作権法21条・23条 | 刑事・民事 |
| 4 | 個人情報を不適切に取得・提供した | 個人情報保護法 | 行政・刑事・民事 |
| 5 | 同意した利用規約に違反した | 民法(債務不履行・不法行為) | 民事 |
| 6 | 限定提供データ・営業秘密を不正取得した | 不正競争防止法 | 刑事・民事 |
| 7 | robots.txtやアクセス制限を無視して収集した | 著作権法30条の4ただし書き、民法709条 | 民事(他の違反の根拠になる) |
1. サーバーに過度な負荷をかけた場合(偽計業務妨害罪・電子計算機損壊等業務妨害罪)
短時間に大量のリクエストを送り、相手のサイトを重くしたり停止させたりすると、偽計業務妨害罪(刑法233条)や電子計算機損壊等業務妨害罪(刑法234条の2)に問われる可能性があります。
「1秒に何回までならOK」という法律上の基準はありません。犯罪にあたるかは、サーバーへの負荷の程度や業務への影響を総合的に見て判断されます。相手のサーバーが古く処理能力が低い場合、自分では控えめなつもりでも障害を起こすことがある点に注意が必要です。
2. ログイン認証を不正に突破した場合(不正アクセス禁止法)
他人のID・パスワードを無断で使ったり、認証の脆弱性を突いたりして会員専用ページのデータを取得すると、不正アクセス禁止法違反になります。法定刑は3年以下の拘禁刑または100万円以下の罰金です。
誰でも閲覧できる公開ページをスクレイピングするだけであれば、同法の「不正アクセス行為」にはあたりません。自分のアカウントでログインして取得する場合は、次の「利用規約」の問題になります。
3. 著作物を無断で複製・公開した場合(著作権法)
Web上の文章、画像、動画、イラストの多くは著作物です。ブログ記事やレビュー文も原則として著作権で保護されます。
スクレイピングでデータを保存する行為は「複製」にあたり、原則として著作権者の許諾が必要です(複製権・21条)。さらに、集めた記事や画像を自社サイトで公開すると公衆送信権(23条)の侵害になります。一方で、情報解析などの目的なら許諾なく利用できる例外があります(次章で解説)。
なお、価格・在庫数・住所・営業時間などの単なる事実データには、原則として著作権が発生しません。
4. 個人情報を不適切に取得・提供した場合(個人情報保護法)
氏名や顔写真など特定の個人を識別できる情報をスクレイピングで集める企業は、個人情報保護法の「個人情報取扱事業者」として規制を受けます。2017年の改正以降、取り扱う件数に関係なくほぼすべての事業者が対象です。
- 利用目的の公表(21条):取得の際は利用目的を本人に通知するか公表する必要があります。スクレイピングでは個別通知が難しいため、プライバシーポリシーで事前に公表しておくのが一般的です。
- 適正な取得(20条1項):偽りその他不正な手段による取得は禁止されています。
- 要配慮個人情報(20条2項):人種、信条、病歴、犯罪歴などは、本人の同意なく取得することが原則禁止です。
- 第三者提供の制限(27条):取得した個人データを公開・販売すると第三者提供にあたり、本人の同意がない限り原則として違法です。
- 不適正利用の禁止(19条):違法・不当な行為を助長するおそれのある方法で利用してはいけません。
法人の名称・所在地・代表電話番号など、生存する個人に関する情報でないものは個人情報保護法の対象外です。業界の企業リストを作って市場分析をするような場合は、同法の規制は及びません。
5. 同意した利用規約に違反した場合(債務不履行・不法行為)
利用規約は、サイトの利用者と運営者の間の約束(契約)です。会員登録時などに規約に同意したうえで、規約が禁止するスクレイピングを行うと、債務不履行や不法行為として損害賠償を請求されたり、アカウントを停止されたりする可能性があります。
会員登録が不要で規約に同意していない公開ページでは、規約違反の責任は生じにくいとされます。ただし、規約で禁止の意思が明確に示されているサイトでの大量収集は、後述のrobots.txtと同様に紛争の火種になりやすいため、避けるのが賢明です。
6. 限定提供データ・営業秘密を不正取得した場合(不正競争防止法)
2018年の不正競争防止法改正(2019年7月施行)で、「限定提供データ」の保護制度が設けられました。ID・パスワードなどで管理され、特定の相手にだけ提供されている有料データベースなどが該当します。
こうしたデータを、アクセス制限を回避するなど不正な手段で取得・使用すると、差止めや損害賠償の対象になります。営業秘密として管理された情報を不正に取得した場合は、刑事罰の対象にもなります。
7. robots.txtやアクセス制限を無視した場合
robots.txtは、サイト運営者がクローラーに「どのページを収集してよいか」を伝えるテキストファイルです。robots.txtに従う法的義務を直接定めた日本の法律はありません。
しかし、robots.txtは運営者の「収集を拒否する」という意思表示として、他の法律の判断材料になります。文化庁の考え方では、AI学習用データの収集を拒否する技術的措置を無視した収集は、著作権法30条の4の例外が適用されない「著作権者の利益を不当に害する場合」にあたり得るとされています。2025年の新聞社によるPerplexity提訴でも、robots.txtの無視が争点の一つになっています(後述)。
これらのような点でWebスクレイピングには法的リスクがありますので、企業として行う場合は7つのそれぞれの観点についてどのようにリスクを回避するかを定めておくと良いでしょう。
先生のご説明でWebスクレイピングが違法の場合が整理できました。ですが、著作権の問題は、結局の所スクレイピング元サイトに連絡して、同意を得ることが必要ということになりますか・・?けっこうハードルが高いですね。
おっしゃるとおり、本来であれば著作物の作者と連絡をとり、目的のためにWebスクレイピングをすることを同意しなければいけないのですが、これではデータを直接もらうことと同じです。
しかし、著作物の利用のすべてに著作権者の同意を得るというのは現実的ではありませんので、著作権法が一定の場合の例外を定めています。著作権法は国内のAI・ビッグデータによるイノベーションを促進するため、他者の著作権の利用範囲を年々広げて来ており、確認を取らなくても、著作物が自由に使える場合が増えています。Webスクレイピングのケースで該当しうる例外規定としては、2018年の法改正で整備された著作権法30条の4(著作物に表現された思想又は感情の享受を目的としない利用)や、著作権法47条の5(電子計算機による情報処理及びその結果の提供に付随する軽微利用等)があります。
著作権を侵害せずにWebスクレイピングしたデータを使うには
著作物を利用するたびに許諾を得るのは現実的ではないため、著作権法には許諾なく利用できる例外があります。スクレイピングで特に重要なのは、2018年改正(2019年1月施行)で整備された30条の4と47条の5です。
| 規定 | 認められる利用 | スクレイピングでの具体例 | 注意点 |
|---|---|---|---|
| 30条の4(非享受目的の利用) | 著作物を「楽しむ」目的ではない情報解析など | クチコミを大量に集めて感情分析し商品開発に活かす、AIの学習データにする | 著作権者の利益を不当に害する場合は不可(ただし書き) |
| 47条の5(軽微利用) | 検索・情報解析サービスで結果とともに著作物の一部を表示 | 検索結果でタイトルや短い抜粋を表示する、論文の剽窃チェック | 表示は「軽微」な範囲に限られる |
30条の4:情報解析・AI学習なら原則として許諾不要
大量の文章や画像から言語や傾向を抽出し、統計的に分析する「情報解析」のための複製は、必要な限度で許諾なく行えます。かつての47条の7(情報解析のための複製)は、この30条の4に統合されています。
ただし、次のような場合は例外が適用されません。
- 収集したデータを、元の著作物を鑑賞できる形でそのまま公開・提供する(享受目的が併存する)
- 情報解析用にすでに販売・提供されているデータベースを無断で複製する
- 学習を拒否する技術的措置(robots.txtなど)を回避して、販売予定のデータベースに相当するデータを収集する
47条の5:検索結果などに付随する「軽微な利用」
検索エンジンのように、情報の所在を検索して結果を示すサービスでは、検索結果とあわせて著作物のタイトルや短い抜粋を表示することが認められています。表示できるのは、利用者が出典を確認できる程度の「軽微」な範囲に限られます。

著作権法は、国内のAI・ビッグデータによるイノベーションを促進するため、許諾なく利用できる範囲を広げてきました。ただし「解析のための収集」と「集めたものをそのまま見せる提供」は区別して考える必要があります。後者は原則どおり許諾が必要です。
生成AIのためのスクレイピングは、「AIの学習」に使うか、「回答生成時の参照(RAG)」に使うかで法的評価が大きく変わります。文化庁は2024年3月に「AIと著作権に関する考え方について」を公表し、この区別を示しています。 AIクローラーの増加を受けて、robots.txtでAI事業者の収集を拒否するニュースサイトが増えています。2025年6月には日本新聞協会がAI事業者に対し、robots.txtを守るよう求める声明を出しました。 企業がAI活用のためにスクレイピングを行う場合は、学習目的であってもrobots.txtの拒否設定を尊重し、RAGで外部記事を使う場合は引用の範囲にとどめるか、提供元とライセンス契約を結ぶのが安全です。 最近は、AIがページの構造を読み取って必要な情報を取り出す「AIスクレイピング」も登場しています。収集の手段がAIになっても、適用される法律は従来のスクレイピングと変わりません。アクセス頻度、利用規約、robots.txt、著作権、個人情報の確認はこれまでどおり必要です。 一方、AIスクレイピングには、サイトごとの専用プログラムを作り込む必要がないという利点があります。たとえばPigData スクレイピングAIでは、取得したい項目を自然言語で指定でき、サイトのデザイン変更による収集停止も起こりにくい設計です。1000サイト以上の大規模な収集にも対応しています。 個人情報保護法の「3年ごと見直し」による改正法が2026年7月10日に成立し、同年7月17日に公布されました。施行は原則として公布から2年以内、罰則規定は2027年1月17日に先行施行されます。 スクレイピングで個人情報を扱う企業に関係する主な改正点は次のとおりです。 AI開発の特例は「何でも自由に集めてよい」という意味ではありません。取得時の利用目的の公表や適正な取得のルールは引き続き適用されるため、政省令やガイドラインの公表を確認しながら運用を見直してください。 出典:契約ウォッチ「個人情報保護法改正とは?」、三宅法律事務所「令和8年改正個人情報保護法 解説レジュメ」 上で説明した箇所をしっかりと押さえていれば、Webスクレイピングが違法になることはほぼないのですが、捜査機関に違法だと判断された例があるためハードルを挙げてしまっていると考えられます。ケーススタディのため、紹介しておきます。 2010年3月ごろ、岡崎市立図書館のウェブサイトの蔵書システムにアクセスできないとの苦情があったことから、同図書館が不正アクセスについて通報し、蔵書システムに対してWebスクレイピング行っていた男性が、同年5月25日高頻度のリクエストを故意に送りつけたとして偽計業務妨害の容疑で逮捕されました。 実際には1秒1アクセス程度で、サーバーに対して攻撃するような高負荷を与えるものではなかったが、図書館のシステムが旧式であったこともあり、閲覧障害が発生しました。 男性に悪意はなかったものの、犯罪が成立しないことを意味する「嫌疑不十分」ではなく、「起訴猶予」という結果となりました。 この事件に関して、のちに岡崎市図書館側は同システムの不備が原因であることを認めていますが、男性が逮捕されたという事実は残ってしまいました。 偽計業務妨害にあたると判断されてしまったということは、故意だと認定されたということですか? そうなんです。大量のアクセスを高速に行った場合、サービスがダウンしてしまうことはその技術があるものであれば十分に予測できただろう、と判断されたようです。1秒1アクセスで高速とは思えませんが、捜査機関はそう考えたようです。 実際のところ悪意はなかったということも相まって、世の中的には判断が難しい、グレーな行為と捉えられるようになったのかもしれませんね。 そうですね。ですから特に企業としてWebスクレイピングを行う場合は経験豊富なプロフェッショナルのPigDataに任せることがオススメなのです。経験に基づき責任持ってWebスクレイピング業務を行ってもらえるため、リスクを大きく下げられます。 2025年8月7日に読売新聞社が、8月26日に朝日新聞社と日本経済新聞社が、AI検索サービスを運営する米Perplexity AIを東京地裁に提訴しました。両社はrobots.txtで収集を拒否していたにもかかわらず、記事が無断で複製・保存され回答に使われたと主張しています。請求額は読売が約21億6,800万円、朝日・日経が各22億円です。 同年12月には共同通信・毎日新聞・産経新聞も抗議書を送付しました。判決が出れば、RAG・AI検索での記事利用とrobots.txtの法的意味について、国内初の司法判断になる可能性があります。 スクレイピングは基本的に違法ではありません。しかし、実装の仕方を間違えてしまったり、収集したデータの取り扱いを過ってしまうと「違法」とみなされ訴えられる可能性もゼロではありません。 PigDataでは、企業がWebスクレイピングをビジネスとして行う際に法的なリスクを回避できるようスクレイピングポリシーを遵守してデータ収集事業を行っています。お客様には安心してご依頼、データの利用を行っていただいています。すでにデータ収集を行うことを検討しているかたは、お気軽にお問い合わせくださいませ。 個人でも企業でも、ルールは同じです。公開ページから常識的な頻度でデータを集め、私的な分析に使うだけなら通常は違法になりません。ただし個人でも、サーバーを停止させたり著作物を公開したりすれば責任を問われます。 規約に同意して利用している場合は、規約違反として損害賠償やアカウント停止の対象になり得ます。規約違反そのものは原則として刑事罰の対象ではありませんが、民事上のリスクは十分にあります。 robots.txtを守る義務を直接定めた法律はありません。ただし運営者の拒否の意思表示として扱われ、著作権法30条の4の例外が使えなくなったり、不法行為の判断材料になったりする可能性があります。 多くの大手プラットフォームは利用規約で自動収集を禁止しています。ログインが必要なページの収集は規約違反になりやすいため、公式APIやデータ提供プログラムを利用してください。 日本では著作権法30条の4により、AI学習目的の収集・複製は原則として許諾不要です。ただし、特定の作品の表現を出力させる目的の学習や、robots.txt等の拒否措置を回避した収集は例外の対象外になり得ます。 価格や企業情報などの事実データは、利用規約に反しない限り販売できる場合があります。一方、個人データの販売は本人の同意がなければ原則違法で、著作物を含むデータは著作権者の許諾が必要です。 法律上の基準はありません。実務では1秒以上の間隔をあけるのが一つの目安ですが、相手のサーバー性能によっては不十分な場合もあります。応答が遅くなったら速度を落とす設計にしてください。
生成AI時代のスクレイピング:学習とRAGで扱いが違う
用途 内容 著作権法上の扱い AI学習(開発・学習段階) 大量のWebデータを収集してモデルを学習させる 原則として30条の4で許諾不要。ただし特定作家の作風を再現する目的の追加学習など、享受目的が併存する場合は対象外 RAG・AI検索(生成・利用段階) 質問に応じてWebページを取得し、その内容を回答に使う 既存の著作物を回答に出力する目的があるため30条の4は適用されにくい。47条の5の軽微利用の範囲を超えると侵害の可能性 生成物の利用 AIが出力した文章・画像を公開する 既存の著作物との類似性・依拠性があれば通常の著作権侵害と同じ robots.txtは「拒否の意思表示」として重みを増している
AIを使ったスクレイピングも法律のルールは同じ
2026年の個人情報保護法改正とスクレイピングへの影響
改正点 内容 スクレイピングへの影響 統計作成・AI開発の特例 統計作成等(AI開発を含む)の目的なら、一定の条件で本人同意なく個人データを提供・利用できる AI開発目的のデータ活用はしやすくなる。ただし統計作成目的以外への流用は不可 不適正利用等の防止 連絡可能な個人関連情報等の不適正な取扱いの禁止、オプトアウト提供時の提供先確認の義務化 名簿屋的なリスト販売や、出所不明データの購入への監視が強まる 特定生体個人情報の規律 顔特徴データなどに独自のルールを新設 SNSなどから顔画像を集めて顔認識に使う行為は特に慎重さが必要 課徴金制度・罰則強化 重大な違反に課徴金納付命令を導入、罰則を拡充 違反時の金銭的リスクが大きくなる 実際に起こったWebスクレイピングの事件
時期 事件 国 争点 結果・現状 2025年8月〜 新聞各社 vs. Perplexity 日本 AI検索による記事の無断複製、robots.txtの無視 東京地裁で係争中 2024年1月 Meta vs. Bright Data 米国 ログアウト状態での公開データ収集と利用規約 裁判所はBright Data側の主張を認めた 2017〜2022年 hiQ Labs vs. LinkedIn 米国 公開プロフィールの収集とコンピューター不正使用防止法 公開データの収集は同法違反にあたりにくいとされたが、規約違反は認定され和解 2010年 岡崎市立中央図書館事件 日本 蔵書検索システムへの自動アクセスと業務妨害 逮捕後、起訴猶予処分 岡崎市中央図書館事件
新聞社によるPerplexity提訴(2025年)
スクレイピングが違法にならないようにするには
スクレイピングの違法性に関するよくある質問
Q. 個人がスクレイピングをしても違法ですか?
Q. 利用規約で禁止されているサイトをスクレイピングすると違法ですか?
Q. robots.txtを守らないと違法ですか?
Q. AmazonやX(旧Twitter)、Instagramはスクレイピングしてもよいですか?
Q. スクレイピングしたデータをAIの学習に使ってもよいですか?
Q. スクレイピングしたデータを販売できますか?
Q. 何秒間隔ならサーバー負荷の問題になりませんか?
スクレイピング法律資料ダウンロード