Aller au contenu
Intelligence Stratégique
DERNIÈRE PUBLICATION 27.09.26
025

Scraping

Le scraping, ou moissonnage de données selon FranceTerme, est l'extraction automatisée de contenus de sites web par un programme, en vue d'un traitement spécifique.

RÉVISÉ LE 27.09.2026 · D. HERNANDEZ9 SOURCES DE RÉFÉRENCEOSINT

Le scraping (web scraping) désigne l’extraction automatisée de contenus de sites web par un programme. FranceTerme recommande l’équivalent « moissonnage de données », ou « moissonnage », publié au Journal officiel du 30 avril 2022. Sa définition officielle vise l’« extraction automatisée de contenus de sites de la toile, pratiquée en vue d’un traitement spécifique ». Le scraping n’est ni licite ni illicite par nature : tout dépend des données collectées et de leur usage.

Comment ça fonctionne ?

Un programme de scraping lit des pages web, puis en extrait des champs précis. FranceTerme cite deux usages commerciaux : la comparaison de prix et l’évaluation de la réputation d’une marque. Le SOCMINT et l’OSINT y recourent pour collecter des publications en volume. Selon FranceTerme, les données d’entraînement d’un grand modèle de langage sont elles aussi moissonnées sur la toile.

Les éditeurs de sites expriment leur refus par des moyens techniques ou contractuels. Le fichier robots.txt, normalisé par l’IETF dans la RFC 9309 de septembre 2022, indique aux robots les pages à ne pas explorer. La RFC précise que ces règles ne constituent pas une forme d’autorisation d’accès. Selon la CNIL, les CAPTCHA, le blocage d’adresses IP et les conditions générales d’utilisation complètent le dispositif.

Exemple

La CNIL a infligé 240 000 euros d’amende à la société KASPR le 5 décembre 2024. Selon la délibération SAN-2024-020, l’extension KASPR pour Chrome collectait des coordonnées de membres de LinkedIn. Certains avaient pourtant réservé ces coordonnées à leurs seules relations. La délibération relève qu’« environ 160 millions de contacts figurent dans la base de données constituée par la société ». La CNIL a retenu des manquements aux articles 5, 6, 12, 14 et 15 du RGPD, avec une astreinte de 10 000 euros par jour de retard.

À ne pas confondre avec

  • Crawler : un robot d’exploration parcourt les liens pour découvrir des pages. Un moteur de recherche en emploie pour bâtir son index. Le scraping vise l’extraction de données précises dans ces pages.
  • API : une interface de programmation livre des données structurées, selon les conditions fixées par l’éditeur. Le scraping extrait des données de pages conçues pour des lecteurs humains.
  • RAG : la génération augmentée par récupération interroge une base documentaire au moment de répondre. Le scraping constitue un moyen parmi d’autres de remplir cette base.

Ce que dit le droit

  • Données personnelles : le RGPD s’applique dès qu’une personne est identifiable. Selon la fiche de la CNIL du 19 juin 2025, le moissonnage « n’est pas en soi incompatible avec les exigences du RGPD ». La CNIL demande d’exclure les sites qui s’y opposent par robots.txt ou CAPTCHA. L’article 226-18 du Code pénal punit la collecte déloyale de données personnelles de cinq ans d’emprisonnement et de 300 000 euros d’amende.
  • Bases de données : l’article L342-1 du Code de la propriété intellectuelle protège le producteur d’une base. Il peut interdire l’extraction d’une partie « qualitativement ou quantitativement substantielle » de son contenu.
  • Fouille de textes et de données : le Code de la propriété intellectuelle autorise la fouille. L’article L122-5-3 est en vigueur depuis le 26 novembre 2021. L’auteur peut s’y opposer, par exemple par des procédés lisibles par machine. Le texte reprend les exceptions des articles 3 et 4 de la directive (UE) 2019/790.
  • Contrats : un contrat encadre aussi une base non protégée. La Cour de justice de l’Union européenne l’a jugé le 15 janvier 2015 (Ryanair, C-30/14). Les conditions de Ryanair interdisaient le « screen scraping » à des fins commerciales.

À jour au 27/09/2026.

Pour aller plus loin

Le cadre juridique de la collecte en sources ouvertes est détaillé dans l’article consacré à l’OSINT.

Questions fréquentes

Le web scraping est-il légal en France ?

Le scraping n'est pas interdit en soi. Il doit respecter le RGPD quand il vise des données personnelles, le droit des producteurs de bases de données (article L342-1 du Code de la propriété intellectuelle) et les conditions d'utilisation des sites.

Comment dit-on scraping en français ?

FranceTerme recommande « moissonnage de données », ou « moissonnage », publié au Journal officiel du 30 avril 2022.

Le fichier robots.txt interdit-il le scraping ?

La RFC 9309 précise que les règles du robots.txt ne sont pas une autorisation d'accès. La CNIL demande toutefois d'exclure de la collecte les sites qui s'opposent au moissonnage par robots.txt ou CAPTCHA.

SOURCES

  1. Moissonnage de données, FranceTerme, ministère de la Culture (Journal officiel), JO du 30/04/2022
  2. RFC 9309, Robots Exclusion Protocol, IETF (RFC Editor), 09/2022
  3. La base légale de l'intérêt légitime : fiche focus sur les mesures à prendre en cas de collecte des données par moissonnage (web scraping), CNIL, 19/06/2025
  4. Délibération de la formation restreinte n° SAN-2024-020 du 5 décembre 2024 concernant la société KASPR, CNIL (Légifrance), 05/12/2024
  5. Code pénal, article 226-18, Légifrance, version en vigueur depuis le 07/08/2004
  6. Code de la propriété intellectuelle, article L342-1, Légifrance, version en vigueur depuis le 01/01/1998
  7. Code de la propriété intellectuelle, article L122-5-3, Légifrance, version en vigueur depuis le 26/11/2021
  8. Directive (UE) 2019/790 du 17 avril 2019 sur le droit d'auteur et les droits voisins dans le marché unique numérique, art. 2, 3 et 4, Journal officiel de l'Union européenne, JO L 130 du 17/05/2019
  9. CJUE, 15 janvier 2015, Ryanair Ltd c/ PR Aviation BV, C-30/14, Cour de justice de l'Union européenne (EUR-Lex), 15/01/2015