Sources
Voyez-le à l’œuvre
Parcourez les modèles et les styles derrière des histoires comme celle-ci — compte gratuit, galerie immédiate.
Explorer le catalogue
Parcourez les modèles et les styles derrière des histoires comme celle-ci — compte gratuit, galerie immédiate.
Explorer le catalogueUn scraper web a mis en échec Google et Reddit dans une procédure judiciaire fondée sur le DMCA, un expert juridique qualifiant la stratégie des plateformes de « bizarre » — et l'issue de cette affaire a de véritables implications sur la constitution des jeux de données d'entraînement pour l'IA et sur le contrôle de l'accès au web public.
Le Digital Millennium Copyright Act a été conçu pour lutter contre la violation du droit d'auteur — la copie et la distribution non autorisées d'œuvres protégées. L'utiliser pour empêcher un scraper de lire des pages web publiquement accessibles relève du grand écart, selon l'expert cité par Ars Technica. Les dispositions anti-contournement du DMCA visent les mesures de protection technique comme le DRM, et non les fichiers robots.txt ou les limites de débit des API. En tentant de présenter le scraping comme une violation du DMCA, Google et Reddit affirmaient en substance que leurs serveurs constituent un verrou technologique protégé — une théorie que les tribunaux ont historiquement accueillie avec scepticisme.
L'argument central du scraper est direct : le web ouvert n'appartient à aucune plateforme en particulier. L'indexation de pages publiquement disponibles est précisément ce que font les moteurs de recherche, les chercheurs universitaires et les pipelines d'entraînement de l'IA. Le fait que le tribunal ait adhéré à ce raisonnement ne signifie pas que le scraping est sans conséquences — le droit des contrats et le Computer Fraud and Abuse Act restent des outils disponibles pour les plateformes — mais cela retire l'une des armes les plus agressives de l'arsenal anti-scraping.
Pour les développeurs de modèles d'IA, la décision constitue un feu vert partiel. Les grands modèles de langage et les systèmes de génération d'images comme Stable Diffusion et ses dérivés ont été construits sur des jeux de données issus du scraping web — Common Crawl, LAION et d'autres. Les contestations juridiques de ce pipeline ont principalement émané de détenteurs de droits d'auteur (auteurs, artistes, photographes) affirmant que leurs œuvres spécifiques avaient été ingérées sans consentement. L'affaire Google/Reddit était différente : il s'agissait de savoir si les plateformes pouvaient utiliser le DMCA pour contrôler l'accès au web lui-même.
Cette voie étant désormais rétrécie, le terrain de bataille le plus probable se déplace vers l'application des conditions d'utilisation et, surtout, vers les questions de droit d'auteur que les tribunaux n'ont pas encore pleinement tranchées. Le règlement avec les auteurs d'Anthropic a établi un précédent financier — environ 3 000 dollars par livre — mais n'a pas déterminé si l'entraînement sur des textes protégés constitue une violation du droit d'auteur. Les développeurs de modèles de génération d'images font face à la même question non résolue pour les contenus visuels.
Pour les créateurs qui utilisent des outils d'IA pour l'image, cela a un effet plus discret mais bien réel : l'étendue et la fraîcheur des données d'entraînement déterminent ce que les modèles peuvent générer, leur capacité à gérer des styles de niche et la rapidité avec laquelle les nouvelles tendances visuelles sont assimilées. Un environnement juridique qui maintient le web public accessible aux scrapers favorise des jeux d'entraînement plus riches et plus actuels — ce qui se répercute in fine sur la qualité des modèles et leur palette stylistique. Les créateurs qui souhaitent explorer ce qui est possible avec les modèles actuels peuvent parcourir le catalogue Charmloop pour voir comment la diversité des données d'entraînement se manifeste en pratique à travers différents styles de génération.
Selon Ars Technica, Google ne renonce pas à la lutte malgré la défaite judiciaire — ce qui est notable étant donné que Google est lui-même l'un des plus grands scrapers web au monde. Le Googlebot de l'entreprise indexe en permanence l'intégralité du web public. Des critiques ont souligné la contradiction de Google, qui défend simultanément son droit de scraper tout en cherchant à empêcher d'autres de faire de même, notamment lorsque ces scrapers alimentent des concurrents dans le domaine de l'IA.
La motivation de Reddit est plus claire : la plateforme a signé un accord de licence de données avec Google et protège agressivement cette source de revenus en restreignant l'accès aux API et au scraping par des tiers. Une décision qui affaiblit sa capacité à faire respecter ces restrictions via le DMCA constitue un revers commercial direct.
Cette affaire ne sera pas le dernier mot. Les plateformes adapteront leurs stratégies juridiques, et le Congrès pourrait encore adopter une législation donnant aux plateformes web un contrôle plus explicite sur l'accès automatisé. Mais pour l'heure, le web public demeure — juridiquement, du moins — plus proche d'un bien commun que d'un jardin clos.