Bronnen
Zie het in actie
Blader door de modellen en stijlen achter verhalen als dit — gratis account, meteen een galerij.
Ontdek de catalogus
Blader door de modellen en stijlen achter verhalen als dit — gratis account, meteen een galerij.
Ontdek de catalogusEen web scraper heeft Google en Reddit verslagen in een rechtszaak op basis van de DMCA, waarbij een juridisch expert de strategie van de platforms omschreef als „bizar" — en de uitkomst heeft reële gevolgen voor de manier waarop AI-trainingssets worden samengesteld en wie de toegang tot het publieke web controleert.\n\n## Belangrijkste conclusies\n\n- Een rechtbank heeft Google en Reddit in het ongelijk gesteld in een DMCA-zaak gericht tegen een web scraper, wat een belangrijke juridische overwinning voor de scraper betekent.\n- Het standpunt van de scraper, zoals gerapporteerd door Ars Technica, is dat „Google en Reddit het internet niet bezitten" — een aanval op het idee dat platformgebruiksvoorwaarden de toegang tot het publieke web kunnen beperken.\n- Een juridisch expert omschreef het gebruik van de DMCA door Google en Reddit tegen een scraper als „bizar", wat suggereert dat hun juridische theorie op drijfzand is gebouwd.\n- De uitspraak kan het voor grote platforms moeilijker maken om AI-bedrijven en onderzoekers te blokkeren bij het scrapen van publiek toegankelijke content.\n- De beslissing valt op een moment waarop de herkomst van AI-trainingsdata onder intensief juridisch toezicht staat — waaronder de schikking van Anthropic van 1,5 miljard dollar met auteurs over het verwerken van boeken.\n\n## Waarom het DMCA-argument altijd een lange kans was\n\nDe Digital Millennium Copyright Act was ontworpen om auteursrechtinbreuk aan te pakken — het ongeoorloofd kopiëren en verspreiden van beschermde werken. Het gebruiken ervan om een scraper te beletten publiek toegankelijke webpagina's te lezen is een vergezochte redenering, aldus de expert geciteerd door Ars Technica. De anti-omzeilingsbepalingen van de DMCA richten zich op technische beschermingsmaatregelen zoals DRM, niet op robots.txt-bestanden of API-limieten. Toen Google en Reddit probeerden scraping te framen als een DMCA-overtreding, betoogden ze in wezen dat hun servers een beschermd technologisch slot vormen — een theorie waar rechtbanken historisch gezien sceptisch tegenover staan.\n\nHet kernargument van de scraper is direct: het open web is niet het eigendom van één enkel platform. Het indexeren van publiek beschikbare pagina's is wat zoekmachines, academische onderzoekers en AI-trainingspijplijnen allemaal doen. De instemming van de rechtbank met die redenering betekent niet dat scraping zonder gevolgen is — contractrecht en de Computer Fraud and Abuse Act blijven bruikbare instrumenten voor platforms — maar het ontneemt hen een van de agressievere wapens uit het anti-scraping arsenaal.\n\n## Wat dit betekent voor de AI-trainingsdata-pijplijn\n\nVoor ontwikkelaars van AI-modellen is de uitspraak een gedeeltelijk groen licht. Grote taalmodellen en beeldgeneratiesystemen zoals Stable Diffusion en zijn opvolgers zijn gebouwd op web-gescrapete datasets — Common Crawl, LAION en andere. Juridische aanvallen op die pijplijn kwamen tot nu toe voornamelijk van auteursrechthebbenden (auteurs, kunstenaars, fotografen) die stelden dat hun specifieke werken zonder toestemming waren verwerkt. De zaak Google/Reddit was anders: het ging erom of platforms de DMCA konden gebruiken om het web zelf te bewaken.\n\nNu die weg is vernauwd, verschuift het waarschijnlijkste strijdtoneel naar de handhaving van gebruiksvoorwaarden en, cruciaal, de auteursrechtelijke vragen die rechtbanken nog niet volledig hebben beantwoord. De schikking van Anthropic met auteurs stelde een financieel precedent — ongeveer 3.000 dollar per boek — maar stelde niet vast of trainen op auteursrechtelijk beschermde tekst überhaupt inbreuk vormt. Ontwikkelaars van beeldgeneratiemodellen staan voor dezelfde onopgeloste vraag voor visuele content.\n\nVoor makers die AI-beeldtools gebruiken heeft dit een stillere maar reële uitwerking: de breedte en versheid van trainingsdata bepaalt wat modellen kunnen weergeven, hoe goed ze omgaan met niche-stijlen en hoe snel nieuwe visuele trends worden opgenomen. Een juridisch klimaat dat het publieke web toegankelijk houdt voor scrapers ondersteunt rijkere, actuele trainingssets — wat uiteindelijk zichtbaar wordt in modelkwaliteit en stilistische variatie. Makers die willen verkennen wat er mogelijk is met huidige modellen kunnen de Charmloop-catalogus doorbladeren om te zien hoe de diversiteit van trainingsdata in de praktijk uitpakt bij verschillende generatiestijlen.\n\n## De zware strijd van Google\n\nVolgens Ars Technica geeft Google de strijd niet op ondanks het verlies in de rechtbank — wat opmerkelijk is, gezien het feit dat Google zelf een van de grootste web scrapers ter wereld is. Het eigen Googlebot van het bedrijf indexeert het volledige publieke web continu. Critici hebben gewezen op de spanning in het feit dat Google tegelijkertijd zijn recht op scrapen verdedigt terwijl het anderen probeert te blokkeren hetzelfde te doen, met name wanneer die scrapers AI-concurrenten voeden.\n\nReddit's motivatie is duidelijker: het platform sloot een datalicentiëringsdeal met Google en beschermt die inkomstenstroom agressief door de toegang voor derden via API en scraping te beperken. Een uitspraak die zijn vermogen verzwakt om die beperkingen via de DMCA af te dwingen, is een directe commerciële tegenvaller.\n\nDe zaak zal niet het laatste woord zijn. Platforms zullen hun juridische strategieën aanpassen, en het Congres zou nog wetgeving kunnen aannemen die webplatforms meer expliciete controle geeft over geautomatiseerde toegang. Maar voorlopig blijft het publieke web — juridisch gezien althans — dichter bij een gemeengoed dan bij een ommuurde tuin.