Fonti
Guardalo in azione
Esplora i modelli e gli stili dietro storie come questa: account gratuito e galleria al volo.
Esplora il catalogo
Esplora i modelli e gli stili dietro storie come questa: account gratuito e galleria al volo.
Esplora il catalogoUno scraper web ha sconfitto Google e Reddit in una sfida legale basata sul DMCA, con un esperto legale che ha definito la strategia delle piattaforme «bizzarra» — e l'esito ha implicazioni concrete su come vengono costruiti i dataset di addestramento per l'IA e su chi controlla l'accesso al web pubblico.
Il Digital Millennium Copyright Act è stato concepito per affrontare la violazione del diritto d'autore — la copia e la distribuzione non autorizzate di opere protette. Utilizzarlo per impedire a uno scraper di leggere pagine web pubblicamente accessibili è un'interpretazione forzata, secondo l'esperto citato da Ars Technica. Le disposizioni anti-aggiramento del DMCA prendono di mira misure di protezione tecnica come il DRM, non i file robots.txt o i limiti di frequenza delle API. Quando Google e Reddit hanno tentato di inquadrare lo scraping come una violazione del DMCA, stavano essenzialmente sostenendo che i loro server costituiscono un blocco tecnologico protetto — una teoria di cui i tribunali sono stati storicamente scettici.
L'argomento centrale dello scraper è diretto: il web aperto non è di proprietà di nessuna singola piattaforma. L'indicizzazione di pagine pubblicamente disponibili è ciò che fanno i motori di ricerca, i ricercatori accademici e le pipeline di addestramento dell'IA. Il fatto che il tribunale abbia concordato con questa impostazione non significa che lo scraping sia privo di conseguenze — il diritto contrattuale e il Computer Fraud and Abuse Act rimangono strumenti validi per le piattaforme — ma rimuove una delle armi più aggressive dall'arsenale anti-scraping.
Per gli sviluppatori di modelli di IA, la sentenza è un via libera parziale. I grandi modelli linguistici e i sistemi di generazione di immagini come Stable Diffusion e i suoi successori sono stati costruiti su dataset raccolti dal web — Common Crawl, LAION e altri. Le sfide legali a quella pipeline sono venute principalmente dai titolari di diritti d'autore (autori, artisti, fotografi) che sostenevano che le loro opere specifiche fossero state acquisite senza consenso. Il caso Google/Reddit era diverso: riguardava la possibilità per le piattaforme di usare il DMCA per fare da guardiani del web stesso.
Con quella strada ora più stretta, il campo di battaglia più probabile si sposta verso l'applicazione dei termini di servizio e, in modo cruciale, verso le questioni di diritto d'autore che i tribunali non hanno ancora pienamente risolto. Il risarcimento agli autori da parte di Anthropic ha stabilito un precedente finanziario — circa 3.000 dollari per libro — ma non ha stabilito se l'addestramento su testi protetti da copyright costituisca effettivamente una violazione. Gli sviluppatori di modelli di generazione di immagini si trovano di fronte alla stessa questione irrisolta per i contenuti visivi.
Per i creator che utilizzano strumenti di IA per la generazione di immagini, questo ha un effetto più silenzioso ma reale: l'ampiezza e la freschezza dei dati di addestramento influenzano ciò che i modelli riescono a rendere, quanto bene gestiscono gli stili di nicchia e quanto rapidamente vengono assorbite le nuove tendenze visive. Un contesto legale che mantiene il web pubblico accessibile agli scraper supporta set di addestramento più ricchi e aggiornati — il che alla fine si riflette nella qualità del modello e nell'ampiezza stilistica. I creator che esplorano le possibilità offerte dai modelli attuali possono sfogliare il catalogo di Charmloop per vedere come la diversità dei dati di addestramento si manifesta in pratica nei diversi stili di generazione.
Secondo Ars Technica, Google non intende abbandonare la battaglia nonostante la sconfitta in tribunale — il che è degno di nota considerando che Google stessa è uno dei più grandi scraper web al mondo. Il Googlebot dell'azienda indicizza continuamente l'intero web pubblico. I critici hanno sottolineato la contraddizione nel fatto che Google difenda simultaneamente il proprio diritto a fare scraping cercando al contempo di bloccare gli altri dal fare lo stesso, in particolare quando quegli scraper alimentano i concorrenti nel campo dell'IA.
La motivazione di Reddit è più chiara: la piattaforma ha firmato un accordo di licenza dei dati con Google e ha protetto aggressivamente quel flusso di entrate limitando l'accesso di terze parti tramite API e scraping. Una sentenza che indebolisce la sua capacità di far rispettare tali restrizioni attraverso il DMCA è un diretto danno commerciale.
Il caso non sarà l'ultima parola. Le piattaforme adatteranno le loro strategie legali e il Congresso potrebbe ancora approvare una legislazione che conferisca alle piattaforme web un controllo più esplicito sull'accesso automatizzato. Ma per ora, il web pubblico rimane — almeno legalmente — più vicino a un bene comune che a un giardino recintato.