Aaron Swartz alla manifestazione per l'accesso aperto alla conoscenza - keyword: Aaron Swartz scraping

Contenuto

Nel 2011, Aaron Swartz veniva perseguito per aver scaricato 70 gigabyte di articoli accademici da JSTOR, un gesto motivato dalla volontà di rendere libero l’accesso alla conoscenza. Oggi, Meta scarica 80 terabyte di libri per addestrare i propri modelli di intelligenza artificiale, un’operazione di scala enormemente maggiore, e se la cava con una multa simbolica. Questa disparità non è un incidente: è la logica stessa del capitalismo di sorveglianza, dove l’estrazione di dati è lecita solo quando serve al profitto e al controllo, mai quando mira alla liberazione.

La persecuzione di Swartz: un esempio fatto uomo

Swartz non stava rubando segreti industriali o dati personali. Stava tentando di liberare articoli accademici finanziati con soldi pubblici, ma bloccati dietro paywall da editori come JSTOR. Il suo “reato” era aver usato uno script per scaricare in massa ciò che avrebbe potuto leggere uno alla volta, se avesse avuto secoli di tempo a disposizione. Il governo statunitense rispose con 13 capi d’accusa, fino a 35 anni di carcere e un milione di dollari di multa. La pressione fu tale che Swartz si tolse la vita nel 2013, a 26 anni.

Come scrisse Lawrence Lessig, il suo mentore:

“Aaron non è morto per colpa della depressione. È stato ucciso da un sistema giudiziario che ha deciso di fare di lui un esempio, per terrorizzare chiunque osi mettere in discussione il controllo della conoscenza.”

Meta fa lo stesso, ma su scala industriale

Nel 2024 e 2025, Meta ha utilizzato LibGen, Z-Library e altre ombre bibliotecarie per scaricare almeno 80 terabyte di libri protetti da copyright, secondo documenti rivelati nella causa Kadrey v. Meta. Questi dati sono stati usati per addestrare Llama, il modello di intelligenza artificiale dell’azienda, ora integrato in prodotti che generano miliardi di ricavi.

La differenza? Meta non è stata perseguita penalmente. Ha affrontato una causa civile, probabile che si risolva con un accordo economico. Nessun dirigente rischia il carcere. Nessun bene è stato sequestrato. Anzi, le azioni di Meta sono salite dopo l’annuncio dei nuovi modelli Llama 3.

Come osservato da Timnit Gebru, ex co-leader dell’etica dell’AI di Google:

“Quando un attivista scarica articoli per condividerli, è un criminale. Quando una corporation scarica libri per costruire un monopolio sull’intelligenza, è ‘innovazione’. La legge non è rotta: funziona esattamente come progettata.”

Scraping e conoscenza: chi decide cosa è lecito?

Lo scraping in sé non è né buono né cattivo. È una tecnica. La sua moralità dipende dall’intento e dal contesto. Swartz voleva democratizzare l’accesso alla scienza. Meta vuole costruire un vantaggio competitivo inestinguibile, basato sulla proprietà esclusiva di modelli addestrati sul lavoro intellettuale di milioni di autori, senza il loro consenso né compenso.

Questo solleva una domanda scomoda: se lo scraping è illegale quando fatto da individui per fini di pubblico dominio, perché dovrebbe essere lecito quando fatto da corporation per fini di profitto privato? La risposta sta nel fatto che le leggi sul copyright e sul computer fraud sono state scritte per proteggere la proprietà, non la conoscenza.

Il doppio standard del copyright nell’era dell’AI

Le aziende tecnologiche sostengono che l’addestramento di modelli AI su dati protetti da copyright rientri nel “fair use” (uso equo). Ma questo argomento vale solo per loro. Quando individui o piccole realtà fanno lo stesso per scopi non commerciali, vengono perseguiti. Il caso di Swartz ne è la prova storica.

In Italia, la situazione non è diversa. Sebbene non ci siano stati processi identici a quello di Swartz, l’Autorità Garante per la Privacy ha multato OpenAI per illeciti nel trattamento dei dati, mentre progetti come Pythia, un modello linguistico italiano open source addestrato su testi di pubblico dominio, faticano a ottenere risorse.

Come ha dichiarato la ricercatrice italiana Eleonora Benedetti:

“In Italia si parla molto di ‘sovranità tecnologica’, ma poi si lascia che siano le Big Tech a definire cosa è lecito estrarre dalla rete. Senza un’alternativa pubblica e decentralizzata, il rischio è di sostituire un colonialismo con un altro.”

Alternative dal basso: l’open source come resistenza

La risposta a questo doppio standard non sta nell’aspettare che le corporation diventino etiche, ma nel costruire alternative. Progetti come BigScience e il suo modello BLOOM hanno dimostrato che è possibile creare grandi modelli linguistici in modo trasparente, rispettando i diritti e coinvolgendo la comunità.

In Italia, iniziative come AI-PVT del Dipartimento per la Trasformazione Digitale cercano di creare modelli addestrati su dati pubblici, mentre comunità come Tethys lavorano su dataset linguistici italiani liberi da restrizioni.

Queste esperienze mostrano che un’altra tecnologia è possibile: una tecnologia che non estrae valore dalla conoscenza per concentrarlo in poche mani, ma la restituisce ampliata a tutti.

Conclusione: la conoscenza non è merce

La storia di Aaron Swartz non è solo una tragedia personale. È un avvertimento su ciò che accade quando la giustizia diventa strumento di potere. Quando chi cerca di condividere viene punito e chi cerca di monopolizzare viene premiato, non siamo davanti a un fallimento del sistema: siamo davanti al suo funzionamento normale.

Fino a quando non riconosceremo che l’accesso alla conoscenza è un diritto fondamentale, non un privilegio da concedere o un mercato da sfruttare, continueremo a vedere attivisti perseguitati e corporation premiate per lo stesso atto. La vera innovazione non sta nel costruire modelli più grandi, ma nel chiedersi: a chi serve questa intelligenza? E chi decide cosa è lecito sapere?