Il tuo piccolo blog, il forum di nicchia, il wiki fatto da volontari: tutto sotto assedio. Non da hacker in cerca di vulnerabilità, ma da bot silenziosi, affamati di testo, immagini, codice. Sono i crawler delle AI, gli stessi che alimentano i modelli linguistici che usiamo ogni giorno. E stanno facendo collassare l’infrastruttura che dovrebbe nutrirli. Non è un incidente di percorso. È il modello di business: prendere tutto ciò che è aperto, trasformarlo in profitto privato, lasciare il conto agli altri. Wikimedia, SourceHut, piccoli progetti open source: stanno segnalando un traffico bot che supera quello umano, spesso di un ordine di grandezza. Il web aperto sta diventando una miniera da sfruttare finché dura, poi si passa oltre. E noi? Siamo quelli che tengono accese le luci mentre loro scavano sotto le fondamenta.
Quando il crawler diventa una ruspa
Non stiamo parlando di indicizzazione benigna. Quella che fanno i motori di ricerca per mostrarti ciò che cerchi. Qui si tratta di estrazione sistematica, su scala industriale, di tutto ciò che è pubblicamente accessibile. I crawler delle AI non rispettano il robots.txt, non fanno backoff quando il server segnala sovraccarico, non si identificano correttamente. Si comportano come se l’intero web fosse loro proprietà privata. Il risultato? Server piccoli che collassano sotto migliaia di richieste al secondo, banda consumata, costi che schizzano. FonteHut ha recentemente dichiarato che oltre l’80% del suo traffico è generato da bot di addestramento AI. Wikimedia ha dovuto implementare misure straordinarie per bloccare gli scraper più aggressivi. Non è più una questione di fastidio: è sopravvivenza.
Il punto è che questi bot non vengono da qualche startup sconosciuta. Sono spesso collegati direttamente ai grandi laboratori: quelli che sviluppano i modelli linguistici più potenti. Usano infrastrutture cloud pagate da venture capital per scaricare terabyte di dati gratuiti, poi rivendono l’accesso ai modelli risultanti come servizio a pagamento. È un ciclo chiuso: prendi dal web aperto, costruisci un recinto attorno alla conoscenza, fai pagare chi vuole entrarci. E se nel frattempo fai fuori qualche progetto indipendente? Meglio così: meno concorrenza, più controllo.
“Stiamo vedendo un prelievo di risorse senza precedenti dalla conoscenza collettiva, senza alcun meccanismo di restituzione”
— ha dichiarato una sviluppatrice di SourceHut in un’intervista recente, chiedendo l’anonimato per timore di ritorsioni. La metafora del saccheggio non è esagerata: è esattamente ciò che sta accadendo. Il web aperto, costruito decennio dopo decennio da volontari, sviluppatori, bibliotecari digitali, sta diventando la materia prima gratuita per l’industria dell’AI. E quando le risorse si esauriranno? Beh, allora si passerà al prossimo campo da sfruttare. Forse i libri scansionati. Forse le registrazioni vocali. Forse il tuo diario personale, se finirà online per errore.
Anubis, i tarpit e la resistenza dal basso
Di fronte a questo assalto, le comunità stanno rispondendo. Non con cause legali lunghe e costose (anche se quelle arrivano), ma con contromisure tecniche, spesso rilasciate come software libero. Uno degli strumenti più interessanti si chiama Anubis: un reverse proxy che si pone davanti al tuo sito e sfida i visitatori sospetti con prove computazionali leggere per gli umani, proibitive per i bot in massa. Non è un CAPTCHA tradizionale: è progettato specificamente per distinguere un crawler AI da un utente reale, facendo leva sul fatto che questi bot non vogliono sprecare risorse su sfide che non portano direttamente a dati utili. Il nome non è casuale: Anubis era il guardiano delle soglie nell’antico Egitto. Ora guarda le soglie dei nostri server.
Un’altra strategia è il tarpit: invece di bloccare il bot, lo fai impantanare. Gli rispondi lentamente, gli servi pagine infinite generate al volo, lo tieni impegnato finché non si stacca esausto. Progetti come Tarpit o varianti simili stanno guadagnando trazione tra gli amministratori di piccoli siti. Non è una soluzione elegante, ma funziona: aumenta il costo dello scraping finché non diventa meno conveniente che aspettare o cercare altrove. È una forma di disobbedienza civile digitale: rendere il saccheggio scomodo.
C’è poi chi sta sperimentando con l’avvelenamento dei dati: inserire silenziosamente informazioni false o dannose nei contenuti, sapendo che i crawler le porteranno nei modelli di addestramento. È rischioso, eticamente complesso, ma parla di una frustrazione profonda: se non ci ascoltano quando chiediamo rispetto, almeno facciamo in modo che il loro bottino sia avvelenato alla fonte. Non è la soluzione ideale, ma è un sintomo di quanto la situazione sia diventata insostenibile.
Il paradosso dell’AI che divora il suo stesso cibo
Qui sta il cuore del paradosso: le AI hanno bisogno del web aperto per imparare. Senza testi diversi, codice aperto, discussioni tecniche, arte condivisa, i modelli sarebbero poveri, ripetitivi, incapaci di generalizzare. Eppure, il modo in cui vengono addestrate sta distruggendo proprio quella apertura di cui hanno bisogno. È come se un contadino, per far crescere il suo grano, decidesse di bruciare il campo ogni anno dopo il raccolto. Funzionerebbe per un po’, finché non rimane nulla da coltivare.
Questo non è inevitabile. Esistono modelli alternativi: addestramento su dati licenziati, collaborazioni con biblioteche e archivi, meccanismi di compensazione per chi crea contenuti. Ma richiederebbero di condividere il potere, di riconoscere che la conoscenza non è un bene da prendere senza chiedere. E l’industria dell’AI, almeno nella sua forma attuale dominata da pochi attori, sembra preferire il saccheggio alla negoziazione. È più veloce, più redditizio, più semplice finché qualcuno paga il conto.
La domanda che dobbiamo porci è semplice: chi ha il potere? Chi lo subisce? E quali alternative esistono dal basso? La risposta alla prima parte è chiara: pochi laboratori ben finanziati, spesso legati a Big Tech o a finanziamenti militari, dettano le regole. Alla seconda: i piccoli editori, i volontari dell’open source, chi mantiene wiki, forum, repository senza grandi budget. Alla terza: stiamo già vedendo le risposte. Strumenti come Anubis, i tarpit, le politiche di accesso più restrittive (quando necessario), ma anche la spinta verso modelli addestrati su dati eticamente raccolti, su licenze chiare, con meccanismi di attribuzione e condivisione del valore. Non è utopia: è già in atto in alcuni angoli del mondo tecnologico che rifiutano di giocare secondo le regole del saccheggio.
Il web aperto non è morto. Ma sta imparando a difendersi. E forse, nel farlo, sta ricordando a tutti noi cosa significa davvero: non una risorsa da estrarre, ma un bene comune da custodire.
