Server rack con cavi - infrastruttura kernel Linux sotto attacco crawler AI

Contenuto

Quattordici core CPU. Ventiquattro ore su ventiquattro. Cinque nodi geograficamente distribuiti. Tutto questo potere di calcolo non serve a compilare codice, non serve a far girare test, non serve a sviluppatori che mandano patch alle tre di notte. Serve a rendere HTML per bot che si fingono browser, bot che scaricano la stessa cronologia di commit novecentoventidue volte perché novecentoventidue sono i fork di linux.git su git.kernel.org, e ogni fork è una copia identica degli stessi un milione quattrocentottantamila commit.

Konstantin Ryabitsev, l’uomo che tiene in piedi l’infrastruttura del kernel Linux, ha pubblicato i numeri. Sono numeri che fanno rabbrividire chiunque gestisca un server: il traffico illegittimo — crawler AI che ignorano robots.txt, che ruotano IP, che si nascondono dietro subnet residenziali, dietro smart TV, dietro frigoriferi connessi — supera ormai tutto il traffico legittimo messo insieme. Cloni git, navigazione umana, mirror ufficiali: tutto il resto è rumore di fondo.

La chiamano “background radiation”. Radiazione di fondo. Una metafora azzeccata: invisibile, costante, dannosa nel lungo periodo. E come la radiazione, non puoi fermarla con un muro. Puoi solo cercare di schermarti, consumando risorse che dovrebbero andare altrove.

Il paradosso dell’open source che nutre le macchine chiuse

C’è un’ironia crudele in tutto questo. Il kernel Linux è il simbolo vivente del software libero: codice aperto, sviluppo trasparente, chiunque può clonare, studiare, modificare, redistribuire. La licenza GPL esiste proprio per garantire che la libertà viaggi col codice. Ma i crawler AI non vogliono la libertà del codice. Vogliono il codice come materia prima gratuita per modelli che saranno proprietari, chiusi, venduti come servizio a chi il codice l’ha scritto.

Ryabitsev lo spiega con una chiarezza disarmante: la storia completa dei commit del kernel è “oro puro” per l’addestramento. Perché è garantita pre-AI. Nessun output di LLM ha contaminato quei messaggi di commit, quelle discussioni su LKML, quelle patch scambiate via email. In un web sempre più inquinato da testo sintetico — la “malattia da prioni digitali” di cui parla Ryabitsev — i dati anteriori all’era generativa valgono oro. E i modelli chiusi se li stanno prendendo gratis, bruciando l’infrastruttura di chi quei dati li produce e li mantiene.

Il paradosso si fa beffa: l’infrastruttura che ospita il software più libero del mondo viene strangolata da aziende che della libertà non vogliono sapere nulla. Google, Microsoft, OpenAI, Anthropic — i nomi li conosciamo. I loro bot no, perché si mascherano. User-agent falsi, IP che ruotano, subnet residenziali noleggiate in blocco. Quando banni un ASN intero di Google Cloud, ti dicono che stai danneggiando “ricercatori legittimi”. Quando banni una subnet residenziale, colpisci utenti reali che navigano da casa. È una guerra asimmetrica: loro hanno budget infiniti, tu hai quattordici core bruciati a vuoto.

La via stupida: perché clonare quando puoi scrapare?

Qui sta l’assurdo tecnico. Ryabitsev lo chiama “il modo più stupido di farlo”. Hai un repository git? git clone. Hai la storia completa in locale, compressa, efficiente. La cammini come vuoi, la analizzi come vuoi, non carichi il server di origine. È per questo che git esiste: distribuzione, non centralizzazione.

Ma i crawler non clonano. Renderizzano. Chiedono a cgit — l’interfaccia web del kernel — di generare HTML per ogni singolo commit. Poi lo parsano. Poi passano al successivo. Un milione quattrocentottantamila volte per fork. Novecentoventidue fork. Miliardi di URL validi, tutti duplicati dello stesso contenuto. E cgit, progettato per umani e crawler educati che rispettano robots.txt, li serve tutti. Perché cgit non sa dire di no. Non è stato costruito per un web ostile.

La colpa non è di cgit. La colpa è di chi tratta l’infrastruttura pubblica come risorsa gratuita da saccheggiare. È il capitalismo estrattivo applicato al codice: estrai valore, esternalizzi i costi. I costi li paga la Linux Foundation, li pagano i maintainer, li paga chi dona server e banda. Il valore se lo prendono i modelli chiusi.

Quando il tuo frigorifero diventa un’arma

Il dettaglio più inquietante nel racconto di Ryabitsev arriva verso la fine: “Enter… your TV?”. I crawler hanno smesso di usare data center. Troppo facili da bloccare per ASN. Ora usano reti residenziali. Milioni di IP domestici. Dispositivi IoT compromessi, proxy residenziali venduti a pacchetti, app “gratuite” che trasformano il tuo telefono in un nodo di una botnet per scraping. La tua smart TV, il tuo termostato connesso, la telecamera del baby monitor: tutti potenziali soldati in questa guerra per i dati di addestramento.

Non è fantascienza. Il mercato dei proxy residenziali è un’industria da miliardi di dollari. Aziende legittime — si fa per dire — vendono accesso a “IP reali” per aggirare blocchi geografici, limiti di rate, fingerprinting. I crawler AI sono i loro clienti migliori. Pagano profumatamente per sembrare te, me, tua nonna che controlla le email.

Questo cambia radicalmente la difesa. Non puoi bannare IP residenziali a caso: colpisci utenti veri. Non puoi fidarti dello user-agent: è falsificato. Non puoi fidarti del comportamento: i bot imitano navigazione umana, cliccano link, aspettano tra una richiesta e l’altra. Sono progettati per superare ogni euristica. E mentre tu affini i filtri, loro bruciano i tuoi core.

Il fallimento di robots.txt e il contratto sociale rotto

Robots.txt era un gentiluomini agreement. Funzionava quando il web era fatto da umani per umani, e i bot erano strumenti di indicizzazione che portavano traffico in cambio di accesso. Googlebot ti scansionava, ti mandava visitatori. Era uno scambio. Oggi i crawler AI non ti mandano traffico. Ti svuotano. Non c’è reciprocità. Non c’è vantaggio per chi ospita i dati.

Il protocollo robots.txt non ha denti. È un file di testo che dice “per favore non entrare”. Chi vuole entrare, entra. Le grandi aziende AI hanno ignorato robots.txt per anni. OpenAI ha ammesso di aver addestrato GPT su contenuti protetti da copyright. Google ha addestrato Bard su dati web senza chiedere permesso. Ora che i dati “puliti” scarseggiano, tornano all’assalto delle ultime fonti incontaminate. Il kernel Linux è una di queste.

La comunità open source ha sempre contato su norme sociali, non tecniche. “Non fare il furbo” bastava quando i furbi erano pochi e identificabili. Oggi i furbi sono corporation da trilioni di dollari con eserciti di ingegneri dedicati ad aggirare le tue difese. Le norme sociali non reggono contro l’asimmetria di risorse.

Difese tecniche: armi spuntate contro carri armati

Ryabitsev descrive l’evoluzione delle difese su git.kernel.org. Prima fail2ban su user-agent: facile, i bot si firmavano. Poi ban per IP: i bot ruotavano IP. Poi ban per ASN: i bot usavano cloud diversi. Poi subnet residenziali: i bot si nascondevano dietro utenti veri. Ogni passo avanti nella difesa costa tempo, competenza, risorse. Ogni passo avanti nell’attacco costa soldi — tanti, ma loro ne hanno.

La contromisura nucleare sarebbe richiedere autenticazione per ogni accesso. Chiudere cgit dietro login. Ma questo tradirebbe lo spirito del progetto: il kernel deve essere accessibile a chiunque, senza barriere. Un sviluppatore in Iran, in Cina, in Cuba deve poter clonare linux.git senza chiedere permesso a un server centrale. L’accesso anonimo è un principio politico, non solo tecnico.

Allora si provano vie di mezzo: rate limiting aggressivo, proof-of-work per richieste costose, rendering differito, mirror ufficiali spinti come unica via legittima. Ryabitsev lo ripete: git clone è la risposta. Clona il repo, hai tutto in locale, non carichi il server. Ma i crawler non clonano. Perché clonare richiede di ammettere che stai scaricando tutto. Scrapare HTML a pezzetti finge di essere navigazione. È plausibile deniability su scala industriale.

Il costo nascosto: chi paga il conto?

La Linux Foundation non è una startup con venture capital illimitato. Vive di donazioni, sponsorizzazioni aziendali, quote associative. I server di git.kernel.org sono donati da sponsor: Google, Microsoft, AWS, tra gli altri. Sì, le stesse aziende i cui crawler stanno strangolando l’infrastruttura donano l’hardware per farla girare. È il paradosso perfetto: ti regalo il coltello con cui mi pugnali.

Quando quattordici core girano al 100% per servire bot, quei core non servono sviluppatori. I mirror si ritardano. I cloni si bloccano. Le push di patch falliscono per timeout. Il lavoro reale — quello che mantiene vivo il kernel, che corregge bug, che aggiunge driver per hardware nuovo — rallenta. È un furto di tempo macchina, e il tempo macchina nel software libero è tempo umano. Ogni ciclo CPU rubato è un maintainer che aspetta, un contributor che si arrende, una patch che non arriva.

E non è solo git.kernel.org. SourceHut, Codeberg, GitLab.com, GitHub stesso: tutti riportano lo stesso pattern. Il traffico AI supera quello umano. I costi di banda e calcolo esplodono. I piccoli hoster chiudono o mettono tutto dietro login. La centralizzazione avanza: solo i giganti possono permettersi di ospitare codice aperto. L’open source diventa un giardino recintato, accessibile solo a chi ha account, credenziali, identità verificata. Esattamente ciò che il software libero voleva evitare.

Alternative dal basso: specchi, torrent, IPFS, reti federate

La risposta non può essere solo difensiva. Serve ripensare la distribuzione. Il kernel Linux è già distribuito per natura: ogni clone è un mirror completo. Ma i crawler non usano git. Usano HTTP. Perché HTTP è universale, non richiede strumenti speciali, funziona ovunque.

Progetti come Git stesso, IPFS, Hypercore, Radicle offrono modelli alternativi: distribuzione peer-to-peer, content-addressed storage, reti federate dove ogni nodo serve una parte del carico. Se i dati del kernel fossero serviti via IPFS o BitTorrent, lo scraping HTTP diventerebbe irrilevante. I bot dovrebbero unirsi alla rete P2P, contribuire banda, rispettare il protocollo. O rinunciare.

Ma la transizione costa. Richiede che utenti e maintainer adottino nuovi strumenti, cambino abitudini, accettino frizioni. E i giganti AI non staranno a guardare: adatteranno i loro crawler per parlare P2P, per unirsi alle reti, per succhiare dati anche da lì. La corsa agli armamenti non finisce cambiando protocollo.

La vera alternativa è politica, non tecnica. Licenze che vietano esplicitamente l’addestramento AI senza consenso. La AGPL già impone condivisione del codice modificato su rete. Servono licenze che estendano il concetto: se usi questo codice per addestrare un modello, il modello è opera derivata e deve essere rilasciato sotto la stessa licenza. Creative Commons sta esplorando questo. OSI dibatte definizioni di “open source AI”. Ma il diritto d’autore è arma spuntata contro chi ha avvocati migliori e giurisdizioni favorevoli.

La sovranità tecnologica non si delega

Questa storia non è solo del kernel Linux. È di ogni infrastruttura pubblica digitale. Wikipedia, OpenStreetMap, archivi scientifici, biblioteche digitali, repository di pacchetti (PyPI, npm, crates.io, Maven Central): tutti sotto assedio. La conoscenza comune — il commons digitale — viene recintata, privatizzata, monetizzata da chi non ha contribuito a crearla.

La sovranità tecnologica significa decidere collettivamente come le nostre risorse computazionali vengono usate. Significa infrastrutture governate da chi le usa e le mantiene, non da chi le saccheggia. Significa che se Google vuole i dati del kernel, negozia con la Linux Foundation, paga per l’accesso, accetta condizioni. Non si nasconde dietro IP residenziali rubati.

Significa anche che noi — sviluppatori, utenti, cittadini — smettiamo di regalare la nostra infrastruttura a chi la usa contro di noi. Ospitare un mirror, donare banda, contribuire codice: sono atti politici. Vanno fatti con consapevolezza. Vanno protetti con licenze, governance, alleanze tra progetti. La Federazione dei progetti open source non è utopia: è necessità di sopravvivenza.

Cosa possiamo fare domani mattina

Se gestisci un server pubblico: implementa proof-of-work per endpoint costosi. Usa Anubis o simili per sfidare i client prima di servire HTML. Spingi i mirror git ufficiali. Documenta come clonare invece di scrapare. Condividi i log degli abusi con altri maintainer: la difesa collettiva batte quella solitaria.

Se sviluppi software: licenzialo con clausole anti-addestramento non autorizzato. La Licenza Anti-AI di Heather Meeker è un punto di partenza. Non è testata in tribunale, ma alza il costo legale per chi ti ignora. Pubblica i dati in formati bulk scaricabili: chi li vuole davvero, li prende una volta e non torna.

Se usi servizi cloud: chiedi trasparenza. Il tuo provider dona risorse a progetti open source? Quegli stessi progetti vengono scrapati dai crawler del tuo provider? Chiedi conto. Sposta risorse su hoster etici, cooperative di calcolo, infrastrutture comunitarie. Disroot, Systemli, Riseup, Autistici/Inventati: esistono alternative. Non sono gratis, costano impegno. La libertà costa sempre.

Se sei un utente: blocca i tracker, usa uBlock Origin, Pi-hole, NextDNS. Non far diventare i tuoi dispositivi nodi di botnet. Disabilita la telemetria. Aggiorna il firmware. La tua smart TV non deve scaricare commit del kernel per conto di OpenAI.

Il kernel non si arrende, ma ha bisogno di alleati

Ryabitsev chiude il suo post con una nota secca: continueranno ad adattarsi. Bloccano, filtrano, ottimizzano cgit, spingono i cloni git. Non mollano. Il kernel Linux è troppo importante per cadere. Ma il costo sale. Quattordici core oggi. Quanti domani? Quanti maintainer bruciati da una battaglia che non hanno scelto?

La radiazione di fondo aumenta. Il web aperto — quello fatto per umani, da umani — si restringe. Ogni difesa eretta è un muro in più, un attrito in più per utenti legittimi. La fiducia si erode. L’apertura diventa rischio.

Non è una storia di tecnologia. È una storia di potere. Chi ha il potere di prendere senza chiedere, e chi subisce il furto. Chi decide che la conoscenza umana è materia prima gratuita per macchine che non servono l’umanità ma i bilanci trimestrali di quattro corporation.

La risposta non è tecnica. È organizzativa. È politica. È costruire alternative che non dipendano dalla benevolenza di chi ci sta derubando. È dire no — con il codice, con le licenze, con l’infrastruttura, con la solidarietà tra progetti.

Quattordici core. Ventiquattro ore su ventiquattro. La radiazione di fondo pulsa. La domanda non è se reggeremo. La domanda è: per chi stiamo bruciando questi cicli?