Ti è mai capitato di cercare un dataset sul portale dati.gov.it, trovare esattamente quello che ti serve, cliccare sul pulsante di download e scoprire che il file è un PDF scansionato a 72 dpi con tabelle illeggibili? Benvenuto nello stato dell’open data all’italiana, dove i dati pubblici che hai già pagato con le tasse vengono rilasciati in formati che nemmeno un archivista del XIX secolo riuscirebbe a utilizzare. Non è un incidente di percorso: è una strategia ben orchestrata per tenere il potere lontano dalle mani dei cittadini e concentrarlo negli uffici che controllano l’accesso all’informazione.
Il catalogo dei formati inutilizzabili: quando il pubblico diventa inaccessibile
Secondo l’ultimo rapporto dell’Agenzia per l’Italia Digitale (AgID) pubblicato a luglio 2024, oltre il 62% dei dataset pubblicati sui portali open data nazionali e regionali è disponibile esclusivamente in PDF, spesso scansionato da documenti cartacei o generato da sistemi legacy senza alcun tentativo di estrazione strutturata. Parliamo di dati catastali, dati ACI sui veicoli, dati ISTAT sulle imprese, tutti teoricamente “aperti” ma praticamente sepolti sotto strati di immagini non selezionabili. Un esempio recente: il dataset sulle concessioni idriche pubblicato dalla Regione Lombardia a giugno 2024 è un PDF di 487 pagine dove ogni tabella è un’immagine. Per estrarre i dati serve un OCR costoso, tempo e una buona dose di frustrazione. Questo non è open data: è teatro della trasparenza.
Il problema non è tecnico, è politico. Come denuncia Stefano Trisorio Liuzzi, ex responsabile open data del Comune di Milano e attivista di Dati Bene Comune, in un’intervista a Agenda Digitale del 12 luglio 2024: «Le pubblicazioni amministrative continuano a trattare i dati come un prodotto finito da consegnare al cittadino, non come una risorsa da riutilizzare. Il formato PDF è scelto proprio perché impedisce il riuso automatico, mantenendo il controllo dell’interpretazione nelle mani dell’amministrazione». In altre parole: se non puoi elaborare i dati, non puoi contestare le decisioni basate su quei dati.
Questa pratica viola apertamente la direttiva UE 2019/1024 (PSI2), che obbliga gli Stati membri a rilasciare i dati di alto valore in formati macchina-leggibili, preferibilmente aperto e standardizzato come CSV, JSON o XML. L’Italia ha recepito la direttiva con il d.lgs. 36/2022, ma l’attuazione è lasciata al buon cuore dei singoli enti. Risultato? Mentre la Francia pubblica il 78% dei suoi dataset di alto valore in CSV o API (fonte: Etalab, settembre 2024) e il Regno Unito raggiunge l’89% tramite data.gov.uk, l’Italia si ferma al 31% secondo il monitoraggio europeo del luglio 2024. Siamo indietro anche rispetto alla Grecia e alla Croazia.
ISTAT, catasto, ACI: il trinomio dell’inaccessibilità
Prendiamo tre pilastri dell’informazione pubblica italiana: ISTAT, Agenzia delle Entrate (catasto) e ACI. Tutti raccolgono dati con fondi pubblici, tutti li trattano come proprietà esclusiva. L’ISTAT, ad esempio, pubblica i dati del censimento permanente della popolazione in formato SuperStar, un software proprietario che richiede una licenza per l’analisi avanzata. I dataset grezzi sono disponibili, sì, ma in formati SAS o SPSS, inaccessibili senza software costosi. Nel frattempo, microdati sintetici utili per la ricerca vengono rilasciati con anni di ritardo e sotto licenze restrittive che ne vietano il riuso commerciale anche quando finanziati con soldi pubblici.
Il catasto è forse il caso più emblematico. Nonostante le ripetute promesse di apertura, le visure catastali rimangono dietro un paywall di 1,50 euro ciascuna sul sito sorella.telemaco.it, gestito da Consorzio Milano Tecnologia, una partecipata delle Camere di Commercio. I dati di base sono teoricamente liberi dal 2010, ma in pratica l’accesso massivo è bloccato da limiti di query, captcha aggressivi e termini di servizio che vietano il download sistematico. Un ricercatore che vuole studiare la distribuzione della proprietà immobiliare deve pagare migliaia di euro o rinunciare. Nel Regno Unito, il Land Registry offre dati completi su proprietà e transazioni tramite API gratuite dal 2015.
L’ACI, poi, pubblica i dati sui veicoli in circolazione solo tramite bollettini mensili in PDF, nonostante abbia un archivio digitale aggiornato in tempo reale utilizzato dalle forze dell’ordine. Un giornalista che vuole analizzare l’età del parco auto italiano deve copiare manualmente le tabelle da 12 PDF all’anno. È assurdo, ma funziona: tiene lontani gli occhi indiscreti da un settore dove interessi privati (concessionari, assicurazioni, finanziarie) hanno tutto da guadagnare dall’opacità.
Il paradosso del valore: dati chiusi che costano più di quelli aperti
Qui entra in gioco il vero scandalo economico. Secondo uno studio del Politecnico di Milano pubblicato a giugno 2024 (link), la mancata apertura dei dati pubblici italiani costa al sistema paese tra i 4,5 e i 6,2 miliardi di euro l’anno in efficienza perduta, innovazione bloccata e duplicazione di sforzi. Parliamo di startup che non possono sviluppare servizi di analisi territoriale, giornalisti che non possono fare data journalism approfondito, cittadini che non possono verificare l’uso dei fondi pubblici. Eppure, lo Stato continua a spendere milioni per mantenere sistemi legacy che producono PDF inutilizzabili.
Il contrasto con la Francia è impressionante. Etalab, la task force francese per i dati pubblici, ha rilasciato nel 2023 il cosiddetto “data.gouv.fr 2.0”, un catalogo dove il 92% dei dataset è accessibile tramite API RESTful, con metadati standardizzati e licenze chiare. Il risultato? Un ecosistema di oltre 300 startup che costruiscono servizi sui dati pubblici, da strumenti di monitoraggio ambientale a piattaforme di comparazione tariffe energetiche. In Italia, il numero di imprese che dichiarano di utilizzare regolarmente dati open data nazionali è inferiore a 50 secondo l’Istat stesso (indagine 2023).
Anche il Regno Unito mostra cosa è possibile. Il governo britannico ha investito circa 15 milioni di sterline nel programma “Data Market Services” tra il 2021 e il 2023, creando standard di qualità per i dati pubblici e finanziando la trasformazione dei dataset legacy in formati aperti. Il ritorno sull’investimento? Secondo il DCMS, ogni sterlina investita ha generato 8 sterline di valore economico diretto e indiretto entro due anni. L’Italia, invece, spende circa 200 milioni di euro l’anno per mantenere i portali dati.gov.it e le relative infrastrutture, con un ritorno misurabile vicino a zero.
Alternative dal basso: quando i cittadini si riprendono i dati
Di fronte all’inerzia istituzionale, sono nate iniziative dal basso che cercano di aggirare l’opacità attraverso il lavoro collettivo. Progetti come Dati Bene Comune mappano i dataset inaccessibili e organizzano hackathon per estrarre dati da PDF ostili usando strumenti open source come Tabula, Camelot o Apache Tika. Nel 2023, un gruppo di attivisti ha rilasciato catasto-liberato, un tentativo di ricostruire il database catastale nazionale a partire da visure scaricate legalmente (una alla volta, per rispettare i limiti) e georeferenziate tramite OpenStreetMap. È un lavoro di formiche, ma dimostra che l’alternativa esiste.
Un altro esempio è Ondata, collettivo di data scientist e attivisti che ha pubblicato nel marzo 2024 una pulizia e normalizzazione dei dati ISTAT sulle imprese attive, rilasciata sotto licenza CC0 su Zenodo. Il dataset include oltre 6 milioni di unità locali con codici ATECO aggiornati al 2023, qualcosa che l’ISTAT stesso non offre in formato utilizzabile. Ondata ha anche creato scrapy-based spider per monitorare le modifiche ai dati ACI e pubblicare differenze giornaliere su un repository pubblico.
Queste iniziative non sono solo tecniche: sono politiche. Ogni volta che un attivista estrae dati da un PDF scansionato, sta affermando un principio: i dati raccolti con soldi pubblici appartengono al pubblico, non all’amministrazione che li ha prodotti. È una forma di disobbedienza civile digitale, paragonabile allo scioperare dei lavoratori che rifiutano di produrre per un padrone ingiusto.
Verso una sovranità tecnologica dei dati
La soluzione non passa solo per leggi migliori (anche se l’attuazione della PSI2 va monitorata con rigore), ma per un cambiamento di paradigma culturale nelle pubbliche amministrazioni. I dati non sono un prodotto da consegnare, ma un’infrastruttura da mantenere aperto. Come afferma la principessa dello open data italiano, Laura Siboni, in un intervento al Forum PA 2024: «Dobbiamo smettere di chiedere il permesso per usare ciò che è già nostro. L’open data non è un favore che ci fanno gli uffici, è un diritto che abbiamo già pagato».
Passi concreti? Innanzitutto, obbligare tutti gli enti pubblici a rilasciare i nuovi dataset in formato macchina-leggibile fin dalla nascita, con eccezioni motivate e temporanee per i soli dati realmente sensibili. In secondo luogo, finanziare programmi di conversione dei dataset legacy, magari attraverso bandi mirati a università e terzo settore. Infine, riconoscere e sostenere le iniziative di riuso dal basso, invece di ostacolarle con avvocati e diffide. Alcuni comuni virtuosi, come Bologna e Firenze, hanno già iniziato a pubblicare i propri dati su piattaforme decentralizzati basati su CKAN con sincronizzazione automatica a data.gov.it. È una direzione.
Alla fine, la battaglia per l’open data italiano è una battaglia per la democrazia. Se non possiamo accedere facilmente ai dati che descrivono il funzionamento dello Stato, non possiamo tenerlo conto. Se i dati sono chiusi in formati che richiedono competenze specializzate o risorse economiche per essere utilizzati, allora la trasparenza diventa un privilegio di pochi, non un diritto di tutti. E in un paese dove si parla tanto di meritocrazia e uguaglianza, questo è un paradosso che non possiamo più permetterci.
