La Commissione europea ha pubblicato il 10 luglio 2025 il Codice di condotta GPAI, il cui capitolo sulla trasparenza dà forma a uno degli obblighi più discussi del Regolamento UE 2024/1689: il riepilogo pubblico dei dati usati per addestrare i modelli di intelligenza artificiale per finalità generali. A quell’obbligo l’AI Act affianca un template, un modello standardizzato che indica cosa dichiarare e come. È il primo tentativo, su scala normativa, di aprire la scatola nera dei dati su cui si fondano i modelli.
Indice dei contenuti
ToggleLa posta in gioco è alta. Chi conosce i dati di addestramento conosce, in parte, anche i limiti e i rischi del modello.
Perché i dati di addestramento sono il vero cuore opaco
Un modello di IA generativa non è programmato riga per riga. È addestrato.
Le sue capacità emergono dall’analisi di quantità enormi di testi, immagini, codice e altri contenuti. Ciò che il modello sa fare, e ciò che sbaglia, dipende in misura decisiva da cosa ha visto durante l’addestramento. Un modello addestrato su dati sbilanciati riprodurrà quegli squilibri. Un modello che ha ingerito materiale protetto da copyright potrà, in certe condizioni, restituirlo. Per anni queste scelte sono rimaste private, custodite dai laboratori come segreto industriale.
Il template del riepilogo rompe questa opacità, almeno in parte.
La questione non è teorica. Quando un modello restituisce risposte distorte su un gruppo sociale, o riproduce stereotipi, la causa va quasi sempre cercata nei dati di addestramento, non in un’intenzione del programmatore. Lo stesso vale per le lacune: un modello addestrato in prevalenza su contenuti in lingua inglese conoscerà peggio le specificità italiane, dal diritto alla cultura. Chi adotta un modello senza sapere nulla della sua dieta informativa ne eredita i punti ciechi senza poterli prevedere. Aprire, anche solo parzialmente, la composizione dei dati significa dare a chi usa il sistema gli strumenti per anticiparne i limiti.
Cosa chiede il template
Il modello predisposto a livello europeo non pretende l’elenco completo di ogni singolo dato. Sarebbe impossibile e privo di senso pratico.
Chiede invece una descrizione sufficientemente dettagliata delle fonti. I fornitori devono indicare i principali dataset utilizzati, i domini di provenienza dei dati, le categorie di contenuti raccolti e le modalità con cui sono stati acquisiti. L’obiettivo è permettere ai titolari di diritti, alle autorità e al pubblico di farsi un’idea fondata di cosa c’è dentro un modello, senza svelare ogni dettaglio tecnico che equivarrebbe a consegnare la ricetta ai concorrenti.
È un equilibrio difficile. Troppa genericità rende il riepilogo inutile. Troppa precisione espone segreti industriali. Il template cerca la misura intermedia.
La standardizzazione del formato ha un valore che va oltre il singolo modello. Imporre a tutti i fornitori lo stesso schema di dichiarazione permette il confronto: chi valuta più modelli può leggere i rispettivi riepiloghi sapendo che rispondono alle stesse domande, invece di trovarsi davanti a documenti costruiti ciascuno a modo proprio. È la stessa logica che ha reso utili le etichette nutrizionali sugli alimenti, dove il valore non sta solo nell’informazione, ma nel fatto che sia presentata in modo omogeneo e quindi comparabile. Senza un formato comune, la trasparenza si frammenta in tante dichiarazioni incommensurabili tra loro.
Il capitolo dedicato alla trasparenza del Codice di condotta GPAI integra questo strumento con un modello di documentazione più ampio, che descrive lo sviluppo del modello, le sue capacità e i suoi limiti. Riepilogo dei dati e documentazione tecnica lavorano insieme.
C’è una differenza importante tra i due destinatari di questa trasparenza. Il riepilogo dei dati di addestramento è pubblico, pensato per i titolari dei diritti e per la collettività. La documentazione tecnica del codice è invece rivolta alle autorità e ai deployer a valle, cioè a chi userà il modello per costruire i propri prodotti. Il primo strumento serve a tutelare chi ha prodotto i contenuti finiti nell’addestramento; il secondo a tutelare chi costruirà sopra il modello. Insieme, coprono entrambi i lati della catena: chi sta a monte dei dati e chi sta a valle dell’uso.
Il nodo del copyright
Il vero motivo per cui questo obbligo esiste si chiama diritto d’autore.
L’addestramento dei modelli ha attinto, su vasta scala, a contenuti protetti: articoli di giornale, libri, fotografie, codice, opere musicali. Gli autori e gli editori sostengono che il loro lavoro è stato usato senza consenso e senza compenso. I laboratori rispondono invocando le eccezioni per il text and data mining previste dal diritto europeo, eccezioni che però i titolari possono escludere riservandosi i diritti.
Il riepilogo dei dati di addestramento sposta l’equilibrio.
Finché le fonti restavano segrete, un autore non poteva nemmeno sapere se la propria opera fosse finita in un modello. Con il template, il titolare ha uno strumento per verificare, contestare, negoziare. Non risolve le cause in corso, ma dà a chi rivendica i propri diritti un appiglio informativo che prima non esisteva. È un cambiamento di rapporti di forza, non solo di trasparenza.
Il diritto europeo aveva già provato a regolare questo terreno con le eccezioni per il text and data mining, che consentono l’estrazione di testo e dati da opere protette salvo che il titolare non abbia espressamente riservato i propri diritti. Il meccanismo dell’opt out, però, funziona solo se chi possiede i diritti sa che le sue opere vengono usate e in che modo riservarle. Il riepilogo dei dati rende quella riserva esercitabile, perché senza sapere quali fonti un modello attinge è impossibile opporsi in modo mirato. È il tassello che mancava per dare effettività a un diritto che esisteva sulla carta ma restava difficile da far valere.
Le controversie giudiziarie intanto proseguono in più paesi, con editori, agenzie di stampa e artisti che contestano l’uso delle loro opere. Nessuna di queste cause si chiude con il template, ma tutte si avvantaggiano di un contesto in cui la provenienza dei dati non è più un segreto assoluto.
Cosa cambia per chi sviluppa e per chi adotta
L’obbligo ricade sui fornitori, ma le sue conseguenze si propagano.
Per chi sviluppa un modello, il riepilogo impone un lavoro di tracciabilità a monte. Non si può dichiarare ciò che non si è documentato. Significa che i fornitori devono tenere traccia delle fonti fin dalla raccolta dei dati, una disciplina che molti non avevano e che cambia il modo di costruire i dataset.
Per chi adotta un modello, il riepilogo diventa uno strumento di valutazione del rischio. Un’azienda che integra un modello nei propri processi può, leggendo il riepilogo, farsi un’idea di quali contenuti il modello abbia visto e quindi di quali rischi, anche di copyright, possa ereditare a valle. Scegliere un modello la cui provenienza dei dati è dichiarata in modo chiaro è una forma di tutela.
Il punto riguarda da vicino le imprese che generano contenuti da rivendere. Se un modello ha appreso da materiale protetto e ne restituisce porzioni riconoscibili, chi pubblica quel contenuto può trovarsi esposto a una contestazione di violazione del diritto d’autore, pur non avendo copiato consapevolmente nulla. Conoscere la provenienza dei dati del modello che si usa diventa allora un elemento di valutazione del rischio commerciale, non una curiosità tecnica. È una delle ragioni per cui il riepilogo, nato come obbligo dei fornitori, finisce per interessare soprattutto chi sta a valle.
Per orientarsi tra questi obblighi, AIPIA mette a disposizione una guida operativa all’AI Act e approfondisce il rapporto tra dati, modelli e diritti nella sua raccolta di testi sull’intelligenza artificiale, dove il tema della provenienza dei dati ricorre come uno dei più discussi.
I limiti di una trasparenza dichiarata
Sarebbe ingenuo considerare il template una soluzione definitiva.
Un riepilogo è un’autodichiarazione. Il fornitore descrive le proprie fonti, e la verifica esterna di quella descrizione è tecnicamente complessa. Nessuno può ricostruire con certezza, da fuori, l’intero dataset di un modello. La trasparenza che il template introduce è quindi reale ma parziale: si fonda sulla buona fede del dichiarante e sulla capacità delle autorità di sanzionare le dichiarazioni false. Il valore dello strumento dipenderà da quanto seriamente verrà controllato.
C’è poi una tensione di fondo che il template non risolve, ma rende visibile. Da una parte la richiesta di trasparenza, dall’altra la difesa del segreto industriale. I fornitori sostengono che la composizione dei dati è parte del proprio vantaggio competitivo, e che rivelarla troppo nel dettaglio significherebbe consegnare ai concorrenti il frutto di investimenti enormi. La Commissione ha cercato un punto di mediazione chiedendo un riepilogo sufficientemente dettagliato ma non esaustivo. Dove cada esattamente quel confine sarà oggetto di interpretazione, e probabilmente di contenzioso, nei prossimi anni.
Una trasparenza che l’Europa impone per prima
Conviene collocare l’obbligo nel quadro internazionale per coglierne la portata.
Nessun’altra grande giurisdizione ha imposto, finora, un obbligo paragonabile di dichiarazione delle fonti di addestramento. Gli Stati Uniti hanno affrontato la questione soprattutto sul terreno giudiziario, lasciando ai tribunali il compito di stabilire i confini dell’uso lecito, senza un obbligo generale di trasparenza a monte. L’Europa sceglie invece la via regolatoria, fissando un dovere informativo che vale per chiunque metta un modello sul mercato interno, a prescindere da dove sia stato addestrato. È la stessa logica extraterritoriale già vista con la protezione dei dati: chi vuole operare nel mercato europeo accetta le sue regole, anche se ha sede altrove.
Questo significa che il template, pur essendo una norma europea, finisce per incidere sulle pratiche globali dei grandi laboratori, che difficilmente costruiranno una versione trasparente dei propri modelli per l’Europa e una opaca per il resto del mondo. La trasparenza imposta in un mercato tende a propagarsi negli altri.
Un precedente che ridisegna il rapporto tra dati e potere
Il riepilogo dei dati di addestramento è uno degli obblighi meno appariscenti dell’AI Act e uno dei più gravidi di conseguenze.
Per la prima volta una norma stabilisce che chi costruisce un modello non può tenere completamente segreto ciò su cui lo ha costruito. È un principio che intacca il modello di business fondato sull’opacità dei dati e che ridà a chi produce contenuti una leva, sia pure imperfetta. L’intelligenza artificiale si è nutrita per anni del lavoro altrui senza doverlo dichiarare. Il template segna il momento in cui quella stagione, almeno sul piano del diritto europeo, si chiude.
di Redazione AIPIA
Contenuti a cura della redazione dell'Associazione Italiana Professionisti dell'Intelligenza Artificiale.
Articoli correlati
- Emerge lo schema commerciale che limita Claude Mythos al settore difensivo
- Deepfake e contenuti sintetici: il divieto UE delle app di nudificazione e la difesa della persona
- Pew Research 2026: perché metà degli americani teme l'IA più di quanto la apprezzi
- Magnifica Humanitas: la prima enciclica di Leone XIV dedicata all'intelligenza artificiale
- Geopolitica dell'IA: DeepSeek nel Sud globale e la frammentazione tecnologica
























