Il 29 giugno 2026 l’International Journal for Educational Integrity ha pubblicato uno studio indipendente su quattro strumenti per riconoscere i testi generati dall’intelligenza artificiale: Pangram, GPTZero, Copyleaks e Turnitin. Sui documenti scritti interamente da un modello linguistico, Turnitin ha restituito sistematicamente un punteggio dello 0%. Gli autori concludono che questi strumenti possono offrire una prima segnalazione, ma non vanno usati come prova unica nelle decisioni importanti. Chi cerca un rilevatore AI per controllare una tesi, un compito o un articolo trova invece quasi solo pagine di produttori che dichiarano accuratezze del 98 o 99%. Questa guida mette a confronto quelle dichiarazioni con gli studi indipendenti, spiega cosa misura davvero un punteggio e cosa fare quando un testo viene segnalato.
Indice dei contenuti
ToggleStudi, linee guida e pagine dei produttori consultati il 5 ottobre 2026.
Cosa fa un rilevatore AI, e cosa non può fare
Un rilevatore di testo generato dall’AI analizza le caratteristiche statistiche di un testo (quanto sono prevedibili le parole, quanto varia la struttura delle frasi) e le confronta con quelle tipiche dei testi umani e dei testi prodotti dai modelli. Il risultato è un punteggio: una stima di probabilità, o una percentuale di testo che lo strumento ritiene generata.
Un punteggio non è una prova. Questa distinzione regge tutto il resto dell’articolo.
Quattro termini aiutano a leggere qualsiasi studio. Il punteggio di rilevazione è il numero che lo strumento restituisce, e dipende dalla soglia scelta dal produttore. La probabilità è ciò che quel numero esprime nel migliore dei casi: una stima, non un accertamento. Un falso positivo è un testo scritto da una persona che lo strumento segnala come generato: è l’errore che produce accuse ingiuste. Un falso negativo è un testo generato che lo strumento classifica come umano: è l’errore che lascia passare chi ha usato l’AI. Nessuno strumento riduce a zero entrambi gli errori, e abbassare uno dei due di solito alza l’altro. Il punto di equilibrio lo sceglie il produttore, non chi legge il punteggio.
Cosa dicono gli studi indipendenti
Lo studio più citato è quello di Weixin Liang e colleghi della Stanford University, pubblicato nel 2023 sulla rivista Patterns. Sette rilevatori sono stati provati su 91 saggi scritti da persone per il TOEFL, l’esame di inglese per non madrelingua. Il tasso medio di falsi positivi è stato del 61,22%: più di metà dei saggi umani è stata scambiata per testo generato. Diciotto saggi su 91 sono stati segnalati da tutti e sette gli strumenti, 89 su 91 da almeno uno.
Sugli elaborati di studenti statunitensi, invece, gli stessi strumenti erano quasi perfetti.
Nello stesso anno Debora Weber-Wulff e un gruppo internazionale di ricercatori hanno provato 14 strumenti su 54 documenti di prova, pubblicando i risultati sull’International Journal for Educational Integrity. La conclusione è netta: gli strumenti disponibili “non sono né accurati né affidabili” e tendono a classificare i testi come umani. Il migliore, Turnitin, ha raggiunto il 76% di accuratezza; GPTZero il 54%, ZeroGPT il 59%. Quando i testi generati venivano riformulati con uno strumento automatico di parafrasi, l’accuratezza su quella categoria scendeva al 26%: la maggior parte dei testi generati passava inosservata.
Uno studio teorico pubblicato su Transactions on Machine Learning Research ha mostrato che la parafrasi ripetuta abbassa in modo marcato le prestazioni di tutte le famiglie di rilevatori, compresi quelli basati su filigrane digitali, con un peggioramento minimo della qualità del testo.
La prova più eloquente l’ha data OpenAI. L’azienda di ChatGPT aveva lanciato il proprio classificatore a gennaio 2023 e lo ha ritirato il 20 luglio dello stesso anno “a causa del basso tasso di accuratezza”. Secondo i dati pubblicati dalla stessa OpenAI, riconosceva correttamente come probabilmente generato solo il 26% dei testi prodotti dall’AI e segnalava come generato il 9% dei testi umani.
Lo studio del giugno 2026, su 160 documenti costruiti appositamente in quattro categorie (umani, generati, ibridi e generati poi “umanizzati”), offre un quadro aggiornato e diverso. I falsi positivi sono stati rari per tutti gli strumenti, segno di miglioramento rispetto al 2023. Il problema si è spostato sui falsi negativi: GPTZero, Copyleaks e Turnitin hanno sottostimato in modo marcato i testi generati, soprattutto quelli prodotti con i modelli più recenti; GPTZero e Copyleaks hanno mancato anche gran parte dei testi ibridi e rielaborati.
Dichiarato dal produttore, verificato da terzi
Le percentuali che compaiono sulle pagine commerciali sono misurate dai produttori, su dati e condizioni scelti da loro. Non sono false per definizione, ma non sono confrontabili con le verifiche indipendenti.
| Strumento | Cosa dichiara il produttore | Cosa hanno trovato verifiche indipendenti |
|---|---|---|
| Turnitin | Falsi positivi sotto l’1% per documenti con oltre il 20% di testo generato; il punteggio non va usato come unica base per decidere | 76% di accuratezza nel 2023 (Weber-Wulff); punteggio dello 0% sui testi interamente generati nello studio del 2026 |
| GPTZero | Si presenta come il rilevatore più accurato; addestrato soprattutto su prosa inglese di adulti | 54% di accuratezza nel 2023; forte sottostima dei testi generati nel 2026 |
| Copyleaks | Oltre il 99% di accuratezza; per l’italiano 99,88% sui testi umani e 97,00% su quelli generati | Nel 2026 ha mancato la maggior parte dei testi ibridi e rielaborati |
| ZeroGPT | 98,4% di accuratezza e meno dell’1% di falsi positivi | 59% di accuratezza nel 2023 |
Va detto che gli strumenti sono cambiati molto dal 2023, e i risultati di allora non descrivono le versioni di oggi. Ma anche lo studio più recente, che pure registra meno falsi positivi, arriva alla stessa conclusione pratica.
Non madrelingua e testi tradotti: chi rischia di più
Lo studio di Liang spiega il meccanismo. Chi scrive in una lingua che non è la propria usa un vocabolario più ristretto e strutture più regolari, cioè proprio le caratteristiche che i rilevatori associano ai testi generati. Quando i ricercatori hanno chiesto a ChatGPT di arricchire il lessico degli stessi saggi TOEFL, il tasso di falsi positivi è sceso dal 61,22% all’11,77%: il paradosso è che un testo ritoccato dall’AI sembrava più umano dell’originale. Anche nello studio di Weber-Wulff i testi umani tradotti automaticamente sono stati scambiati per testi generati molto più spesso degli altri.
Turnitin stesso, nelle sue FAQ, ammette che i falsi positivi sono più probabili su testi ripetitivi, con poca variazione strutturale o parafrasati senza idee nuove. Studenti stranieri, chi scrive in una seconda lingua, chi ha uno stile semplice e schematico: sono i profili su cui un punteggio alto merita più cautela, non meno.
E in italiano?
Qui la risposta onesta è breve: non abbiamo trovato studi indipendenti sull’affidabilità dei rilevatori AI per testi in italiano.
Gli studi citati lavorano sull’inglese. OpenAI dichiarava che il proprio classificatore funzionava “nettamente peggio” nelle altre lingue. GPTZero indica di essere addestrato soprattutto su testi inglesi. Le uniche cifre specifiche per l’italiano che abbiamo trovato sono quelle di Copyleaks, che sono dichiarazioni del produttore senza una metodologia pubblica verificabile. Chi usa un rilevatore su una tesi italiana lo fa, di fatto, senza sapere quanto sbaglia.
Sul piano istituzionale, l’Università di Padova ha preso posizione nelle sue linee guida sull’uso dell’intelligenza artificiale nella didattica e nelle tesi, aggiornate al 28 novembre 2025: non esistono strumenti in grado di individuare con certezza l’uso dell’IA in un documento, e l’Ateneo a oggi non ne sostiene l’utilizzo. Le linee guida raccomandano di non affidarsi esclusivamente ai rilevatori, perché possono generare falsi positivi ed essere aggirati facilmente.
Tesi, università e conseguenze disciplinari
Le conseguenze di un errore non sono simmetriche.
Un falso negativo lascia passare un elaborato; un falso positivo può portare a un’accusa di plagio contro chi non ha copiato nulla. Per questo i produttori stessi mettono le mani avanti. Turnitin scrive che non stabilisce se c’è stata una violazione, che fornisce dati perché siano i docenti a decidere secondo le regole della propria istituzione, e che la percentuale dell’indicatore non deve essere usata come unica base per un’azione o come misura definitiva di valutazione.
Alcuni atenei sono andati oltre. Il 16 agosto 2023 la Vanderbilt University ha disattivato il rilevatore di Turnitin, con un calcolo semplice: anche con il tasso dell’1% dichiarato allora, sui 75.000 elaborati ricevuti nel 2022 circa 750 studenti sarebbero stati segnalati per errore. La Sloan School del MIT, nelle sue indicazioni per i docenti, scrive che i rilevatori hanno tassi d’errore elevati e possono portare ad accusare ingiustamente gli studenti. Lo studio del 2026 aggiunge un dato su cui riflettere: applicato a 1.163 tesi di master, il rilevatore migliore ne ha segnalate il 45,5%, quasi sempre con livelli bassi o moderati, senza che nessuno sappia quante lo fossero davvero.
Chi riceve una segnalazione su un testo scritto da sé ha argomenti concreti. Le bozze e la cronologia delle versioni di un documento mostrano come il testo è nato. Gli appunti, le fonti consultate, la capacità di discutere il contenuto in un colloquio valgono più di qualsiasi percentuale. AIPIA ha affrontato il tema dal lato dei docenti nella guida pratica all’AI per la scuola e i docenti e nell’analisi su intelligenza artificiale e didattica.
Un’ultima avvertenza riguarda i dati. Caricare l’elaborato di uno studente o il testo di un collaboratore su un servizio online di terzi significa trasferire dati personali, e non sempre le condizioni del servizio dicono come vengono conservati. La guida AIPIA su AI e privacy nel rispetto del GDPR aiuta a valutarlo prima di farlo.
Rilevatori e marcatura dei contenuti: due cose diverse
La rilevazione statistica cerca di indovinare l’origine di un testo dopo che è stato scritto. La marcatura funziona al contrario: è il fornitore del modello a inserire nel contenuto un segnale tecnico che ne dichiara l’origine. Il Regolamento UE 2024/1689 (AI Act) prevede obblighi di trasparenza e di marcatura dei contenuti sintetici a carico dei fornitori, che AIPIA ha descritto nell’articolo su trasparenza AI Act e marcatura dei contenuti sintetici. Neanche la marcatura è infallibile, come mostrano gli studi sulla parafrasi, ma sposta la responsabilità su chi produce il contenuto invece che su chi lo riceve.
Come usarli senza fare danni
Un rilevatore può servire come campanello, mai come sentenza. Usato così, ha qualche utilità: un punteggio molto alto su un testo che non somiglia agli altri lavori della stessa persona è un motivo per fare domande, non per trarre conclusioni. Un punteggio basso, d’altra parte, non dimostra che il testo sia umano, visto quanto spesso gli strumenti mancano i testi generati e rielaborati. Per scuole, università e redazioni le misure che funzionano sono altre: regole chiare e scritte su cosa è consentito, compiti che richiedono il processo oltre al prodotto, colloqui orali, versioni intermedie.
La domanda “questo testo l’ha scritto un’AI?” non ha una risposta tecnica affidabile. Ha senso solo la domanda che la segue: chi ne risponde, e sa spiegarlo.
Domande frequenti
I rilevatori AI sono affidabili?
No, non abbastanza da fondare una decisione. Gli studi indipendenti del 2023 hanno misurato accuratezze tra il 26% e il 76% secondo i casi; quello del 2026 registra pochi falsi positivi ma molti testi generati non riconosciuti.
Un rilevatore AI può provare che un testo è stato scritto con ChatGPT?
No. Restituisce una stima statistica, non una prova. Gli stessi produttori, come Turnitin, scrivono che il punteggio non deve essere l’unica base per un provvedimento.
Esiste un rilevatore AI affidabile per l’italiano?
Non abbiamo trovato studi indipendenti sui testi in italiano. Le cifre disponibili per l’italiano sono dichiarazioni dei produttori, senza metodologia pubblica verificabile.
Cosa fare se un rilevatore segnala come AI un testo che ho scritto io?
Raccogliere bozze, cronologia delle versioni del documento, appunti e fonti consultate, e chiedere di discutere il contenuto. Ricordare che gli studi documentano falsi positivi soprattutto su testi di non madrelingua, tradotti o molto schematici.
Turnitin rileva ChatGPT?
Turnitin offre un indicatore di testo generato, ma nello studio indipendente del giugno 2026 ha restituito un punteggio dello 0% sui documenti scritti interamente da un modello linguistico. Turnitin stesso avverte che l’indicatore non va usato come unica base per decidere.
Fonti
- Who wrote this? Evaluating the reliability of AI detection tools in higher education, International Journal for Educational Integrity 22, art. 16 (29 giugno 2026)
- Liang W. et al., GPT detectors are biased against non-native English writers, Patterns 4(7), 2023
- Weber-Wulff D. et al., Testing of detection tools for AI-generated text, International Journal for Educational Integrity 19, art. 26, 2023
- Can AI-Generated Text be Reliably Detected?, Transactions on Machine Learning Research (arXiv:2303.11156)
- OpenAI, New AI classifier for indicating AI-written text (con aggiornamento del 20 luglio 2023)
- Università di Padova, Linee guida per l’impiego degli strumenti di IA generativa nella didattica e nella redazione delle tesi (rev. 28 novembre 2025)
- Vanderbilt University, Guidance on AI Detection and Why We’re Disabling Turnitin’s AI Detector (16 agosto 2023)
- MIT Sloan Teaching & Learning Technologies, AI Detectors Don’t Work (consultata il 5 ottobre 2026)
- Turnitin, AI writing detection capabilities FAQ; GPTZero, FAQ; Copyleaks, AI Content Detector; ZeroGPT (dichiarazioni dei produttori, consultate il 5 ottobre 2026)
di Redazione AIPIA
Contenuti a cura della redazione dell'Associazione Italiana Professionisti dell'Intelligenza Artificiale.
Articoli correlati
- Come leggere i benchmark AI nel 2026: indici, maratone e i loro limiti
- AI per avvocati: strumenti, limiti deontologici e obblighi verso il cliente
- FrontierMath e Humanity's Last Exam: i test che misurano i limiti dell'IA
- Che cos'è un DOI e perché anche una guida professionale ha bisogno di un identificativo persistente
- GPT-5.6, Claude Sonnet 5 e Grok 4.5 a confronto: la comparativa dell'estate 2026
























