Quando OpenAI ha rilasciato GPT-5 il 7 agosto 2025, il modello è arrivato con una finestra di contesto già più ampia dei predecessori e con la promessa di un’espansione progressiva. Con GPT-5.2, disponibile da inizio 2026, la finestra è salita a 400.000 token, il doppio rispetto alla generazione precedente. Con GPT-5.4, annunciato per marzo 2026, arriva a un milione di token nella versione API e Codex. La progressione racconta una strategia precisa di OpenAI: rendere il contesto lungo non un’opzione premium ma la norma di funzionamento dei modelli linguistici di punta. E non è l’unica a muoversi in questa direzione: Google con Gemini e Anthropic con Claude seguono traiettorie parallele.
Indice dei contenuti
ToggleCosa significa concretamente un milione di token di contesto
Un milione di token equivale, approssimativamente, a 750.000 parole in inglese (leggermente meno in italiano, dove le parole tendono a essere più lunghe). Per dare un riferimento concreto: sono circa dieci romanzi di lunghezza media, o l’intera documentazione tecnica e commerciale di un progetto aziendale di medie dimensioni, o alcuni anni di corrispondenza email di un professionista, o un’intera base di codice software di dimensioni consistenti. In termini pratici, un modello con questa finestra di contesto può ricevere in input tutto questo materiale in un’unica sessione e ragionare su di esso in modo coerente.
Con i modelli di generazioni precedenti, che operavano con finestre da 8.000, 32.000 o al massimo 128.000 token, lavorare su documenti lunghi richiedeva strategie di frammentazione: dividere il testo in blocchi, processarli separatamente, ricomporre i risultati alla fine. Ogni frammentazione comportava una perdita di contesto, il modello non poteva vedere le connessioni tra blocchi diversi, e possibili incoerenze nelle risposte. Servivano architetture complesse per gestire il flusso: sistemi RAG (Retrieval-Augmented Generation) con database vettoriali, pipeline di chunking, strategie di overlap tra blocchi. Con una finestra da un milione di token, molti di questi workaround diventano superflui per i documenti di dimensioni medie. Il modello vede tutto in una volta.
La differenza non è solo quantitativa. Un modello che può leggere l’intera documentazione tecnica di un software insieme al codice sorgente e ai log di errore può rispondere a domande che richiedono la comprensione di dipendenze trasversali tra moduli. Un modello che può analizzare un contratto di cento pagine con tutti gli allegati in un unico passaggio può identificare clausole contraddittorie che un’analisi frammentata, dove la clausola A è in un blocco e la clausola B in un altro, potrebbe non cogliere. Un modello che può leggere un intero anno di verbali di consiglio di amministrazione può ricostruire l’evoluzione di una strategia aziendale nel tempo.
La corsa al contesto lungo: tre strategie a confronto
OpenAI non è sola nella corsa al contesto esteso, e il modo in cui ciascun laboratorio affronta il problema è diverso. Google ha offerto una finestra da un milione di token con Gemini 2.5 Pro già nel secondo semestre 2025, sfruttando un’architettura multimodale che permette di processare non solo testo ma anche immagini, audio e video all’interno della stessa finestra. Per Google, il contesto lungo è il terreno dove Gemini si differenzia: la capacità di ragionare su un video di un’ora o su un archivio di centinaia di immagini insieme a documenti testuali è un vantaggio competitivo che i concorrenti text-first non possono replicare con la stessa naturalezza.
Anthropic ha ampliato progressivamente le capacità di contesto di Claude, puntando su un aspetto che i numeri grezzi non catturano: la qualità della comprensione nei contesti lunghi. Un modello può accettare nominalmente un milione di token in input, ma se la qualità delle risposte degrada oltre una certa soglia, se il modello “dimentica” le informazioni nella parte centrale del prompt, un problema noto come “lost in the middle”, la finestra dichiarata è più grande della finestra effettiva. Anthropic ha investito nella coerenza del ragionamento attraverso l’intera finestra, non solo nell’espansione della dimensione massima.
I benchmark dedicati al contesto lungo confermano che le prestazioni non sono uniformi. Il test OpenAI-MRCR (Multi-Round Co-reference Resolution) valuta la capacità di un modello di ritrovare e riferirsi correttamente a informazioni distribuite in punti diversi di un contesto molto lungo. I cosiddetti test “needle in a haystack” inseriscono un’informazione specifica in un punto casuale di un contesto di centinaia di migliaia di token e verificano se il modello riesce a recuperarla. Diversi test indipendenti hanno dimostrato che molti modelli, pur accettando nominalmente contesti molto ampi, degradano la qualità delle risposte quando le informazioni rilevanti si trovano nella parte centrale dell’input. La finestra dichiarata e la finestra effettiva non sempre coincidono, un dato che i consumatori e le aziende dovrebbero tenere presente quando confrontano le specifiche tecniche.
Cosa cambia per gli sviluppatori di applicazioni AI
Per chi sviluppa applicazioni basate su modelli linguistici, il contesto da un milione di token cambia l’architettura dei sistemi in modo concreto. Molte applicazioni RAG sono state progettate per compensare le limitazioni del contesto corto: recuperano frammenti rilevanti da un database vettoriale, li iniettano nel prompt e chiedono al modello di rispondere usando quei frammenti come base. Il sistema funziona, ma introduce complessità: bisogna scegliere come tagliare i documenti in chunk, come indicizzarli, quale algoritmo di retrieval usare, quanti frammenti includere nel prompt. Ogni scelta introduce un margine di errore.
Con un contesto da un milione di token, parte di questa complessità può essere eliminata per i casi d’uso di dimensioni medie. Invece di cercare i frammenti rilevanti in un database, si carica l’intero documento, o l’intero insieme di documenti, nel prompt del modello. Il vantaggio è la semplicità e la completezza: il modello ha accesso a tutto il materiale, non solo ai frammenti selezionati dall’algoritmo di retrieval. Lo svantaggio è il costo: più token in input significano più spesa per ogni richiesta.
La RAG non diventa obsoleta. Per dataset molto grandi, miliardi di documenti, basi di codice con milioni di righe, archivi storici di decenni, il contesto lungo non basta e il recupero selettivo resta indispensabile. Ma per casi d’uso di dimensioni intermedie, analisi di un singolo progetto, revisione di un dossier legale, studio di una base normativa, audit di una base di codice di dimensioni moderate, il contesto esteso semplifica l’architettura, riduce i punti di errore e migliora la qualità delle risposte eliminando il rischio che il sistema di retrieval ometta un frammento rilevante.
Il costo è un fattore da monitorare attentamente. GPT-5.4 applica un prezzo doppio per i prompt che superano i 272.000 token di input, sia per il prezzo di input sia, in parte, per l’output. Per le aziende che elaborano grandi volumi di documenti lunghi in modo continuativo, il conto può salire rapidamente. Il bilanciamento tra completezza del contesto e costo dell’inferenza è una decisione progettuale che ogni team deve calibrare sul proprio caso d’uso, valutando se il miglioramento qualitativo delle risposte giustifica il costo aggiuntivo.
Implicazioni per la sicurezza e la privacy dei dati
L’ampliamento della finestra di contesto pone anche questioni nuove in materia di sicurezza e privacy. Un prompt da un milione di token può contenere informazioni altamente sensibili: dati finanziari, informazioni personali, segreti industriali, strategie aziendali riservate. Quando questo prompt viene inviato via API a un fornitore di modelli proprietari, tutto il materiale transita sui server del fornitore. Per le aziende europee soggette al GDPR, questo solleva interrogativi concreti: i dati personali contenuti nel prompt vengono trattati dal fornitore del modello? Per quanto tempo vengono conservati? In quale giurisdizione risiedono i server che li processano?
OpenAI, Anthropic e Google offrono garanzie contrattuali sulla non-utilizzo dei dati di prompt per il training e sulla conformità a standard di sicurezza come SOC 2. GPT-5.4 introduce anche opzioni di residenza dei dati a livello regionale, con un sovrapprezzo del 10%. Per le aziende con requisiti di conformità particolarmente stringenti, sanità, difesa, pubblica amministrazione, queste garanzie possono non essere sufficienti, e l’alternativa è l’inferenza locale con modelli open source, che però non offrono ancora finestre di contesto paragonabili a quelle dei modelli proprietari di punta.
Un altro aspetto di sicurezza riguarda il rischio di prompt injection su contesti lunghi. Più il prompt è ampio, più aumenta la superficie di attacco: un documento apparentemente innocuo inserito in un contesto da un milione di token potrebbe contenere istruzioni nascoste che inducono il modello a comportarsi in modo imprevisto. I laboratori stanno lavorando su difese specifiche per i contesti lunghi, ma il problema è aperto e le soluzioni attuali non sono a prova di errore.
Implicazioni per i professionisti e le imprese italiane
Per un avvocato che deve analizzare un contratto complesso con decine di allegati, un milione di token significa poter caricare l’intero dossier e chiedere al modello di identificare rischi, incoerenze e clausole problematiche in un’unica richiesta, senza dover selezionare manualmente i passaggi rilevanti o rischiare di perdere un riferimento cruciale in un allegato dimenticato. Per un consulente finanziario, significa processare bilanci, piani industriali, documentazione di due diligence e benchmark di settore in una singola sessione, ottenendo un’analisi che tiene conto di tutte le informazioni disponibili.
Per un project manager, significa dare al modello accesso a tutta la documentazione di progetto, specifiche tecniche, email, report di avanzamento, verbali delle riunioni, ticket di assistenzae ottenere risposte contestualizzate che considerano la storia completa del progetto. Per un ricercatore, significa caricare decine di paper scientifici e chiedere una rassegna bibliografica che identifichi connessioni e contraddizioni tra gli studi.
Il rischio speculare è l’eccesso di fiducia. Un modello con contesto lungo non è un modello infallibile. Può ancora allucinare, può ancora sbagliare le inferenze, può ancora confondere informazioni all’interno di un documento complesso, può ancora perdere di vista un dettaglio a pagina 47 di un documento di 200 pagine. Il contesto esteso riduce certi errori, quelli dovuti alla frammentazione e alla perdita di informazioni tra blocchi, ma non elimina gli errori intrinseci del modello. La verifica umana resta indispensabile, soprattutto su documenti con implicazioni legali, finanziarie o mediche. L’IA con un milione di token di contesto è uno strumento potente, non un sostituto del giudizio professionale.
Per le imprese italiane, il messaggio pratico è questo: la finestra di contesto determina quali compiti possono essere delegati in modo affidabile a un modello linguistico, e man mano che la finestra si amplia, aumenta la gamma di attività in cui l’IA può dare un contributo reale. Non si tratta solo di efficienza: si tratta di poter affrontare problemi che prima richiedevano ore di lavoro umano per la sola raccolta, organizzazione e lettura delle informazioni. Il contesto da un milione di token non rende l’IA onnisciente. La rende capace di lavorare su scala, e per chi sa usarla, questa è una differenza che conta.
di Redazione AIPIA
Contenuti a cura della redazione dell'Associazione Italiana Professionisti dell'Intelligenza Artificiale.
Articoli correlati
- Claude Sonnet 5: un milione di token di contesto al prezzo di lancio
- Modelli open source contro proprietari: la grande biforcazione del 2026
- GLM-5 e il chip cinese Ascend: un modello di frontiera senza NVIDIA
- Gemini 3.1 Pro: Google torna in vetta ai benchmark AI
- Grok 4.20 e l'architettura multi-agente: quattro AI in parallelo
























