Strategia

La guerra dei prezzi dei token: quanto costa l’intelligenza nell’estate 2026

di Redazione AIPIA ·

SpaceXAI ha fissato l’8 luglio 2026 il prezzo di Grok 4.5 a 2 dollari per milione di token in ingresso e 6 dollari in uscita, dichiarando un costo inferiore di circa il 60 per cento rispetto a Opus 4.8 e GPT-5.5. Il giorno dopo OpenAI ha portato in disponibilità generale GPT-5.6, la cui variante Luna costa 1 dollaro in ingresso e 6 in uscita. Una settimana prima, il 30 giugno, Anthropic aveva lanciato Claude Sonnet 5 con un prezzo introduttivo di 2 e 10 dollari valido fino al 31 agosto. Tre mosse in dieci giorni che raccontano la stessa storia: sul mercato dei modelli linguistici è in corso una guerra dei prezzi. Questo articolo la legge dal punto di vista economico, con qualche conto in tasca a chi quei modelli li deve pagare.

Aggiungi AIPIA tra i preferiti su Google

Il listino dell’estate 2026, voce per voce

Prima di tutto, l’unità di misura. I modelli via API si pagano a consumo, per milione di token elaborati: un token corrisponde grosso modo a tre quarti di parola inglese, un po’ meno in italiano. Si paga sia il testo inviato al modello, l’input, sia quello generato, l’output, che costa sempre di più perché generare è più oneroso che leggere.

Ecco i listini di questa estate. Claude Sonnet 5 costa 2 dollari per milione di token in ingresso e 10 in uscita fino al 31 agosto 2026; dal 1 settembre passerà al listino ordinario di 3 e 15 dollari. Grok 4.5 si presenta a 2 e 6 dollari, con la dichiarazione esplicita di costare circa il 60 per cento meno dei diretti concorrenti di fascia alta. GPT-5.6 arriva in tre varianti: quella intermedia, Luna, costa 1 dollaro in ingresso e 6 in uscita, mentre la variante maggiore, Sol, resta in anteprima a 5 e 30 dollari. Più in basso c’è DeepSeek, il laboratorio cinese che da anni fa da pavimento al mercato: la versione V4 Flash costa 0,14 e 0,28 dollari, la V4 Pro ha un listino di 1,74 e 3,48 dollari su cui è attivo uno sconto promozionale del 75 per cento.

Una precisazione di metodo: questo non è un confronto di qualità.

Le capacità dei modelli differiscono, e la scelta giusta dipende dal compito. Qui interessa la dinamica economica: prezzi di ingresso sotto i 2 dollari e prezzi di uscita tra 6 e 15, per modelli che i produttori collocano nella fascia alta delle proprie gamme. Dodici mesi fa cifre simili appartenevano ai modelli economici, non alle ammiraglie.

Perché il listino non dice tutto: tokenizer, cache e fasce orarie

Chi si ferma al prezzo per milione di token confronta mele con pere, per almeno tre ragioni. E poiché sono le ragioni su cui i reparti acquisti sbagliano più spesso i preventivi, vale la pena passarle in rassegna una per una, con i numeri dichiarati dai fornitori stessi.

La prima è il tokenizer, il sistema con cui ogni modello spezza il testo in token. Non è uguale per tutti: Anthropic ha dichiarato che Sonnet 5 usa un tokenizer aggiornato, e lo stesso testo può produrre fino al 35 per cento di token in più rispetto al conteggio precedente, a seconda del tipo di contenuto. Un prezzo unitario più basso su un conteggio più alto può costare quanto prima: l’unico confronto onesto si fa sul costo per attività completata, non per token.

La seconda è la cache. Tutti i grandi fornitori scontano pesantemente i token di input già visti di recente: Anthropic dichiara risparmi fino al 90 per cento sull’input in cache e del 50 per cento con l’elaborazione in batch, DeepSeek prezza l’input in cache a un decimo del listino. Per applicazioni che ripetono lo stesso contesto, un assistente che risponde su un manuale aziendale, per esempio, la cache cambia l’ordine di grandezza della bolletta.

La terza è il tempo. DeepSeek applica da tempo prezzi differenziati per fascia oraria, con sconti che storicamente hanno oscillato tra il 50 e il 75 per cento nelle ore di minore domanda. È il segnale più esplicito di come funziona questa economia: i fornitori vendono capacità di calcolo deperibile, come i posti su un aereo, e il peak pricing serve a riempire le macchine quando l’Asia dorme o l’America non è ancora sveglia.

Due simulazioni per una PMI italiana

Proviamo a tradurre i listini in spesa mensile, con due casi tipici e numeri prudenti. I prezzi sono in dollari, come da listino: al cambio attuale la differenza con l’euro non sposta gli ordini di grandezza di cui parliamo.

Primo caso: uno studio professionale che analizza documenti. Ipotizziamo 400 documenti al mese, con circa 5.000 token letti e 1.000 generati per ciascuno: fanno 2 milioni di token in ingresso e 0,4 milioni in uscita ogni mese. Con Sonnet 5 a prezzo introduttivo il conto è di 8 dollari al mese; a listino pieno, 12. Con Grok 4.5 si scende a 6,40 dollari, con GPT-5.6 Luna a 4,40. Cifre da abbonamento telefonico, non da investimento tecnologico.

Secondo caso: un’azienda con un assistente clienti automatizzato. Ipotizziamo 50.000 conversazioni al mese, ciascuna con circa 3.000 token di contesto in ingresso e 500 in uscita: 150 milioni di token letti, 25 milioni generati. Con Sonnet 5 introduttivo sono 550 dollari al mese, che salgono a 825 a listino pieno; con Luna circa 300, con Grok 4.5 circa 450. E poiché gran parte del contesto si ripete a ogni conversazione, la cache può tagliare la voce più pesante in modo drastico: il costo reale, ben ottimizzato, scende spesso sotto la metà di questi valori.

La conclusione operativa è controintuitiva.

Per la stragrande maggioranza delle PMI italiane, il costo dei token è ormai una voce marginale: poche decine o poche centinaia di euro al mese anche per usi intensivi. Le voci che decidono il successo o il fallimento di un progetto sono altre: l’integrazione con i sistemi esistenti, il controllo di qualità sulle risposte, la protezione dei dati e, sopra tutte, la preparazione delle persone che devono usare questi strumenti dentro processi reali. Chi vuole costruirsi un quadro ordinato di queste competenze può partire dai percorsi formativi sull’intelligenza artificiale di AIPIA, pensati per professionisti e decisori non tecnici.

Tre anni di caduta verticale

Per apprezzare la traiettoria serve la serie storica. Nel marzo 2023 GPT-4, allora il modello di riferimento, costava 30 dollari per milione di token in ingresso e 60 in uscita. Nell’estate 2026 modelli molto più capaci costano tra 1 e 3 dollari in ingresso: la fascia alta del mercato ha visto i prezzi dividersi per dieci, e in alcuni confronti per venti, in poco più di tre anni. Poche tecnologie nella storia industriale hanno mostrato una deflazione così rapida a capacità crescente.

Le cause sono in parte fisiologiche.

I processori dedicati all’inferenza migliorano di generazione in generazione, le tecniche di ottimizzazione dei modelli riducono il calcolo necessario per ogni risposta, e la concorrenza tra fornitori di cloud abbassa i costi dell’infrastruttura. Una parte del calo dei prezzi riflette quindi un calo genuino dei costi: vendere intelligenza costa davvero meno di un anno fa.

La deflazione, intanto, cambia cosa conviene fare. A 60 dollari per milione di token in uscita, far lavorare un modello per ore su un compito era un lusso da laboratorio; a 6 dollari diventa una scelta ordinaria. È il motivo per cui il 2026 è l’anno degli agenti, sistemi che macinano decine di milioni di token per completare un singolo incarico complesso: non sono diventati possibili perché i modelli sono più intelligenti, o non solo. Sono diventati possibili perché ogni loro passo costa dieci volte meno di prima. Il prezzo, in questo mercato, non segue l’innovazione: la precede e la seleziona.

Ma la fisiologia spiega solo una parte del calo. Ed è qui che la lettura economica si fa interessante.

Sotto costo per conquistare il mercato? Gli indizi

La domanda che gli analisti si fanno da mesi è se i prezzi di questa estate coprano i costi. Rispondere con certezza è impossibile dall’esterno, perché i costi di inferenza dei laboratori sono tra i segreti meglio custoditi del settore. Gli indizi, però, si possono mettere in fila.

Primo indizio: i prezzi introduttivi con scadenza, come quello di Sonnet 5 valido fino al 31 agosto, sono per definizione prezzi promozionali, pensati per spostare clienti prima del ritorno al listino. Secondo: le dichiarazioni di sconto rispetto ai concorrenti, come il 60 per cento rivendicato da SpaceXAI, descrivono una strategia di penetrazione, non un equilibrio di costi. Terzo: i laboratori di frontiera sostengono investimenti enormi in addestramento e infrastruttura, finanziati da capitale di rischio e non dai margini correnti; su questo blog abbiamo raccontato la corsa ai finanziamenti che li alimenta. Quarto: la storia recente del settore tecnologico, dal cloud al food delivery, insegna che le guerre di prezzo finanziate dal capitale finiscono quando il mercato si consolida, e i listini poi risalgono.

Va aggiunto il ruolo del pavimento cinese. Con listini fino a venti volte inferiori a quelli occidentali e pesi dei modelli spesso pubblicati, DeepSeek e gli altri laboratori open-weight fissano il prezzo di riserva dell’intero mercato: nessun fornitore americano può allontanarsi troppo dal pavimento senza dover dimostrare, benchmark alla mano, che la differenza di qualità vale la differenza di prezzo. È una pressione che non dipende dalle promozioni e non scadrà il 31 agosto.

C’è però un contrappeso che rende questo mercato diverso: i costi di cambio fornitore restano bassi. Le API dei principali modelli sono in larga parte intercambiabili, e un’impresa che ha costruito bene la propria applicazione può passare da un modello all’altro in giorni, non in mesi. Finché questa portabilità regge, nessun fornitore può alzare i prezzi impunemente. La vera partita dei prossimi anni si gioca proprio qui: agganciare i clienti a strumenti, agenti e funzioni proprietarie che rendano il cambio costoso, per poi ricostruire il potere di prezzo che oggi la concorrenza cancella.

Le clausole che contano più del prezzo

Per un’impresa italiana che firma oggi un contratto o costruisce un progetto su questi modelli, la lezione dell’estate 2026 si riassume in tre cautele. Progettare fin dall’inizio per la portabilità, evitando dipendenze profonde da funzioni esclusive di un singolo fornitore quando non servono. Misurare il costo per attività completata, non il prezzo per token, mettendo in conto tokenizer, cache e volumi reali. E trattare i prezzi correnti come congiunturali: chi costruisce un business plan assumendo che l’intelligenza costerà per sempre quanto costa oggi ripete l’errore di chi, dieci anni fa, considerava eterni i tassi a zero. Su come impostare queste valutazioni dentro l’organizzazione, i programmi di formazione aziendale di AIPIA lavorano esattamente su questo confine tra tecnologia e conto economico.

La guerra dei prezzi dei token è una notizia eccellente per chi compra, oggi. Ma i prezzi di una guerra non sono i prezzi della pace che seguirà: conviene approfittarne sapendo che la bonanza ha una data di scadenza, anche se nessun listino la dichiara.

Aggiungi AIPIA tra i preferiti su Google
Con il supporto di:AdobeAnthropicMetaMicrosoftCanvaAsanaDocuSignZoomHootsuiteUpworkKeelaAzure
Iscriviti
🇮🇹Italiano✓ 🇬🇧English✓ 🇪🇸Español✓