Blu7, azienda in corso di riconoscimento MIM per corsi in aula e online. Iscriviti a 7 Pillole Blu.

Sulla pagina pubblica dei prezzi delle API di OpenAI il modello economico della famiglia GPT-5.6 si chiama Luna e costa 0,20 dollari per milione di token in entrata e 1,20 dollari per milione di token in uscita. Il modello di punta della stessa famiglia, Sol, sta a 5 dollari in entrata e 30 in uscita. Sono cifre pubblicate, che chiunque può andare a leggere.

Il prezzo di Luna è recente. Arriva da un taglio dell’80% deciso il 30 luglio 2026 e ricostruito in italiano da Fabio Lalli su AI4Business. Nella stessa analisi il taglio viene accostato a un annuncio arrivato il giorno seguente, il miliardo di utenti attivi raggiunto da OpenAI. Sempre secondo quella ricostruzione, il Wall Street Journal ha riunito le due notizie sotto un titolo solo.

Dallo stesso pezzo arrivano altri due numeri che riguardano da vicino chi compra. Sulle piattaforme per sviluppatori i modelli open di produzione cinese hanno superato il 60% del traffico. Open, qui, vuol dire che chi li produce mette a disposizione i componenti interni del modello invece di tenerli chiusi. E sullo stesso compito la distanza fra i listini di fornitori diversi arriva ormai a due ordini di grandezza.

Due ordini di grandezza vuol dire circa cento volte. Non è una sfumatura. È la differenza fra spendere due dollari e spenderne duecento per ottenere lo stesso risultato. Per una piccola impresa la domanda non è più se possa permettersi l’intelligenza artificiale. È se stia pagando il modello giusto per il lavoro che le serve.

Una nota prima di partire. Tutti i prezzi di questo articolo sono in dollari, come il listino da cui arrivano. Non li converto in euro, perché il cambio si muove per conto suo e non cambia il ragionamento.

Il meccanismo che genera quel costo, fuori dagli uffici tecnici, si spiega di rado. Vale la pena partire da lì, perché è più semplice di quanto sembri.

Cosa vuol dire pagare a token

I sistemi come ChatGPT non leggono parole, leggono token. Un token è un pezzetto di testo, che può essere una parola breve, una porzione di parola lunga, uno spazio o un segno di punteggiatura. La documentazione di Google per i modelli Gemini fissa una regola di conversione utile, secondo cui un token vale circa quattro caratteri e cento token corrispondono più o meno a sessanta o ottanta parole inglesi.

Il conto si fa due volte. Si pagano i token che entrano nel modello, cioè la domanda più tutto il materiale che le si allega. Si pagano poi i token che escono, cioè la risposta. Nei listini dei grandi modelli linguistici le due voci hanno prezzi diversi e sul listino OpenAI il rapporto è netto. Tutti e tre i modelli di testo della famiglia GPT-5.6 hanno l’uscita a sei volte il prezzo dell’entrata, da 0,20 contro 1,20 su Luna fino a 5 contro 30 su Sol.

La ragione è intuitiva. Leggere è veloce, scrivere richiede di produrre una parola dopo l’altra.

Da qui discende la cosa più utile da sapere. Non paghi quanto tempo usi lo strumento, paghi quanto testo gli fai attraversare. Una richiesta lunghissima con una risposta di due righe può costare meno di una richiesta di due righe che genera dieci pagine.

Perché la lingua in cui scrivi cambia il conto

C’è un dettaglio che in Italia conviene conoscere. I sistemi che spezzettano il testo in token sono stati costruiti soprattutto sull’inglese, quindi lo stesso identico contenuto tradotto in un’altra lingua può produrre un numero di token molto diverso. Uno studio di Petrov, La Malfa, Torr e Bibi ha misurato differenze che in alcuni casi arrivano a quindici volte, con ricadute dirette sul costo di accesso ai servizi commerciali, sui tempi di risposta e sulla quantità di materiale che si riesce a passare al modello.

Quello studio non pubblica una cifra per l’italiano, quindi non è possibile dire di quanto salga il conto scrivendo in italiano invece che in inglese. La conseguenza pratica però è chiara. Un preventivo costruito su conteggi di parole inglesi va letto come limite inferiore, mai come cifra finale.

Venti centesimi comprano duemila pagine, ma solo da leggere

Diamo un peso concreto a quei 0,20 dollari, usando la regola di conversione di Google. Un milione di token corrisponde a 600.000-800.000 parole inglesi. A trecento parole per pagina, che è una convenzione nostra e non un dato di fonte, fanno fra duemila e duemilaseicento pagine di parole inglesi date in pasto alla macchina per venti centesimi di dollaro.

Serve un’avvertenza doppia. Quel prezzo copre solo l’entrata, cioè la lettura. La risposta si paga a parte, sei volte tanto. E questi non sono preventivi, sono ordini di grandezza ricavati da prezzi pubblicati e da una regola di conversione dichiarata, su listini che si muovono di settimana in settimana.

Il numero però basta a spostare la prospettiva, perché racconta una cosa vera. Sul lavoro ripetitivo di testo il costo del calcolo, quello che in gergo si chiama inferenza e indica il momento in cui il modello elabora una richiesta, è sceso a un livello che per una PMI conta poco.

Il che sposta il problema altrove. Se un compito ripetitivo costa pochi dollari all’anno, la voce di spesa che pesa non è la fattura del fornitore. Sono le ore delle persone che controllano, correggono e rifanno. Vale la pena tenerlo a mente quando si legge un’offerta, perché il risparmio vero non sta quasi mai nel prezzo per token.

Il modello troppo potente per un compito semplice

È la parte che al momento dell’acquisto quasi non si affronta, quindi conviene dirla qui. Dentro la stessa famiglia esistono modelli diversi per potenza e per prezzo. La scelta è del cliente. Prendere sempre il più potente è comodo, sembra prudente e ricorda la logica del prendo la macchina più grande così sto tranquillo. Applicata al testo, quella logica costa in due modi che si moltiplicano fra loro.

Il primo è ovvio. Il modello grande ha un prezzo per token più alto, venticinque volte tanto fra Luna e Sol. Il secondo si scopre in bolletta. I modelli pensati per ragionare producono passaggi intermedi prima di rispondere, una specie di ragionamento scritto che l’utente non vede. Quei passaggi sono token e si pagano. La documentazione di Google li conteggia come voce separata, insieme al contenuto in cache, cioè alla parte di richiesta già vista in precedenza e tenuta da parte dal fornitore per non rielaborarla ogni volta.

Un modello che ragiona non costa solo di più a token, consuma anche più token per dire la stessa cosa. Su una domanda sola non se ne accorge nessuno. Su ottocento schede prodotto rifatte ogni stagione, sì.

Il conto per un compito ripetitivo

Pensiamo a un’azienda vinicola del Chianti con ottocento referenze a catalogo, cioè ottocento schede prodotto da riscrivere per l’e-commerce. Oppure a uno studio di commercialisti a Novoli che ogni mattina riassume la posta arrivata dai clienti. Sono lavori semplici in senso tecnico. Il materiale c’è già, il formato è fisso, quello che serve è ordine e costanza, non intuizione.

Facciamo il conto delle schede prodotto. Prima gli ingredienti, tutti dichiarati, perché un numero senza ingredienti non vale niente.

  1. Luna, 0,20 dollari per milione di token in entrata e 1,20 in uscita (listino pubblico OpenAI).
  2. Sol, 5 dollari in entrata e 30 in uscita (stesso listino).
  3. Conversione, cento token ogni sessanta-ottanta parole inglesi (documentazione Google).
  4. Convenzione nostra, trecento parole per pagina.
  5. Ipotesi nostre dell’esempio, ottocento schede, cinquecento parole di materiale in entrata per scheda, duecentocinquanta parole di testo prodotto in uscita.

Ottocento schede da cinquecento parole fanno 400.000 parole in entrata, cioè fra 500.000 e 670.000 token. A 0,20 dollari per milione siamo fra 10 e 13 centesimi. Le uscite sono 200.000 parole, cioè fra 250.000 e 335.000 token, che a 1,20 dollari per milione fanno fra 30 e 40 centesimi.

Totale per l’intero catalogo, fra 40 e 53 centesimi di dollaro. Rifacendo un quinto delle schede venute male si resta sotto il dollaro. Il conto è su parole inglesi, quindi in italiano va letto come pavimento e non come cifra esatta.

Adesso lo stesso lavoro immaginando di aver lasciato selezionato il modello di punta. Con Sol l’entrata costa fra 2,50 e 3,33 dollari, l’uscita fra 7,50 e 10. Totale fra 10 e 13 dollari, venticinque volte il primo conto.

Su un catalogo una tantum sono entrambi importi trascurabili. La differenza si vede quando il lavoro si ripete. Un catalogo alla settimana per un anno costa fra i 21 e i 28 dollari con Luna, fra i 520 e i 700 con Sol. Nessuno riceve mai una fattura intestata schede prodotto, quindi quella differenza resta invisibile finché non la si va a cercare.

Attenzione però a non confondere due cose. I due ordini di grandezza citati da AI4Business stanno fra i listini di fornitori diversi, in un mercato spinto verso il basso dai modelli open cinesi. Dentro la famiglia di un solo fornitore la forbice è più stretta e si calcola dal listino pubblico, venticinque volte fra il modello economico e quello di punta.

Quando il modello di punta è la scelta giusta

C’è però l’altra metà del ragionamento. Ignorarla sarebbe disonesto. Se lo studio di Novoli, invece di riassumere la posta, chiede di incrociare tre anni di bilanci per capire dove si è spostato il margine, oppure se una scuola paritaria fiorentina fa analizzare i risultati di un questionario a genitori e docenti per costruirci sopra il piano formativo, il modello economico non è più la scelta giusta.

Qui la differenza fra un modello e l’altro non si vede nel prezzo, si vede nella qualità della risposta. Un’analisi sbagliata costa molto più dei centesimi risparmiati. La regola non è usa il modello economico, è fai corrispondere il modello al compito. Sono due frasi diverse e la seconda è quella che fa risparmiare davvero. Aiuta anche ricordare che non tutte le intelligenze artificiali sono la stessa cosa, perché la scelta comincia prima del listino.

Ma io pago un abbonamento fisso, non i token

È un’obiezione legittima e va accolta. Chi usa l’AI solo dalla chat, con un abbonamento mensile, non vede nessun contatore. Il costo per token esiste lo stesso, ma lo assorbe il fornitore, che in cambio mette limiti d’uso e differenzia i modelli disponibili per piano.

Il tema diventa concreto nel momento in cui si smette di chattare e si comincia ad automatizzare, cioè quando il modello viene collegato al gestionale, al sito o alla posta attraverso una API. Una API è il canale tecnico con cui due programmi si parlano senza che nessuno stia davanti allo schermo. Ogni singola richiesta che passa da quel canale si chiama chiamata ed è l’unità che compare nei conteggi di consumo. È lì che la spesa si moltiplica per il numero di operazioni. Ed è lì che la scelta del modello diventa una voce di bilancio.

Anche restando alla chat, però, un principio si porta a casa. Il costo esiste sempre. Quando non lo paghi in fattura lo paghi in limiti d’uso, in dati o in attenzione. Ne abbiamo scritto a proposito dei servizi di intelligenza artificiale gratuiti ed è la stessa storia vista da un’altra angolazione.

E se la macchina sta in ufficio? Lì il conto cambia forma: non si paga più a token, si paga hardware che deve stare al passo con il lavoro. Cosa lo rallenta davvero e le due domande da fare a chi manda il preventivo stanno in Intelligenza Artificiale in Ufficio? Quanto ti costa.

Quattro leve che abbassano il conto senza peggiorare il risultato

Sono ordinate per rapporto fra fatica e risultato, dalla più facile alla più impegnativa.

  1. Scegliere il modello per compito, non per abitudine. Sul listino OpenAI fra il modello economico e quello di punta ballano venticinque volte, sia in entrata sia in uscita. Costa mezz’ora di prova iniziale, in cui si fa girare lo stesso lavoro su due modelli diversi e si confronta l’esito.
  2. Elaborare in blocco quando non c’è fretta. Chi vende applica uno sconto se accetti di ricevere la risposta più tardi. OpenAI dichiara sulla propria pagina prezzi il 50% di sconto su entrata e uscita con la Batch API, con esecuzione entro ventiquattro ore. Google documenta la stessa percentuale per la propria modalità batch, sempre con un tempo obiettivo di ventiquattro ore. Per un catalogo prodotti aspettare una notte non cambia niente.
  3. Non allegare tutto ogni volta. Ogni documento che accompagna la richiesta entra nella finestra di contesto, cioè nello spazio di memoria che il modello ha a disposizione per quella conversazione, quindi si paga. Passare il listino intero quando serve una riga sola è il modo più silenzioso di gonfiare la spesa.
  4. Riusare le parti fisse. Quando le istruzioni iniziali sono sempre le stesse, il fornitore sa riconoscerle e le conteggia in modo agevolato. È il caching già nominato più sopra. Sul listino OpenAI l’entrata in cache di Luna costa 0,02 dollari per milione contro 0,20, cioè un decimo. È una leva tecnica e serve qualcuno che la imposti, ma sui volumi alti pesa parecchio.

I modelli aperti e la parte di conto che non si vede

Il 60% del traffico sulle piattaforme per sviluppatori conquistato dai modelli open cinesi racconta una pressione sui prezzi che riguarda tutti, anche chi non userà mai uno di quei modelli. Qui open source significa che sono scaricabili i pesi del modello, cioè i numeri che il sistema ha ricavato durante l’addestramento e che ne costituiscono di fatto la memoria. Con l’attrezzatura adatta si può quindi far girare il modello su macchine proprie, senza pagare a consumo.

Va detto con calma, perché la convenienza va guardata per intero. Un modello scaricabile toglie la voce costo per token e ne aggiunge altre, dall’hardware alla manutenzione fino a chi risponde quando qualcosa smette di funzionare. In più la scelta del fornitore non è solo economica. Dove finiscono i dati, con quali garanzie contrattuali, per quanto tempo quel modello resterà disponibile sono domande che pesano quanto il listino, a volte di più, soprattutto per chi tratta dati di clienti, pazienti o studenti.

Il prezzo che scende non rende la scelta più facile, sposta soltanto i criteri con cui si decide. Quando la spesa era il vincolo principale, decideva lei. Adesso che quel vincolo si è allentato, tornano in primo piano affidabilità, riservatezza e continuità del servizio.

Cinque domande da farsi prima di scegliere

  1. Questo lavoro è ripetitivo o richiede giudizio? La risposta indirizza la classe di modello prima ancora del fornitore.
  2. Quante volte al mese lo faccio? Un compito singolo non merita ottimizzazioni, uno che gira ogni giorno le ripaga in fretta.
  3. Quanto materiale gli sto passando ogni volta? Quanto di quel materiale serve davvero?
  4. Ho fretta della risposta o posso aspettare la notte?
  5. Che tipo di dati stanno dentro la richiesta? Se ci sono dati personali o riservati, la domanda economica passa in secondo piano.

Chi si occupa di intelligenza artificiale a Firenze sente ripetere che il problema delle PMI è il budget. In questo momento, per il lavoro di testo, il budget è il problema minore. Il problema è che si compra alla cieca, perché mancano le due o tre nozioni che rendono leggibile una fattura.

Domande frequenti

Quanto costa davvero usare l’AI in una piccola impresa?

Per compiti di testo ripetitivi, cifre basse. Sul listino pubblico di OpenAI il modello economico GPT-5.6 Luna sta a 0,20 dollari per milione di token in entrata e 1,20 in uscita. Il conto svolto qui sopra, ottocento schede prodotto riscritte per intero, resta sotto il dollaro. Le voci che pesano davvero sono altre, cioè le ore delle persone che controllano il risultato e l’eventuale scelta di un modello sovradimensionato.

Quante pagine sono un milione di token?

Applicando la regola di conversione di Google e contando trecento parole a pagina, fra duemila e duemilaseicento pagine di parole inglesi. Vale per il testo che entra nel modello. La risposta che il modello produce si conta e si paga a parte, a un prezzo più alto.

Come faccio a sapere quanti token consumo?

Nei pannelli per sviluppatori il conteggio è mostrato per ogni chiamata, cioè per ogni singola richiesta inviata al modello, diviso fra entrata e uscita. Chi usa solo la chat con abbonamento non lo vede, perché in quel caso il consumo lo gestisce il fornitore dentro i limiti del piano.

Conviene passare a un modello open?

Dipende da volumi e competenze interne. Il prezzo per token sparisce, ma compaiono hardware, manutenzione e responsabilità sulla continuità del servizio. Per la maggior parte delle PMI la leva che rende di più resta scegliere bene il modello a consumo.

Se i prezzi scendono così in fretta, ha senso decidere adesso?

Sì, purché si decida in modo reversibile. Vale la pena costruire i propri automatismi in modo che il modello sia sostituibile con poco lavoro, così un taglio di listino annunciato fra sei mesi diventa un’occasione invece che un lavoro da rifare.

In sintesi

Fino a poco tempo fa la domanda sensata era se una piccola impresa potesse permettersi questi strumenti. Con venti centesimi per milione di token in entrata quella domanda ha perso mordente. Al suo posto ne resta una più scomoda. Stiamo pagando il modello giusto per il lavoro che facciamo davvero?

La risposta non arriva da un listino. Arriva da mezz’ora passata a guardare quali compiti si ripetono, quanto materiale viene allegato per abitudine e quali di quelle richieste avrebbero potuto aspettare fino al mattino dopo. È un lavoro noioso e vale molto più di qualsiasi sconto.

Blu7, azienda in corso di riconoscimento MIM per corsi in aula e online. Iscriviti a 7 Pillole Blu.

Lascia un commento

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *