Blu7, azienda in corso di riconoscimento MIM per corsi in aula e online. Iscriviti a 7 Pillole Blu.

Stai finendo il preventivo, l’assistente sta ragionando bene, poi compare il riquadro: hai raggiunto il limite d’uso, riprova più tardi. Se l’abbonamento è a pagamento la reazione è un misto di incredulità e fastidio. Non è un dispetto e non è un guasto, ma il modo in cui i fornitori distribuiscono una capacità di calcolo limitata, secondo regole pubblicate che si possono leggere e in buona parte aggirare. Sul tema circola molta mitologia, quindi qui stiamo alle pagine di aiuto ufficiali.

Perché il blocco esiste

Nella pagina sul piano Pro aggiornata il 10 giugno 2026, Anthropic scrive che i limiti servono a gestire la capacità disponibile e a garantire un accesso equo a tutti gli utenti. Google dice la stessa cosa per Gemini, dove i limiti sono presentati come il modo di garantire a tutti un’esperienza ottimale.

Dietro quelle formule c’è un vincolo fisico. Ogni risposta esce da schede di calcolo dedicate, care, energivore e in numero finito: quando la domanda le supera, o il servizio rallenta per tutti oppure si mette un tetto a chi consuma di più. È lo stesso vincolo che rende gli assistenti più lenti in certe fasce orarie, tema dell’articolo su cosa decide la velocità di un’AI, in uscita a breve.

Non contano i messaggi, conta quanto testo fai rileggere

L’errore più comune è immaginare il limite come un contatore di messaggi.

Un token è il frammento di testo con cui i modelli linguistici lavorano, all’incirca una parola breve o un pezzo di parola lunga. Tutto ciò che entra in una conversazione e ne esce si misura in token: quella è la valuta del limite. La documentazione di Anthropic per Claude Code, datata 15 aprile 2026, lo spiega senza giri: ogni turno rimanda al modello la conversazione fatta fino a quel punto, i file di progetto già letti, infine il messaggio nuovo. La prima delle tre voci cresce molto più in fretta delle altre, quindi una sessione lunga si porta dietro tutto il pregresso a ogni domanda.

In una chat lunga un messaggio corto può costare molto più di un messaggio lungo mandato all’inizio, perché il grosso del consumo non è la domanda nuova ma il ripasso di quello che c’è già stato.

Anthropic elenca sette fattori che incidono sul limite: lunghezza del messaggio, peso dei file allegati, lunghezza della conversazione in corso, uso di strumenti come la ricerca web, modello scelto, livello di sforzo impostato, creazione di artefatti (i documenti che l’assistente produce a lato della chat). Google descrive per Gemini limiti “basati sul calcolo”, che tengono conto di complessità del prompt, modelli e funzioni usate, lunghezza della chat. Fornitori diversi, stessa architettura.

Caso tipico in uno studio fiorentino: un commercialista apre la chat alle nove per una circolare, alle undici ci infila una domanda su un contratto, dopo pranzo chiede una email per un cliente. Tre lavori dentro un filo solo: al terzo, ogni domanda si trascina dietro la circolare e il contratto che non c’entrano più nulla.

Due orologi che girano insieme

Chi paga ha due contatori sopra la testa, non uno.

Il primo è la sessione. Anthropic documenta che il limite di sessione si azzera ogni cinque ore. Google indica per Gemini lo stesso identico intervallo, con il rinnovo ogni cinque ore fino al tetto settimanale.

Il secondo è il limite settimanale. Sul piano Pro vale su tutti i modelli e si azzera a un orario fisso assegnato all’account, sempre lo stesso a prescindere da quando si comincia a lavorare. I piani Max ne hanno due, uno generale più uno riservato a una famiglia di modelli.

La differenza fra i due decide come organizzare la giornata. La sessione si recupera aspettando qualche ora. Il settimanale no, perché esaurito di martedì compromette il resto della settimana. Chi consuma molto dovrebbe tenere d’occhio il settimanale, non la sessione. Su Claude entrambi si vedono in Impostazioni > Utilizzo, con la barra della sessione corrente, il tempo che le resta e la data di azzeramento del settimanale.

Non tutti i fornitori però pubblicano queste meccaniche. La pagina ufficiale su ChatGPT Plus dice soltanto che l’abbonamento può includere limiti d’uso come tetti di messaggi, soprattutto nei momenti di alta domanda, aggiungendo che variano in base alle condizioni del sistema. Nessun numero, nessuna finestra temporale: chi cerca cifre precise per quel servizio non le trova, mentre chiunque le pubblichi le sta ricostruendo per conto proprio.

Limite d’uso e limite di lunghezza sono due cose diverse

Confonderli porta a rimedi sbagliati.

Il limite d’uso riguarda quanto si può lavorare in un certo periodo: quando scatta si può solo aspettare, cambiare piano o comprare capacità aggiuntiva.

Il limite di lunghezza riguarda la singola conversazione ed è legato alla finestra di contesto, la quantità massima di testo che il modello tiene davanti a sé in una volta. Anthropic dichiara sui piani a pagamento finestre da 1 milione di token per i modelli più recenti, 500.000 per altri, 200.000 per i restanti, dove 200.000 token valgono circa 500 pagine di testo o più. Qui la soluzione non è aspettare: si apre una conversazione nuova oppure si spostano i materiali in un progetto.

Sui piani a pagamento dove è attiva l’esecuzione di codice, le conversazioni molto lunghe fanno scattare una gestione automatica del contesto, che riassume i messaggi vecchi per far posto ai nuovi. La documentazione avverte che quelle conversazioni consumano più limite d’uso, suggerendo di aprirne una nuova quando il tetto si avvicina. Una chat infinita è la via più veloce per bruciare l’abbonamento.

Cosa fare, in ordine di resa

Chiudi la conversazione quando cambi argomento

Se la prossima domanda avrebbe perfettamente senso in una finestra vuota, apritene una vuota: la documentazione di Claude Code lo formula proprio così e mette a disposizione due comandi, /clear che azzera la cronologia e /compact che la riassume conservando il filo. Nella versione web basta aprire una chat nuova.

Metti i documenti ricorrenti dentro un progetto

Un progetto è una cartella di lavoro con dentro istruzioni e file di riferimento. Anthropic documenta che i contenuti caricati lì restano in memoria e non pesano sul limite quando li si riutilizza, perché si conteggiano soltanto le parti nuove. È la leva a più alto rendimento per chi lavora sempre sugli stessi materiali: una scuola che interroga di continuo il proprio PTOF, il regolamento d’istituto e le circolari fa una cosa molto diversa caricandoli una volta in un progetto invece di allegarli a ogni chat.

Spegni gli strumenti che non servono in quella chat

Ricerca web, ricerca approfondita e connettori esterni (i cosiddetti MCP, i canali che collegano l’assistente ad altri programmi) sono descritti nella documentazione come particolarmente onerosi in token. Anthropic consiglia di disattivarli quando non servono, perché occupano contesto e tenerne pochi attivi lascia più spazio al lavoro vero. Si riaccendono in due secondi dalle impostazioni di ricerca e strumenti.

Scegli il modello in base al compito

Ogni famiglia ha modelli leggeri e modelli pesanti, con consumi molto diversi. La documentazione descrive Haiku come il più rapido ed economico, buono per ricerche veloci e modifiche semplici, Sonnet come la scelta giusta per la gran parte del lavoro, Opus come quello per i problemi difficili, con l’avvertenza esplicita che consuma molto di più e va acceso solo quando serve. Vale anche per il livello di sforzo, che si abbassa sui compiti di routine: correggere una email o tradurre una scheda prodotto non richiede il modello di punta.

Prepara il messaggio prima di mandarlo

Le buone pratiche pubblicate da Anthropic il 2 giugno 2026 dicono di pianificare la conversazione prima di aprirla, essere specifici invece che vaghi, raggruppare in un unico messaggio le richieste collegate, rileggere il prompt prima dell’invio. Il criterio è ridurre i giri di chiarimento, la parte di consumo più facilmente evitabile.

Quando è metodo e quando serve il piano superiore

Applicate queste cinque cose per due settimane, poi guardate i contatori. Se il settimanale non lo sfiorate più, era questione di metodo. Se continuate a esaurirlo il mercoledì il problema è la taglia dell’abbonamento: nessun accorgimento basta.

I numeri pubblicati aiutano a decidere. Il piano Pro di Anthropic costa 20 dollari al mese e offre almeno cinque volte l’uso per sessione rispetto alla versione gratuita. I piani Max costano 100 dollari al mese nella versione 5x e 200 in quella 20x, con un uso per sessione cinque e venti volte quello del Pro. Per Gemini, Google indica moltiplicatori sui limiti standard: 2x con AI Plus, 4x con AI Pro, 5x o 20x sopra AI Pro con AI Ultra. ChatGPT Plus costa 20 dollari al mese, senza numeri dichiarati.

Esiste una via di mezzo, cioè comprare capacità a consumo senza cambiare piano. Anthropic la chiama crediti d’uso e la offre sui piani a pagamento. OpenAI vende crediti che si attivano al raggiungimento dei limiti inclusi, con due avvertenze. Valgono 12 mesi dall’acquisto e quello che avanza scade senza riportarsi. Soprattutto, la pagina ufficiale precisa che al momento funzionano soltanto con alcuni strumenti specifici, quindi non sbloccano la conversazione che si è fermata. Prima di comprare capacità a consumo, quindi, va verificato che il fornitore la venda per lo strumento che si usa davvero.

Un avvertimento: in cima alla pagina ufficiale di Gemini campeggia un avviso, dal 17 maggio 2026 i limiti d’uso cambiano. Sono meccaniche in movimento, da riverificare alla fonte prima di decidere una spesa. Per lo stesso motivo conviene testare un assistente sul proprio lavoro reale invece di fidarsi delle schede prodotto.

Domande frequenti

Se cancello una conversazione recupero il limite consumato?

Nessun fornitore documenta un rimborso del contatore. La logica del meccanismo dice di no perché il consumo avviene quando il messaggio viene elaborato. Chiudere una conversazione serve a non pagare di nuovo lo stesso testo nei messaggi successivi.

Usare l’assistente da app diverse cambia qualcosa?

No, almeno per Claude: la documentazione dice che l’uso su tutte le superfici del prodotto (web, riga di comando, desktop) confluisce nello stesso limite. Il contatore è dell’account, non dello schermo.

Un allegato pesa quanto lo stesso testo incollato?

La lunghezza dei file allegati è uno dei fattori che Anthropic elenca fra quelli che consumano limite, alla pari della lunghezza del messaggio. Un PDF di 80 pagine allegato per una domanda da due righe è un costo enorme per un risultato piccolo.

I trucchi che girano in rete per raddoppiare i limiti funzionano?

Alcuni si basano su comportamenti che nessun fornitore documenta, quindi non sono verificabili e possono smettere di funzionare senza preavviso. Prima di adottarne uno, cercatelo nelle pagine di aiuto ufficiali.

Conviene installare un modello in azienda per evitare i limiti?

È una strada percorribile, con costi e complessità propri, a cui dedichiamo un articolo a parte in uscita a breve. Prima di arrivarci vale la pena capire quanto si spende davvero oggi, un conto che si fa a token: ne parliamo nell’articolo sui costi reali dei modelli AI.

Il messaggio di blocco dice una cosa sola, cioè che state chiedendo più capacità di quanta ne abbiate comprata. Se volete inquadrare l’AI nei processi aziendali invece di rincorrerla, ecco come lavoriamo sull’intelligenza artificiale a Firenze.

Blu7, azienda in corso di riconoscimento MIM per corsi in aula e online. Iscriviti a 7 Pillole Blu.

Lascia un commento

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *