Blu7, azienda in corso di riconoscimento MIM per corsi in aula e online. Iscriviti a 7 Pillole Blu.

Fino a poco tempo fa la risposta era semplice. Far girare un modello linguistico serio dentro la propria azienda voleva dire comprare un armadio di schede grafiche (100.000 euro non bastavano), quindi nessuna piccola impresa se lo poneva come problema. Si pagava a consumo, punto.

Quella risposta si sta incrinando. I modelli aperti più capaci hanno cominciato a girare su macchine che una persona può avere sulla scrivania, quindi la domanda torna legittima anche per uno studio di venti persone a Firenze. Siamo a macchine da 4.900 euro oggi, Agosto 2026, ma nulla ci vieta di pensare che questo prezzo possa crollare a settembre. La risposta onesta però ha due facce che vanno guardate entrambe prima di firmare un preventivo.

Indice

Cosa è cambiato davvero {#cosa-e-cambiato-davvero}

Il segnale più chiaro arriva da un progetto italiano chiamato DwarfStar, su GitHub nel repository antirez/ds4, scritto da Salvatore Sanfilippo, il programmatore che ha creato Redis. È software libero con licenza MIT, scaricabile e usabile senza pagare nulla. Al 5 agosto 2026 il repository raccoglie oltre 20.600 stelle, il segnalibro con cui gli sviluppatori marcano i progetti importanti.

DwarfStar è un motore di inferenza, cioè il programma che carica un modello e lo fa lavorare sull’hardware disponibile. L’inferenza è il momento in cui un modello già addestrato produce la risposta, il lavoro che la macchina fa ogni volta che qualcuno preme invio.

La particolarità è la specializzazione: invece di far girare qualsiasi modello in modo mediocre, ne segue pochi e li ottimizza fino in fondo, oggi soprattutto DeepSeek V4 Flash. Nel suo post del 15 maggio 2026 l’autore attribuisce l’esplosione del progetto a tre cose arrivate insieme. Le prime due sono un modello quasi di frontiera abbastanza veloce da cambiare le carte in tavola e una ricetta di compressione che gli permette di stare in 96 o 128 GB di memoria. La terza è l’esperienza accumulata in questi anni dal movimento dell’AI in locale, diventata finalmente sfruttabile in tempi brevi. Nello stesso post scrive una frase che riassume la motivazione, «AI is too critical to be just a provided service», l’intelligenza artificiale è troppo importante per essere soltanto un servizio che qualcun altro ti eroga.

Le due idee che fanno entrare un modello grande in un computer piccolo

La compressione selettiva

La quantizzazione è la riduzione della precisione con cui vengono salvati i numeri interni di un modello, un po’ come un JPEG rispetto alla foto originale. Meno precisione vuol dire meno spazio occupato e più velocità, con un costo in qualità.

L’idea applicata qui con cura è comprimere in modo diverso le diverse parti del modello. La documentazione spiega che vengono ridotti a 2 bit solo gli esperti instradati, la grande maggioranza del peso complessivo, mentre le componenti delicate come le proiezioni e il sistema di instradamento restano intatte. Il risultato dichiarato è che quelle versioni reggono l’uso reale e chiamano gli strumenti esterni in modo affidabile.

L’uso del disco come memoria

Il secondo meccanismo si chiama SSD streaming e serve quando la memoria non basta comunque. I modelli di tipo Mixture of Experts sono divisi in tanti sottomodelli specializzati, di cui a ogni passaggio se ne attivano pochi. DwarfStar tiene in memoria le parti sempre necessarie e gli esperti più richiesti, pescando gli altri dal disco a stato solido solo quando servono. Così un portatile da 64 GB fa girare qualcosa che altrimenti non ci starebbe.

La documentazione è esplicita sul prezzo della scorciatoia: lo streaming da disco non è veloce quanto avere tutto in memoria e penalizza soprattutto la generazione, perché ogni parola prodotta rimette in moto la ricerca degli esperti.

Il motivo serio per tenere l’AI in casa

Il motivo principale è uno e pesa parecchio. I dati non escono dall’azienda. Nessun documento caricato su un server altrui, nessuna clausola contrattuale da interpretare, nessuna dipendenza da un fornitore che domani può cambiare listino o modello sottostante.

Per uno studio legale che tratta fascicoli di clienti, per un poliambulatorio che maneggia referti, per un’azienda manifatturiera con disegni tecnici da non far vedere in giro, non è una preferenza ideologica ma un requisito. Vale anche per una scuola che voglia sperimentare sui materiali dei propri studenti senza aprire un capitolo di responsabilità sul trattamento dei minori.

Ce n’è un secondo, più piccolo: la spesa diventa prevedibile, perché una domanda in più non genera una riga di fatturazione. Non è però un costo azzerato, visto che restano corrente e manutenzione.

Il motivo serio per non farlo

Le prestazioni per singola persona sono di un altro ordine rispetto a un servizio online. Sono numeri pubblicati dal progetto stesso.

| Macchina | Contesto | Generazione |

|—|—|—|

| MacBook Pro M5 Max, 128 GB | 2.048 token | 39,35 token al secondo |

| MacBook Pro M5 Max, 128 GB | 65.536 token | 27,64 token al secondo |

| DGX Spark GB10, 128 GB | 2.048 token | 18,05 token al secondo |

| DGX Spark GB10, 128 GB | 65.536 token | 13,84 token al secondo |

Un token è il pezzetto di testo con cui i modelli contano, mediamente qualcosa fra una sillaba e una parola breve. Sono cifre che reggono bene il lavoro di una persona per volta. Il problema nasce con cinque persone, perché quella velocità è tutta la potenza della macchina, quindi va divisa.

La documentazione riporta anche il caso multiutente serio: un server con 8 schede NVIDIA L40S regge più sessioni contemporanee con 120 token al secondo aggregati. Buon risultato, ma quel pezzo di hardware non sta su una scrivania.

Terzo dato, quello che smonta la fantasia di unire i computer dell’ufficio. Il progetto misura due macchine collegate insieme: 25,09 token al secondo su cavo Thunderbolt 5, 10,70 sulla rete WiFi e 3,63 attraverso una VPN. In una prova di controllo sulle stesse due macchine, con lo stesso modello compresso e un contesto un po’ più ampio (12.000 token invece di 8.192), il passaggio da un processo singolo a due macchine costa il 19,4%. Distribuire serve a far entrare modelli più grandi, non a farli andare più veloci.

Il costo che non finisce nel preventivo

La macchina su cui il progetto misura le prestazioni migliori è un MacBook Pro con chip M5 Max. Sullo store italiano di Apple, al 5 agosto 2026, le configurazioni standard con quel chip vanno da 4.899 euro per il 14 pollici a 5.799 euro per il 16 pollici. I 128 GB di memoria unificata usati nei test sono un’opzione a pagamento in più, il cui importo non compare nella pagina perché lo calcola il configuratore. Quello che si può dire con certezza è quindi una soglia minima: la macchina dei test costa più di 4.899 euro. Quanto di più non è pubblicato.

La documentazione fissa anche il resto della scala: 96 GB di memoria o più per il funzionamento normale, 64 GB se si accetta la lentezza dello streaming da disco, 512 GB per far girare il modello maggiore.

Ma la macchina è la parte facile del conto. Il costo vero è chi la fa funzionare. Il progetto si dichiara di qualità beta e avverte che il software cambia molto rapidamente: normale per un lavoro giovane, però vuol dire che qualcuno deve aggiornarlo, seguire i cambi di modello e rispondere al telefono quando alle nove di mattina l’assistente non parte. In una PMI senza reparto tecnico quella persona non esiste, quindi va comprata da fuori.

Qui il paragone è impari: i listini dei fornitori online sono verificabili al centesimo, come nel pezzo sui costi dell’AI a token, mentre il costo della gestione interna non ha listino e si scopre strada facendo.

Tre casi in cui vale la pena valutarlo

Dati che per legge o per contratto non possono uscire. Sanità, studi professionali con obblighi di riservatezza, aziende sotto accordo di non divulgazione. Qui il confronto non è economico, è di ammissibilità.

Volumi molto alti e ripetitivi su un compito solo. Classificare migliaia di documenti, estrarre campi da fatture, riassumere archivi: lavori che si lanciano la notte, dove la lentezza non disturba nessuno.

Vale la pena mettere in fila il punto di pareggio, approssimativo e dichiarato tale. Partiamo dalla soglia minima di 4.899 euro, contando solo i token in uscita e trattando euro e dollari come equivalenti, cosa che a questi ordini di grandezza non sposta la conclusione. Al prezzo del modello economico, 1,20 dollari per milione, servono circa 4,1 miliardi di token generati per pareggiare. Al prezzo del modello di punta, 30 dollari per milione, il pareggio scende a circa 163 milioni di token. Sono totali da raggiungere, non consumi di un anno. Nel conto mancano il sovrapprezzo dei 128 GB, l’elettricità e il costo di gestione, quindi la soglia vera è più alta. Detto in modo diretto: il caso dei volumi regge solo per chi genera centinaia di milioni di token sul modello caro, altrimenti il conto non torna e la scelta va motivata con la riservatezza, non con il risparmio.

Chi ha già competenza tecnica in casa. Se un reparto IT segue già server e backup, il costo di gestione non è nuovo, è un pezzo in più di un mestiere che si sta già facendo.

Tre casi in cui è quasi sempre la scelta sbagliata

Poche persone che lo usano di tanto in tanto. Dieci colleghi che fanno qualche domanda al giorno consumano una cifra minima a consumo. Ammortizzare una macchina di fascia alta richiederebbe anni.

Si vuole sempre l’ultimo modello disponibile. Il progetto dichiara di inseguire i migliori pesi aperti del momento e avverte che un modello può essere rimosso quando ne arriva uno migliore. Chi vuole stare sempre in cima insegue quella rincorsa comprando hardware, invece di cambiare una riga di configurazione.

Non c’è nessuno che possa occuparsene. Un modello che nessuno aggiorna diventa un oggetto fermo in sei mesi, il modo più veloce per bruciare il budget AI di un anno.

Come si decide in pratica

Il percorso sensato non parte dall’acquisto. Si mette in fila cosa deve fare l’AI, si misura per un paio di mesi la spesa reale a consumo e si separano i compiti che toccano dati riservati dagli altri. Solo allora il confronto ha due colonne di numeri veri, invece di una di preventivi e una di impressioni. È il ragionamento che portiamo avanti nella pagina sull’intelligenza artificiale per le imprese di Firenze.

Domande frequenti

Un modello aperto è meno sicuro di uno commerciale?

Aperto vuol dire che i componenti interni sono pubblicati e ispezionabili, non che sia meno curato: è il concetto della voce open source applicato ai modelli. La sicurezza dipende molto di più da chi configura il sistema e da chi ci accede.

Posso usare un normale PC da ufficio?

No, non per i modelli di cui si parla qui: servono decine di gigabyte di memoria a disposizione del processore grafico. Esistono modelli piccoli che girano su macchine comuni, ma sono un’altra categoria di qualità.

Quanto consuma una macchina così accesa tutto il giorno?

Il consumo in watt non è pubblicato. La documentazione descrive però un’opzione che riduce l’uso del processore grafico a una percentuale scelta, pensata per calore, ventole e batteria, senza cambiare la risposta in uscita.

Serve rinunciare del tutto ai servizi online?

Quasi mai. La configurazione più realistica per una PMI è mista: i dati riservati restano dentro, tutto il resto passa da un servizio a consumo scelto in base al prezzo.

Blu7, azienda in corso di riconoscimento MIM per corsi in aula e online. Iscriviti a 7 Pillole Blu.

Lascia un commento

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *