Blu7, azienda in corso di riconoscimento MIM per corsi in aula e online. Iscriviti a 7 Pillole Blu.

Ma come nasce una Intelligenza Artificiale? (con tanti esempi semplici e gli aspetti sociali)

Prova a chiedere a un assistente AI, (Gemini, ChatGPT, Copilot) il recapito di un ufficio comunale di Firenze, riceverai un numero: ben formattato, verosimile, con il prefisso giusto. Devi sapere che può essere completamente sbagliato. Poi chiedigli di un fatto accaduto il mese scorso in Piazza Dalmazia: ti dirà che non lo sa, oppure ti racconterà con la stessa sicurezza qualcosa, ma è un fatto di due anni fa.

Sono due dei comportamenti che fanno perdere fiducia, soprattutto se devi usare questi strumenti per lavorare o per studiare. Tutti questi errori nascono nello stesso punto: la prima delle quattro fasi con cui si costruisce un modello linguistico, il pre-addestramento, in inglese pre-training.

Oggi proviamo a conoscere e capire quali sono queste 4 fasi così magari conosci le basi una Intelligenza Artificiale, avrai risposte alle tue curiosità.

Come nasce un’intelligenza artificiale

Questo articolo è la puntata 1 di 4 di una serie che segue le quattro fasi di costruzione di un modello LLM (Large Language Model = Modello dal Largo, Esteso Linguaggio = Intelligenza Artificiale), spiegando per ognuna un comportamento che chi lo usa vede tutti i giorni, una spiegazione pratica.

  1. Il pre-addestramento: perché l’AI inventa (questa puntata)
  2. Quanto costa addestrare un’intelligenza artificiale: perché usarla costa poco e costruirla costa enormemente
  3. La rifinitura: perché risponde con quel tono e perché due prodotti fatti sullo stesso motore rispondono in modo diverso
  4. Le guardie: perché a volte si rifiuta e chi ha deciso che si rifiutasse

Alla fine delle quattro “puntate” forse avrò illustrato perché l’intelligenza artificiale fa quello che fa. Non serve alcuna competenza tecnica: ogni termine lo spiego la prima volta che compare.

Allora ho cercato una immagine per farti vedere di cosa parliamo ed ecco un Castello con 4 torri.

Castello di vetro con la scritta LLM sul portone: la torre del pre-addestramento e illuminata, fuori dalle mura sei uomini male armati duellano
Pre addestramento, la prima fase della Intelligenza Artificiale

Una Intelligenza Artificiale, (un modello linguistico) è come un Castello con 4 torri, 4 punti cardine.
Tutto inizia con cercare i nuovi soldati del castello, del modello linguistico, siamo al pre-addestramento: castello con le porte aperte.

Che cosa e come impara davvero un modello linguistico

Un modello linguistico non nasce con un archivio di fatti o di conoscenze statiche. Una AI contiene i risultati di un allenamento, durissimo, fatto su una quantità enorme di testo.
L’esercizio è sempre lo stesso: dato un pezzo di frase, indovinare che cosa viene dopo.

ESEMPIO: prendo la frase base “Con la palla posso giocare a …”
E qui il “modello linguistico” inizia a mettere una parola finale:
– Con la palla posso giocare a calcio: ok
– Con la palla posso giocare a basket: ok
– Con la palla posso giocare a surf: no
– Con la palla posso giocare a nuoto: si e no (qui ne riparliamo le prossime uscite)

È facile capire quanto sia grande l’allenamento se devo “rispondere a tutto”!
Il testo, la parola, viene prima spezzata in token, cioè frammenti di parola: “impossibile” può diventare “im”, “poss”, “ibile”. E in questo caso non si suddivide in sillabe come siamo abituati!
(è una questione di statistica, ma ne parliamo un’altra volta).
Il programma prende un frammento e poi prova a prevedere il frammento successivo, confronta la sua previsione con quello vero e corregge di pochissimo i propri valori interni.E poi ricomincia. Miliardi di volte, tutto il giorno, tutti i giorni.
Per questo servono tanti computer potentissimi, sempre accesi che lavorano incessantemente…

Il modello linguistico (AI) non impara se una cosa è vera. Impara che certe sequenze di parole stanno spesso insieme. È una differenza che sembra sottile e spiega quasi tutto il resto (in originale «contingent statistical relationships») (nota 1).

Perché allora l’intelligenza artificiale inventa

Se il meccanismo produce ciò che è statisticamente plausibile, produrrà anche cose plausibili e false. È esattamente questo il fenomeno che in italiano chiamiamo allucinazione: il modello linguistico risponde con la stessa sicurezza quando sa e quando no, perché internamente non c’è nessuna differenza fra i due casi.
Tralascio il fatto che potrebbe rispondere “non lo so”, ma che nel marketing è meglio dare una risposta che il silenzio, ma non parlo di questo oggi.

Uno studio del 2025 guidato da ricercatori di OpenAI (ChatGPT) lo mette per iscritto: se durante il pre-addestramento le affermazioni sbagliate non sono distinguibili dai fatti, le allucinazioni emergono «per naturali pressioni statistiche».
Non sono un difetto di lavorazione da correggere, sono una conseguenza del metodo.

Si capisce da subito che meno errori statistici il modello restituisce e più “l’intelligenza sembra intelligente” e fornisce risposte corrette.

Lo stesso studio aggiunge però una sfumatura che complica la storia: il pre-addestramento spiega perché gli errori nascono, non perché sopravvivono.
I modelli continuano a tirare a indovinare anche dopo l’addestramento, perché i test con cui li si valuta premiano con il punteggio pieno una risposta azzeccata per caso e con lo zero un onesto «non lo so». Traduco: se sbagli risposta prendi zero, se indovini +1, quindi tu buttati.
Chi viene valutato a crocette impara a rispondere sempre.
Le fasi successive, che vedremo nelle prossime puntate, peggioreranno il problema invece di risolverlo.

Perché non sa (sempre) quello che è successo il mese scorso

Il pre-addestramento è una fotografia: si raccoglie il testo fino a una certa data, si addestra il modello e da lì in poi le informazioni successive semplicemente non ci sono. È quella che in inglese si chiama knowledge cutoff, la data di taglio della conoscenza (nota 2).

Non è però un muro netto. Nella documentazione tecnica di Anthropic, consultata il 5 agosto 2026, i modelli hanno due date diverse: la fine dei dati di addestramento e la data fino a cui la conoscenza è «più estesa e affidabile».

ESEMPIO: l’allenamento si è fermato al 31 dicembre 2025, ecco che i fatti, i giocatori, fino a quella data “sono allenati” e dopo si è continuato ad aggiornare, ma con una granularità molto grossa e qui gli errori sono molto probabili perché il modello ha visto poco materiale, quindi sa poco e male.

E Perplexity.ai? E le ricerche via web che adesso ChatGPT, Claude o Gemini fanno via web?
Tutte domande corrette.
Quando un assistente ti dà informazioni aggiornate, non le ha imparate: le ha appena lette, con una ricerca in rete o nel testo che gli hai incollato. Non è la stessa cosa che saperle. Quel materiale vive dentro la conversazione in corso, sparisce quando la chiudete e non lascia traccia nel modello. Se la ricerca non trova la pagina giusta, la risposta torna a essere una previsione: una risposta “ad occhio”.
Sapendo che il web è per 2/3 spazzatura, la risposta sarà… approssimativa.

Da dove viene tutto quel testo (l’aspetto sociale)

Qui la questione tecnica diventa una questione pubblica. Perché quel testo è stato scritto da qualcuno. Sto per parlare della povera Wikipedia e di libri usati e tritati.

Uno dei pochi casi in cui la composizione dei dati è stata pubblicata in modo leggibile è GPT-3, nel 2020 (ChatGPT). La tabella nel documento originale dice che il grosso veniva da Common Crawl, un archivio pubblico che copia periodicamente grandi porzioni del web: 410 miliardi di token, il 60 per cento del materiale usato in addestramento.
Wikipedia pesa 3 miliardi di token, il 3 per cento, ma è stata fatta rileggere al modello 3 o 4 volte (nota 6), mentre il web generico è stato letto meno di una volta.

ESEMPIO: Prendi una squadra di calcio e fagli fare esercizi di nuoto, di basket e di cricket, male non gli farà, ma l’allenamento è molto scarso (il web, internet).
Poi dai a quella squadra Antonio Conte o Guardiola e la squadra diventerà allenatissima (Wikipedia).
Non conta solo la quantità di dati, ma la loro qualità (nota 3).

Aspetto sociale: Anthropic ha comprato milioni di libri usati e li ha sventrati e dati in pasto alla sua Claude.ai. La qualità dentro i libri e non nel web.
Ovviamente è scattata una causa collettiva in USA e…

Il diritto d’autore, in tribunale

La decisione più chiara finora è l’ordinanza già citata del giugno 2025. Il giudice ha stabilito due cose distinte: addestrare un modello sui libri (usati nel caso in questione) è uso lecito perché «straordinariamente trasformativo», ma chi compra un libro ne fa quel che vuole, mentre scaricare copie pirata (dal web) per costruirsi una biblioteca permanente non lo è, resta un illecito a prescindere dall’uso che se ne fa (nota 4).
La distinzione non passa fra il produrre AI e non produrla, ma da come i testi sono stati procurati.

IL FINALE CHE NON TI ASPETTI: però Anthropic ha chiuso il procedimento con un accordo transattivo, approvato in via definitiva il 20 luglio 2026: l’ordinanza di approvazione finale istituisce un fondo non reversibile da 1,5 miliardi di dollari (sì, miliardi di dollari) e stima un pagamento di circa 3.000 dollari per opera nella class action.
Chissà perché. Ma torniamo al Castello e ai nostri neo soldati che si stanno allenando.

I dati personali, in Italia

Come sempre in Italia si sa cosa è incerto e poco cosa è certo.
Alleniamoci con l’altalena, verrebbe da dire.
Il 2 novembre 2024 il Garante per la protezione dei dati personali ha chiuso l’istruttoria su ChatGPT con il provvedimento n. 755, annunciato con un comunicato del 20 dicembre: una sanzione di 15 milioni di euro più una campagna informativa di 6 mesi su come opporsi all’uso dei propri dati. L’autorità contestava a OpenAI di aver trattato dati personali degli utenti per addestrare ChatGPT senza aver prima individuato una base giuridica adeguata, oltre alla violazione del principio di trasparenza.

Quella sanzione oggi non è vigente. Il Tribunale di Roma, con sentenza n. 4153/2026 pubblicata il 18 marzo 2026, ha accolto l’opposizione proposta contro il provvedimento, che il Garante ha di conseguenza rimosso in via temporanea dal proprio sito.
Il caso era comunque già passato all’autorità irlandese, diventata capofila per la regola dello sportello unico. Il merito della questione resta quindi aperto: quello che è caduto è questo specifico provvedimento italiano.

E c’è una buona notizia per te che leggi: dal 2 agosto di quest’anno è scattato un pezzo in più di un atto potente, l’AI Act.
Un pezzo che lavora per il cliente e per il lettore, non per chi costruisce i modelli.

Nella stessa direzione va l’AI Act europeo, che al considerando 107 chiede ai fornitori di modelli di uso generale una «sintesi sufficientemente dettagliata» dei contenuti usati per l’addestramento, con un limite però dichiarato nel testo stesso: deve essere «di respiro ampio e generale, anziché dettagliata sotto il profilo tecnico». Sulle scadenze e su chi è obbligato a fare cosa abbiamo scritto un articolo dedicato all’AI Act.

I pregiudizi entrano qui, non dopo (sociale)

Si tende a pensare ai pregiudizi come un difetto di comportamento, correggibile con qualche istruzione. Sono invece una proprietà dei dati. I dati vengono decisi qui.

Il documento su GPT-3 lo dice senza giri di parole: i modelli addestrati su internet hanno pregiudizi su scala internet. Nella loro analisi, l’83 per cento delle 388 professioni testate veniva completato più facilmente con un soggetto maschile che femminile. La tendenza aumentava quando la professione era preceduta dall’aggettivo “competente”.

C’è un’etichetta diventata famosa per tutto questo: nel 2021 un gruppo di ricercatrici definì questi modelli pappagalli stocastici (nota 5). Traduco: pappagalli statistici, che ripetono con eleganza combinazioni di parole sentite, senza capirle davvero. L’articolo fece così rumore che Google si separò da due delle autrici. I modelli di oggi sono andati ben oltre il pappagallo, su questo non c’è dubbio: ma la materia prima è rimasta quella e i pregiudizi dentro la materia prima pure.
Tienilo a mente per la puntata 4.

C’è poi un effetto ancora meno visibile, quello della pulizia. Uno studio del 2021 ha documentato (C4) un grande archivio di testo usato per addestrare modelli: 156 miliardi di token raccolti da oltre 365 milioni di documenti, dove un documento è il testo estratto da un singolo indirizzo web. I ricercatori hanno guardato che cosa il filtro anti parolacce aveva buttato fuori: i documenti scritti in inglese afroamericano venivano rimossi nel 42 per cento dei casi e quelli in inglese ispanico nel 32, contro il 6,2 per cento dell’inglese bianco standard. Nell’archivio finale il 97,8 per cento dei documenti apparteneva a quest’ultima varietà. Fra i testi eliminati non c’era solo pornografia: c’erano contenuti medici, discussioni legislative sui matrimoni fra persone dello stesso sesso, materiale sulla cura dei neonati.

Chi è poco rappresentato nei dati esiste poco per il modello. Non perché qualcuno lo abbia deciso, ma perché una regola scritta per togliere il turpiloquio ha tolto anche altro. Il bias algoritmico comincia qui. Nessuna rifinitura successiva lo cancella davvero: al massimo lo copre.

Che cosa cambia per un’azienda o una scuola

Un modello linguistico non è un archivio da interrogare, è un generatore di testo plausibile. Da qui discende tutto il resto.

Se un artigiano di Rifredi chiede quali siano gli obblighi di fatturazione per il suo caso, riceverà una risposta scritta bene, con la struttura giusta e i termini giusti: assomiglia alle risposte corrette che il modello ha visto migliaia di volte, il che non è la stessa cosa che essere corretta. Se una scuola chiede la data di una circolare ministeriale, otterrà una data verosimile (non è detto che sia vera).

Tre conseguenze operative:

Su come impostare questo tipo di lavoro nel concreto abbiamo raccolto il nostro approccio nella pagina dedicata all’intelligenza artificiale per le imprese di Firenze.

La domanda che questa puntata lascia aperta

Per arrivare a completare una frase in modo credibile, un modello ripete il ciclo previsione-correzione su una quantità di testo che si misura in centinaia di miliardi di token.

Quanto costa concretamente farglielo fare? E chi al mondo se lo può permettere?

È una domanda che il pre-addestramento apre e non può chiudere, perché riguarda il conto e non il metodo. Il processo descritto qui è già l’addestramento del modello base: le fasi successive lo rifiniscono, non lo rifanno da capo. La puntata 2, Quanto costa addestrare un’intelligenza artificiale, guarda la stessa fase dal lato della spesa: perché usarla costa pochi centesimi mentre costruirla costa quanto un’infrastruttura industriale, con la conseguenza che a poterlo fare sono pochissimi soggetti al mondo. Sul lato dei costi d’uso i conti sono già fatti in quanto costa davvero l’AI a token.

Poi ti porterò a Nairobi, da uomini pagati meno di due dollari l’ora per insegnare a una macchina a fare il loro lavoro per sempre. E intanto fammi sapere se ti è piaciuto il primo articolo!

Un dubbio da portarti alla prossima puntata: tutto quello che hai scritto sul web, i post, le recensioni, quel commento del 2019, con ogni probabilità è già dentro l’allenamento di qualche modello. Nessuno ti ha chiesto niente. Ti sta bene, o no? Non è una domanda facile: pensaci e scrivimelo nei commenti.

Fonti e note dell’autore

  1. Nell’ordinanza del 23 giugno 2025 sul caso Bartz contro Anthropic, il tribunale federale della California del Nord riassume l’apprendimento come la scoperta, per tentativi ed errori ripetuti, di «relazioni statistiche contingenti» fra ogni frammento di parola e tutti gli altri (in originale «contingent statistical relationships»). Qui e altrove le citazioni da documenti in inglese sono nostre traduzioni.
  2. La data di taglio non vale identica per tutte le AI, ma per le maggiori al momento è così: esiste una linea, una data oltre la quale il modello non ha studiato.
  3. Un dettaglio comparabile sulla composizione dei dati si trova nel documento di presentazione di LLaMA, modello aperto del 2023: proporzione di campionamento, numero di passaggi e dimensione su disco per ogni sottoinsieme. Sono eccezioni: per i modelli commerciali più diffusi oggi quella tabella in pubblico non c’è.
  4. In originale «exceedingly transformative» e «no entitlement to use pirated copies for its central library». L’accordo transattivo, approvato in via definitiva il 20 luglio 2026, istituisce un fondo non reversibile da 1,5 miliardi di dollari e stima circa 3.000 dollari per opera, al lordo di spese e onorari.
  5. Il saggio è «On the Dangers of Stochastic Parrots: Can Language Models Be Too Big?» (Bender, Gebru, McMillan-Major e Mitchell, conferenza FAccT, 2021). Due delle autrici, Timnit Gebru e Margaret Mitchell, lasciarono Google fra il dicembre 2020 e il febbraio 2021 nel conflitto nato attorno al saggio.
  6. Per la precisione: 3,4 passaggi completi, dalla tabella 2.2 del documento di presentazione di GPT-3 (2020).

Blu7, azienda in corso di riconoscimento MIM per corsi in aula e online. Iscriviti a 7 Pillole Blu.

Lascia un commento

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *