Blu7, azienda in corso di riconoscimento MIM per corsi in aula e online. Iscriviti a 7 Pillole Blu.
Alla fine della puntata scorsa ti ho promesso uomini che insegnano a una macchina a fare il loro lavoro. Oggi te li presento: non sono gli ingegneri o i matematici. Prima però una prova: fai la stessa domanda a due assistenti AI diversi. Uno risponde con tre paragrafi cordiali e una domandina finale, l’altro con un elenco puntato asciutto. Sotto, in parecchi casi, gira lo stesso motore. Chi gli ha dato due caratteri così diversi? Delle persone, pagate per dire qual è la risposta buona. Questa fase si chiama rifinitura ed è la puntata di oggi.
Come nasce un’intelligenza artificiale
Questo articolo è la puntata 3 di 4 di una serie che segue le quattro fasi di costruzione di un modello, spiegando per ognuna un comportamento che chi lo usa vede tutti i giorni.
- Il pre-addestramento: perché l’AI inventa
- Quanto costa addestrare un’intelligenza artificiale: perché usarla costa poco e costruirla costa enormemente
- La rifinitura: perché risponde con quel tono e perché due prodotti fatti sullo stesso motore rispondono in modo diverso (questa puntata)
- Le guardie: perché a volte si rifiuta e chi ha deciso che si rifiutasse
Alla fine delle quattro puntate saprai spiegare perché l’intelligenza artificiale fa quello che fa. Non serve alcuna competenza tecnica: ogni termine viene spiegato la prima volta che compare.
Ma torniamo al castello
I nostri soldati hanno finito l’addestramento di base. Nella puntata 1 li abbiamo visti imparare le competenze (i dati) indovinando miliardi di volte il frammento di parola che viene dopo; nella puntata 2 abbiamo scoperto che quell’addestramento se lo possono permettere pochissimi castelli al mondo (nota 1).
Solo che un soldato appena addestrato sa tirare colpi, non sa quali tirare e davanti a chi. Per questo adesso al castello arrivano i maestri d’armi, persone in carne e ossa che guardano ogni colpo e dicono “questo va bene, questo no, rifallo così”.
Non aggiungono forza al soldato: gli danno uno stile.
Il soldato grezzo non è un interlocutore
Quello che esce dal pre-addestramento non è un assistente: è un completatore di testo. Se gli scrivi una domanda, la continuazione più probabile potrebbe essere un’altra domanda: nelle pagine web le domande stanno spesso in fila.
Utile come un ombrello bucato.
Il metodo per correggerlo l’ha messo nero su bianco uno studio di OpenAI del 2022, che apre netto: ingrandire un modello linguistico non lo rende automaticamente più capace di seguire l’intenzione di chi gli scrive (nota 2).
Traduco: puoi fare il soldato grosso quanto ti pare, ma se nessuno gli insegna a combattere tira fendenti a caso, solo più forti.
Lo stesso studio misura il peso della fase: dopo la rifinitura, un modello da 1,3 miliardi di parametri veniva preferito dai giudici umani a uno cento volte più grande ma non rifinito (nota 2).
Non perché sapesse di più: aveva imparato a rispondere a tono.
Rifinitura e RLHF: non sono la stessa cosa
Sentirai dire che la rifinitura “è” l’RLHF, l’apprendimento per rinforzo dal giudizio umano.
Non è esatto: la rifinitura è la fase, l’RLHF è una delle tecniche che si usano lì dentro, non è l’unica.
Ogni RLHF è rifinitura, non ogni rifinitura è RLHF.
ESEMPIO: “vado in palestra” e “faccio crossfit”. Il crossfit si fa in palestra, ma in palestra puoi fare anche pesi liberi, pilates, spinning, ginnastica dolce, …
Traduco: rifinitura è il periodo di allenamento, RLHF è uno dei programmi possibili.
I due momenti che nessuno ti ha mai raccontato della AI
Primo momento: imitare le risposte dei maestri
Delle persone scrivono a mano risposte esemplari e alla Intelligenza Artificiale si chiede di imitarle. Si chiama addestramento supervisionato: nessun rinforzo, nessun voto, solo imitazione.
ESEMPIO: le prime ore di scuola guida. Non guidi tu: guardi l’istruttore, il babbo o lamma che ti portano a giro, guardi le mani, lo specchietto, la partenza in salita, poi arrivi in un posto sicuro (non l’ho scritto a caso) e provi a rifare i suoi gesti. Nessun punteggio: ti si mostra come si fa.
Nel caso del 2022 le risposte esemplari erano poche migliaia (nota 3): una briciola rispetto ai miliardi di frammenti del pre-addestramento.
Le competenze il soldato le aveva già: qui gli si insegna la postura. Aveva letto le istruzioni di guida, magari aveva superato il test teorico, ora siamo alla pratica.
Secondo momento: il giudice artificiale. E tu eri la cavia.
Ti è mai capitato che ChatGPT ti fornisse due risposte simili e ti chiedesse quale preferivi? Tu eri il maestro-cavia. Ora lo sai.
Arrivano i confronti: si fanno generare più risposte alla stessa domanda e delle persone indicano quale preferiscono. I maestri-cavia.
Con decine di migliaia di confronti (nota 3) si costruisce un modello di ricompensa: un programma il cui unico mestiere è prevedere quale risposta piacerebbe di più al giudice umano.
ESEMPIO: un Sous Chef e non un aiuto-cuoco in cucina, ma un vice Chef ha assaggiato mille tuoi piatti sentendo ogni volta il tuo verdetto. A un certo punto non servi più tu: assaggia lui e sa cosa diresti. Il modello principale si allena contro quell’assaggiatore, giorno e notte, senza stancare nessun umano. Questo soltanto è l’RLHF.
Traduco: il giudice artificiale è un giudice che ha imparato i gusti del giudice umano, così il giudizio umano si moltiplica senza moltiplicare gli umani.
Nel 2023 un gruppo di Stanford ha mostrato che anche il giudice artificiale si può saltare: gli autori definiscono l’RLHF una procedura «complessa e spesso instabile» (nota 4). Come saltarla ne parliamo un’altra volta.
Perché due prodotti sullo stesso motore rispondono diversamente?
Adesso la risposta ce l’hai. Chi costruisce un prodotto parte da un motore e ci fa sopra la propria rifinitura, coi propri esempi e le proprie preferenze. Stessi soldati, maestri d’armi diversi: due eserciti con due stili. E’ un po’ come quando le case automobilistiche condividono la struttura di base della macchina ma poi forniscono due allestimenti diversi: stesso motore e pianale, ma magari fari diversi, interni diversi, …
C’è poi un secondo livello, più rapido da cambiare: le istruzioni di sistema, il testo invisibile che il fornitore mette davanti a ogni tua conversazione. Ma quelle sono roba della quarta puntata. Intanto tieni a mente: il tono viene dalla rifinitura, i rifiuti soprattutto dalle guardie.
Chi sono i maestri d’armi (il colpo al cuore)
Ed eccoli, gli uomini della promessa. Nel caso del 2022 i valutatori erano una quarantina di collaboratori, reclutati con un test di ammissione su piattaforme per freelance e società di etichettatura dati. A un questionario volontario risposero in 19: i gruppi più numerosi erano filippini e bangladesi, poi statunitensi; tre quarti sotto i 35 anni, quasi tutti laureati (nota 5).
Giovani, istruiti, dall’altra parte del mondo: sono loro a decidere come ti parla il tuo assistente.
E qui un dato che complica la storia: alla frase «sono stato pagato equamente per questo lavoro», quasi la metà si dichiarò molto d’accordo, quasi tutti gli altri d’accordo, nessuno contrario (nota 5). Erano però collaboratori selezionati, per un lavoro di ricerca.
Il resto della filiera è un’altra storia. Nel gennaio 2023 un’inchiesta di TIME ha documentato che, per costruire il filtro anti contenuti tossici poi integrato in ChatGPT, OpenAI aveva affidato a una società in Kenya la classificazione di testi su abusi, violenza e odio. Secondo i documenti visti dai giornalisti, quei lavoratori portavano a casa meno di due dollari l’ora, fra sei e nove volte meno di quanto il committente versava alla società; leggevano centinaia di passaggi atroci per turni di nove ore e tutti gli intervistati hanno descritto ferite psicologiche durature. La società fornitrice contesta cifre e carichi: i suoi numeri sono in nota (nota 6). Quando il contratto fu chiuso in anticipo per la durezza del lavoro, la maggior parte finì su incarichi pagati peggio o perse il posto. Era il modo con cui mantenevano le famiglie, hanno risposto quei poveri lavoratori.
Precisazione dovuta: quel lavoro in Kenya non era ordinare risposte per preferenza, era etichettare orrori per un rilevatore di contenuti nocivi. Per spiegarmi ancora meglio: arrivava una immagine e dovevano dire se era da mandare alla Guardia o passabile al modello. Ma vedevano sempre delle immagini non raccomandabili o testi poco edificanti.
Cioè la fase delle guardie: prossima puntata. Il problema però è strutturale: lo scrive la Partnership on AI, coalizione di cui OpenAI fa parte, documentando condizioni precarie e il possibile tentativo di nascondere quanto l’AI dipenda da questi lavoratori (nota 7).
«Lontano dagli occhi, lontano dal cuore»? direi di no.
Anthropic è diversa: in meglio?
C’è chi prova un’altra strada: Anthropic fa giudicare le risposte direttamente ad un’altra AI, guidata da una “costituzione” scritta di principi, elencando fra i motivi proprio questo: il giudizio umano può costringere persone a leggere contenuti disturbanti (nota 8).
Ma qui si è deciso che una macchina decide per allenare un’altra macchina che comunque interagisce con gli uomini.
Ci siamo spostati su un’altra domanda: la Costituzione dei principi di Anthropic l’ha pur scritta qualcuno.
Chi decide che cos’è un buon colpo
Il punto vero: cambiando tecnica non cambia il fatto che un criterio l’ha scelto qualcuno. Gli autori dello studio del 2022 lo ammettono fra i limiti: hanno allineato il modello alle preferenze dei valutatori, che seguivano istruzioni scritte dai ricercatori, quindi in fondo alle preferenze dei ricercatori stessi (nota 9). E c’è un numero scivoloso: i valutatori erano in accordo 3 volte su 4 (nota 9). E sulla quarta?
Non esiste un criterio oggettivo di “buona risposta”: esiste un documento scritto da qualcuno. Anthropic il suo lo pubblica e lo aggiorna (nota 8).
“Addestriamo l’AI sui tuoi dati”: occhio a cosa firmi
Scendo un attimo dal Castello: questa frase la sento spesso dalle imprese fiorentine e non.
Quando a un’agenzia immobiliare di Campo di Marte o a uno studio di architettura dell’Oltrarno propongono di “utilizzare l’intelligenza artificiale sui vostri documenti”, quasi sempre non è addestramento. È recupero di informazioni, in inglese RAG: i documenti restano in un archivio, il sistema ci pesca dentro i pezzi utili e li passa al modello insieme alla domanda. Il modello non impara nulla: per questo puoi aggiungere o togliere un documento in un minuto.
PS: abbiamo appena creato una AI locale che ti può aiutare ad anonimizzare i documenti prima di mandarli a chatgpt e amici: ti può interessare?
Il fine-tuning vero, cioè una rifinitura su misura, serve ad altro: classificare, tradurre con sfumature particolari, produrre contenuti in un formato preciso. E’ quella differenza che percepisci te, come persona quando dici: questa Intelligenza Artificiale “scrive meglio” di questa altra.
Nell’elenco dei casi d’uso della documentazione ufficiale, “insegnargli i tuoi dati” non compare (nota 10): il fine-tuning cambia il come, non il cosa sa: personalizzare il modello di un altro è un servizio e i servizi si ritirano. (nota 10)
In pratica: quando il fornitore ti dice “personalizziamo il modello”, chiedigli se intende fare un vero ri-addestramento sui tuoi documenti o se intende solo scriverti un prompt con istruzioni ed esempi. Sono due lavori diversi: il primo costa di più, ci mette più tempo e i tuoi documenti restano da lui, il secondo è immediato ed economico. Prova sempre prima il secondo metodo, perché quasi sempre basta.
Come impostare la scelta è il tema della nostra pagina sull’intelligenza artificiale per le imprese di Firenze; per le scuole c’è il percorso di formazione AI.
Il portone del Castello si chiude: è arrivata la nuova AI
Torniamo al castello un’ultima volta. È sera, i maestri d’armi hanno finito: i soldati hanno uno stile, un tono, perfino le buone maniere. Mentre loro escono, sulle mura salgono altre figure e il portone si chiude. Sono le guardie: quelle che domani, quando qualcuno busserà con una certa domanda, diranno di no. Chi le ha messe lì? Chi ha scritto la lista delle domande a cui non si risponde? È la quarta e ultima puntata.
Intanto ti lascio il dubbio di oggi, che facile non è: il tono gentile del tuo assistente l’hanno scelto persone che non conosci, seguendo istruzioni che non puoi leggere, per paghe che nessuno ti dice. Se esistesse una versione rifinita da persone pagate meglio e con criteri pubblici, ma costasse il doppio, tu quale sceglieresti? Scrivimelo nei commenti: la risposta comoda non vale.
Fonti e note dell’autore
- Epoch AI, pagina Trends: «Frontier AI labs have raised more than $370 billion», i laboratori di frontiera hanno raccolto oltre 370 miliardi di dollari. È la stessa misura usata nella puntata 2. https://epoch.ai/trends
- Ouyang et al., OpenAI, “Training language models to follow instructions with human feedback” (InstructGPT), 2022: https://arxiv.org/abs/2203.02155. In originale: «Making language models bigger does not inherently make them better at following a user’s intent». Il confronto di preferenza: le risposte del modello rifinito da 1,3 miliardi di parametri erano preferite a quelle del GPT-3 da 175 miliardi. Qui e nelle note seguenti le citazioni da documenti in inglese sono nostre traduzioni.
- Stesso studio, sezione 3.2: circa 13.000 richieste con risposta esemplare per l’addestramento supervisionato e circa 33.000 richieste ordinate per preferenza per il modello di ricompensa.
- Rafailov et al., “Direct Preference Optimization”, 2023, gruppo della Stanford University: https://arxiv.org/abs/2305.18290. In originale «complex and often unstable». Per precisione: il vantaggio dimostrato dagli autori riguarda il controllo della polarità positiva o negativa del testo generato, non il tono di voce; il “tono e stile” («the right tone and style») è il caso d’uso indicato per il metodo dalla documentazione OpenAI, consultata il 5 agosto 2026: https://platform.openai.com/docs/guides/direct-preference-optimization
- Ouyang et al., appendice B: circa 40 collaboratori, reclutati tramite Upwork e Scale AI con un test di ammissione. Al questionario volontario risposero in 19: 22% filippini, 22% bangladesi, 17% statunitensi; il 75% sotto i 35 anni; l’89,4% con almeno una laurea triennale (52,6% triennale più 36,8% magistrale). Alla frase «I was paid fairly for doing the task» («sono stato pagato equamente per questo lavoro»): 47,4% molto d’accordo, 42,1% d’accordo, 10,5% né d’accordo né contrario, nessun contrario.
- Billy Perrigo, TIME, 18 gennaio 2023: https://time.com/6247678/openai-chatgpt-kenya-workers/. Paghe nette fra 1,32 e 2 dollari l’ora secondo i documenti visionati; il committente pagava alla società fornitrice 12,50 dollari l’ora, «fra sei e nove volte» quanto arrivava ai lavoratori; tre dipendenti hanno riferito di 150-250 passaggi da leggere per turno di nove ore; all’epoca il salario minimo di una receptionist a Nairobi era 1,52 dollari l’ora. La smentita della società fornitrice: 70 passaggi per turno e paghe fra 1,46 e 3,74 dollari l’ora al netto delle tasse. Il contratto fu chiuso nel febbraio 2022, otto mesi prima del previsto, per la natura traumatica del lavoro.
- Partnership on AI, “Responsible sourcing considerations”, 16 giugno 2021: https://partnershiponai.org/responsible-sourcing-considerations/. In originale: «Out of sight is also out of mind».
- Anthropic, “Claude’s Constitution”: https://www.anthropic.com/news/claudes-constitution (versione aggiornata pubblicata il 21 gennaio 2026); studio tecnico: Bai et al., “Constitutional AI”, 2022, https://arxiv.org/abs/2212.08073. Fra i limiti dichiarati del giudizio umano: «it may require people to interact with disturbing outputs».
- Ouyang et al., sezione 5.2 (limiti): il modello è allineato alle preferenze dei valutatori, influenzate dalle istruzioni ricevute, dal contesto di lavoro retribuito e da chi le istruzioni le ha scritte, cioè i ricercatori. Accordo fra valutatori: «inter-labeler agreement to be about 73%», quindi disaccordo su poco più di una risposta su quattro.
- Documentazione OpenAI sul supervised fine-tuning, consultata il 5 agosto 2026: https://platform.openai.com/docs/guides/supervised-fine-tuning. Casi d’uso indicati: classificazione, traduzione con sfumature, contenuti in formato preciso, correzione di errori nel seguire le istruzioni; minimo 10 esempi, miglioramenti apprezzabili da 50-100. Avviso sulla stessa piattaforma: «OpenAI is winding down the fine-tuning platform», non più accessibile a nuovi utenti.
Blu7, azienda in corso di riconoscimento MIM per corsi in aula e online. Iscriviti a 7 Pillole Blu.