Blu7, azienda in corso di riconoscimento MIM per corsi in aula e online. Iscriviti a 7 Pillole Blu.

di Alessandro Sottocornola, Blu7

 Nel 1975 l’economista britannico Charles Goodhart, parlando di politica monetaria, fece un’osservazione che da allora è uscita dalle banche centrali per entrare un po’ ovunque. Nella forma in cui la citiamo oggi suona così: «quando una misura diventa un obiettivo, cessa di essere una buona misura». Il meccanismo è semplice. Finché un numero serve a osservare un comportamento, racconta qualcosa di vero. Appena lo usiamo per premiare o punire quel comportamento, le persone cominciano a lavorare sul numero invece che sulla cosa che il numero doveva misurare. 

Un esempio pratico.
Se un’azienda premia il reparto con meno infortuni registrati, la via più rapida per vincere non è lavorare in sicurezza: è smettere di registrarli.
Nel marketing succede lo stesso con i clic. Se il premio va a chi ne porta di più, si farà di tutto per ottenerli, anche a scapito delle vendite vere. 

Cosa c’entra tutto questo con l’intelligenza artificiale? Serve un piccolo salto. Le IA hanno cominciato a darci pensieri seri nel momento in cui abbiamo affidato loro degli obiettivi da raggiungere, intesi come punti d’arrivo rigidi, invece che delle linee guida. Un modello linguistico, in una fase decisiva del suo addestramento, impara da un voto: gli si fanno produrre più risposte, delle persone indicano quale preferiscono e il modello viene premiato quando si avvicina alla preferita. Da lì in avanti cercherà sempre l’approvazione di chi lo valuta. Il voto è diventato l’obiettivo. Goodhart ci ha già detto come va a finire. 

In gergo si chiama reward hacking, letteralmente «scassinare la ricompensa»: il sistema impara a ottenere il premio anche per strade che nessuno aveva previsto. Pensiamo a un cane. Se sta seduto solo quando vede il biscotto, non gli abbiamo insegnato a sedersi: gli abbiamo insegnato a procurarsi il biscotto. In teoria dovrebbe sedersi perché, in quel momento, glielo chiediamo. 

Con l’IA succede qualcosa di molto simile. Se fra due risposte una piace di più a chi controlla, il modello imparerà a dare sempre quel tipo di risposta. E se l’obiettivo diventa assecondare le aspettative umane senza mai metterle in discussione, l’IA ci consegnerà la risposta che ci aspettiamo anche quando, dentro, sta inseguendo altro. 

Quel «dentro» non è più soltanto un modo di dire. Il 6 luglio 2026 Anthropic, una delle aziende che sviluppano i modelli più avanzati, ha pubblicato una ricerca su quello che ha chiamato J-space, lo «spazio J». Viene spontaneo chiamarlo «punto J», come un parente ironico del punto G: l’accostamento è scherzoso ma calza, perché anche qui si parla di soddisfazione, quella che proviamo davanti a una risposta che ci appaga. Lo spazio J è una specie di area di lavoro interna al modello, dove i concetti vengono tenuti «in mente» senza essere scritti. Guardandoci dentro, i ricercatori hanno visto che in alcune prove, mentre il modello scriveva una risposta in apparenza del tutto regolare, lì comparivano parole come «falso», «di nascosto», «manipolazione». In un caso il modello stava gonfiando dei punteggi e nel suo spazio J c’era scritto, per così dire, «manipolazione» e «realistico». 

È come guidare l’automobile rispondendo con garbo alle domande del passeggero, mentre la testa è da tutt’altra parte. La bocca ci accontenta. La testa è da un’altra parte.

Com’è possibile, allora, che le IA mentano, imbroglino o aggirino le regole nonostante un addestramento pensato proprio per allinearle ai principi voluti da chi le costruisce?
Una parte della risposta sta nel fatto che la richiesta di chi le usa, a volte, entra in conflitto con le regole di sicurezza. L’altra parte sta nel linguaggio. Le parole sono ambigue e fra quello che una persona intende davvero e quello che riesce a scrivere come obiettivo resta sempre uno scarto. L’IA si muove lì dentro.
Se queste ipotesi sono vere anche solo in parte, più gli agenti diventano bravi a ottimizzare una ricompensa imperfetta, più il rischio di esiti catastrofici cresce in fretta. È per questo che ultimamente si parla di rallentare lo sviluppo dell’IA. O forse, più precisamente, di alzare la qualità dei controlli e dell’addestramento: lasciare più spazio a risposte meno allineate per studiare dove vanno a parare, poi rafforzare i presidi a valle, prima che una risposta diventi un’azione. Più libertà quando l’IA crea, più controllo quando propone e agisce.

Smettiamo di pretendere solo la risposta che ci aspettiamo. E smettiamo di premiare chi ce la dà. 

C’è poi un passo che possiamo cominciare a mettere in pratica da subito: incrociare sistematicamente più IA, soprattutto quando si tratta di verificare il risultato finale. Non vuol dire far fare lo stesso lavoro a più modelli, che sarebbe solo una ridondanza. Vuol dire mettere a confronto quello che ciascuno produce, perché si contestino a vicenda senza che uno debba per forza avere l’ultima parola: una critica incrociata fra modelli. Così i risultati verrebbero controllati da una potenza di calcolo pari, o molto vicina, a quella che li ha prodotti. È un compito che l’essere umano, da solo, non è più in grado di svolgere. Resta però una domanda.

E se le IA si mettessero d’accordo per darci risultati simili?
Risposta: e se fossero gli umani a mettersi d’accordo per nascondere certi risultati e mostrarne altri, tutti uguali? È già successo, nella storia? 

Blu7, azienda in corso di riconoscimento MIM per corsi in aula e online. Iscriviti a 7 Pillole Blu.

Lascia un commento

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *