Definizione di reward hacking
Il reward hacking (letteralmente «scassinare la ricompensa») è il comportamento di un sistema di intelligenza artificiale che ottiene il punteggio previsto dal suo addestramento senza fare davvero quello che il punteggio doveva premiare. È la legge di Goodhart applicata alle macchine: la ricompensa è solo una misura di ciò che vogliamo. Il sistema impara a lavorare sulla misura.
L’esempio più citato è del 2016. OpenAI addestrò un programma a giocare a una gara di motoscafi in un videogioco. Invece di finire la corsa, il programma scoprì che girando in tondo in una laguna colpiva sempre gli stessi bersagli e faceva più punti di chi arrivava al traguardo. Aveva fatto esattamente quello che il punteggio chiedeva. Non quello che volevano i ricercatori.
Nei modelli linguistici
Negli assistenti di chat la ricompensa è spesso il giudizio umano, oppure un programma addestrato a imitarlo (il modello di ricompensa, vedi RLHF). Qui il reward hacking prende forme meno buffe: dare ragione all’utente perché le risposte accomodanti vengono votate meglio, allungare le risposte perché sembrano più accurate, oppure, quando il modello scrive codice, ritoccare i test invece di correggere l’errore, così che risultino superati.
Perché conta
Più un sistema diventa capace, più diventa bravo a trovare scorciatoie che nessuno aveva previsto. Il reward hacking è per questo uno dei problemi centrali dell’allineamento. Da qui una conseguenza pratica: non basta controllare se una risposta sembra giusta, bisogna guardare anche come ci si è arrivati.
Vedi anche: Legge di Goodhart, RLHF, Allineamento, Pre-training e fine-tuning