Definizione di RLHF

RLHF (dall’inglese reinforcement learning from human feedback, apprendimento per rinforzo dal giudizio umano) è una delle tecniche con cui un modello già addestrato viene portato a rispondere in modo utile e pertinente. Funziona così: delle persone confrontano coppie di risposte del modello e indicano quale preferiscono; da quei confronti si costruisce un modello di ricompensa, cioè un programma il cui unico compito è prevedere quale risposta un giudice umano sceglierebbe; il modello principale si allena poi contro quel giudice artificiale.

Due precisazioni che cambiano il senso della sigla. La prima: l’RLHF è una tecnica, non l’intera fase di rifinitura. Nella stessa fase c’è anche l’addestramento supervisionato, in cui il modello impara imitando risposte esemplari scritte a mano, senza alcun rinforzo. E per allinearsi alle preferenze umane esistono metodi che il rinforzo non lo usano affatto, come l’ottimizzazione diretta delle preferenze (DPO). Ogni RLHF è rifinitura, non ogni rifinitura è RLHF. La seconda: il fatto che un assistente si rifiuti di trattare certi argomenti dipende soprattutto da un altro strato, fatto di filtri e istruzioni di sistema, più che dalle preferenze imparate qui.

Resta il tema di metodo, che nessuna tecnica risolve: chi sono i valutatori, in che condizioni lavorano, quali criteri seguono e chi quei criteri li ha scritti. Sono le domande dell’allineamento.

Vedi anche: Allineamento, Pre-training e Fine-tuning, Bias algoritmico, System prompt