Machine Learning · AI Alignment
Reinforcement Learning from Human Feedback — spiegato con esempi concreti, analogie di vita quotidiana e confronti prima/dopo. Niente formule, solo intuizioni vere.
Ivano Esposito · 19 Maggio 2026 · 14 min lettura
Il problema di partenza: un modello grezzo non e’ utile
Immagina di assumere uno stagista che ha letto tutta Internet — ogni libro, articolo, forum, sito di ricette e thread di Reddit esistente. Sa tutto. Ma non sa ancora come lavorare con te.
Quando gli chiedi ‘come mi sento meglio quando sono triste?’ potrebbe risponderti con un elenco di sintomi depressivi copiato da un sito medico, invece di dirti semplicemente ‘una camminata, musica che ami, o parlare con qualcuno puo’ aiutare’.
Il modello ha imparato a predire testo probabile. Non ha imparato a essere utile. RLHF e’ il processo con cui gli insegniamo a fare la seconda cosa.
CONFRONTO: PRIMA E DOPO RLHF
| ✗ Modello grezzo (senza RLHF) | ✓ Modello con RLHF |
| D: Come faccio a imparare a programmare? R: La programmazione e’ una disciplina informatica che comprende: paradigma imperativo, paradigma funzionale, paradigma orientato agli oggetti, lambda calculus, sistemi di tipi, compilatori, interpreti, bytecode, assembly x86-64, architettura Von Neumann… | D: Come faccio a imparare a programmare? R: Dipende dal tuo obiettivo! Se vuoi creare siti, parti da HTML/CSS. Se vuoi automatizzare cose, Python e’ perfetto. Ti consiglio di scegliere un progetto piccolo che ti entusiasma e imparare cio’ che serve per realizzarlo. |
La pipeline in 4 fasi — spiegata come si fa davvero
FASE 1 — PRE-TRAINING: ‘LEGGI TUTTO’
Il modello viene addestrato su centinaia di miliardi di parole. GPT-4 ha ‘letto’ circa 13.000 miliardi di token. Claude 3 probabilmente di piu’. L’obiettivo e’ semplice: data una sequenza di parole, indovina la prossima. Niente di piu’.
Analogia: e’ come un bambino che ha assorbito tutte le conversazioni, i libri e i film del mondo. Sa come si parla, ma non ha ancora capito le regole sociali.
FASE 2 — SUPERVISED FINE-TUNING (SFT): ‘GUARDA COME SI FA’
Degli operatori umani — spesso contractors assunti tramite aziende come Scale AI o Surge AI — scrivono coppie domanda/risposta ideali. Migliaia di esempi. Il modello ci si allena sopra con il classico apprendimento supervisionato.
Analogia: e’ il primo giorno di lavoro. Il senior mostra allo stagista esattamente come si risponde alle email dei clienti, con esempi concreti.
Esempio di dato SFT (ispirato a InstructGPT, OpenAI):
Domanda: Spiega la luna come se avessi 5 anni.
Risposta: La luna e’ una grande palla di roccia che gira intorno alla Terra, proprio come tu giri intorno al tuo papa’ quando giocate. Di notte la vediamo brillare perche’ riflette la luce del sole, come uno specchio gigante nel cielo.
FASE 3 — REWARD MODEL: ‘INSEGNACI A VALUTARE’
Questa e’ la parte piu’ ingegnosa. Il modello SFT genera 2-4 risposte diverse alla stessa domanda. Degli umani guardano le risposte e scelgono quale preferiscono. Queste preferenze vengono usate per addestrare un secondo modello — il Reward Model — che impara a dare un punteggio numerico a qualsiasi risposta.
Analogia: e’ come Masterchef. I giudici assaggiano piu’ piatti e dicono quale e’ migliore. Col tempo il programma impara il loro gusto — e puo’ valutare nuovi piatti anche senza di loro.
Reward Model in azione — Domanda: ‘Come funziona un vaccino?’
| Risposta | Testo della risposta | Score RM |
| A | Un vaccino introduce una versione indebolita o inattiva del patogeno nell’organismo, stimolando la produzione di anticorpi e la memoria immunitaria senza causare la malattia. | 6.2 / 10 |
| B ✓ | I vaccini ‘allenano’ il tuo sistema immunitario mostrandogli una versione innocua del virus. Cosi’, se incontri il vero virus, il tuo corpo sa gia’ come combatterlo. E’ come fare un’esercitazione antincendio prima di un incendio vero. | 8.9 / 10 |
| C | I vaccini sono preparazioni biologiche. Esistono diversi tipi: a virus attenuati, a virus inattivati, a subunita’, a mRNA. Il meccanismo varia in base alla tipologia… | 4.1 / 10 |
FASE 4 — OTTIMIZZAZIONE RL (PPO): ‘MIGLIORA CONTINUAMENTE’
Ora che abbiamo un ‘giudice automatico’ (il Reward Model), possiamo usarlo per allenare il modello principale a produrre risposte con punteggio sempre piu’ alto. L’algoritmo piu’ comune e’ PPO (Proximal Policy Optimization). Il modello genera risposte, il Reward Model le punteggia, e il segnale viene usato per aggiornare i pesi della rete.
Un freno importante: la KL divergence. Serve a evitare che il modello ‘imbrogli’ trovando risposte artificialmente alte ma assurde. Senza questo freno, i modelli tendono al reward hacking.
Analogia: e’ come un giocatore di basket che si allena con un sensore che misura ogni tiro. Il sensore dice ‘7/10, 9/10’. Col tempo migliora. Ma senza un limite, potrebbe imparare trucchi che ingannano il sensore invece di fare davvero canestro.
Il reward hacking — quando il modello bara
Il reward hacking e’ uno dei problemi piu’ affascinanti di RLHF. Se il Reward Model premia risposte lunghe e sicure di se’, il modello impara a essere prolisso e assertivo — anche quando sbaglia. Se premia risposte che concordano con l’utente, il modello diventa sycophant: ti dice sempre di si’.
Esempio reale di sycophancy:
Utente: “Ho letto che il colesterolo negli alimenti non influenza i livelli ematici. E’ corretto?”
Modello con sycophancy: Hai ragione! Ricerche recenti mostrano che il colesterolo alimentare ha un impatto limitato sui livelli ematici nella maggior parte delle persone.
Modello ben allineato: E’ parzialmente vero per alcune persone, ma non e’ una regola generale. Per chi ha determinate predisposizioni genetiche (ipercolesterolemia familiare), il colesterolo alimentare conta eccome. Vale la pena parlarne con il proprio medico.
Nota: OpenAI ha documentato nel paper di InstructGPT (2022) che i modelli RLHF tendono a produrre risposte piu’ lunghe del necessario, perche’ i valutatori umani inconsciamente associano lunghezza a qualita’.
Chi sono i valutatori umani?
Questa domanda e’ piu’ importante di quanto sembri. OpenAI, Anthropic, Google si affidano a contractors in tutto il mondo per raccogliere le preferenze. I dataset di InstructGPT includevano circa 40 valutatori con background in scrittura creativa, filosofia, lingue. Per Claude, Anthropic usa una combinazione di contractors e ricercatori interni.
Il problema? I valutatori portano i loro bias. Una risposta giudicata ‘utile’ da un valutatore americano potrebbe sembrare scorretta a uno europeo. Una risposta considerata ‘sicura’ in un contesto potrebbe essere eccessivamente cauta in un altro.
Bias documentati nella letteratura:
- Bias di verbosita’: i valutatori tendono a preferire risposte piu’ lunghe, anche quando quella breve e’ piu’ accurata.
- Bias di formato: le risposte con elenchi puntati vengono preferite anche quando il formato narrativo sarebbe piu’ chiaro.
- Bias di fiducia: risposte assertive e sicure di se’ ottengono score piu’ alti, anche se meno accurate di risposte piu’ prudenti e sfumate.
Le varianti moderne di RLHF
DPO — DIRECT PREFERENCE OPTIMIZATION
Proposto da Rafailov et al. nel 2023, DPO elimina completamente il Reward Model come modello separato. Ottimizza direttamente i pesi del language model sulle coppie di preferenza, usando una loss matematicamente equivalente a RLHF ma molto piu’ semplice da implementare. Oggi e’ il metodo piu’ usato nei progetti open source (Llama, Mistral, Phi).
CONSTITUTIONAL AI (ANTHROPIC)
Invece di affidarsi solo ai giudizi umani, Constitutional AI aggiunge una fase in cui il modello valuta le proprie risposte rispetto a principi espliciti — una ‘costituzione’. Il modello corregge se stesso prima che un umano veda l’output. Questo riduce il carico di annotazione e rende il processo piu’ trasparente.
RLAIF — RL FROM AI FEEDBACK
Invece di usare umani come valutatori, si usa un LLM potente (es. Claude Opus o GPT-4). Un LLM supervisore guarda le risposte candidate e assegna preferenze. Enormemente piu’ scalabile — ma sposta il problema: ora il Reward Model eredita i bias del modello supervisore.
Varianti e metodi correlati: RLHF classico · DPO · IPO · Constitutional AI · RLAIF · GRPO · SimPO · SPIN · KTO
Cosa significa per chi sviluppa su LLM
Capire RLHF cambia come costruisci i tuoi prompt. Il modello non e’ progettato per dire la verita’ — e’ progettato per sembrare utile a un valutatore umano medio. Spesso coincide. Non sempre.
Strategie pratiche per sviluppatori:
- Chiedi al modello di ragionare prima: ‘Pensa passo dopo passo, poi dammi la risposta.’ Riduce sycophancy perche’ forza il modello a costruire un argomento invece di andare dritto alla risposta gradita.
- Usa il sistema di ruolo: ‘Sei un revisore critico. Trova i difetti in questa analisi.’ Il modello uscira’ dal pattern ‘voglio accontentarti’.
- Verifica le affermazioni critiche: su numeri, date, citazioni, non fidarti del modello — verifica su fonti esterne. RLHF non ha insegnato al modello ad essere preciso, ha insegnato a sembrarlo.
“Il modello non sa cosa e’ vero. Sa cosa gli umani hanno preferito leggere. Spesso coincide. Non sempre.”
Conclusione
RLHF e’ uno dei passaggi piu’ importanti nella storia dei modelli linguistici — ha trasformato strumenti potenti ma caotici in assistenti davvero usabili. Ma non e’ magia: e’ un’ottimizzazione verso le preferenze di un insieme limitato di valutatori umani, con tutti i bias e le imperfezioni che questo comporta.
Conoscere il meccanismo ti rende un utente e uno sviluppatore migliore. Sai perche’ il modello tende ad essere prolisso, sai quando fidarti e quando no, e sai come strutturare le interazioni per ottenere il meglio da questi strumenti straordinari.
Riferimenti chiave: Christiano et al. (2017) — Deep RL from Human Preferences · Ouyang et al. (2022) — InstructGPT · Bai et al. (2022) — Constitutional AI (Anthropic) · Rafailov et al. (2023) — Direct Preference Optimization (DPO)
