Cos'è DPO (Direct Preference Optimization)?
Direct Preference Optimization: tecnica moderna più efficiente di RLHF per allineare il modello direttamente sulle preferenze espresse, senza sistemi di ricompensa complessi.
Un esempio pratico
Il DPO è come mostrare direttamente due risposte e dire 'questa sì, quella no': più semplice e veloce del sistema a premi dell'RLHF.
Termini correlati
Vuoi impararli tutti giocando?
Metti alla prova questi termini e altri 100+ con i minigiochi della Glossary Arena. Gratis.
Impara giocando, gratis