Torna al GlossarioGLOSSARIO AI ACCADEMY · Fondamenti Profondi e Allineamento

Cos'è DPO (Direct Preference Optimization)?

Direct Preference Optimization: tecnica moderna più efficiente di RLHF per allineare il modello direttamente sulle preferenze espresse, senza sistemi di ricompensa complessi.

Un esempio pratico

Il DPO è come mostrare direttamente due risposte e dire 'questa sì, quella no': più semplice e veloce del sistema a premi dell'RLHF.

Termini correlati

Vuoi impararli tutti giocando?

Metti alla prova questi termini e altri 100+ con i minigiochi della Glossary Arena. Gratis.

Impara giocando, gratis

Usiamo cookie tecnici essenziali e, solo con il tuo consenso, Google Analytics per migliorare il sito. Maggiori informazioni