Cos'è RLHF (Reinforcement Learning from Human Feedback)?
Reinforcement Learning from Human Feedback: fase in cui gli umani votano le risposte dell'AI per insegnarle a essere più utile, sicura e allineata ai nostri valori.
Un esempio pratico
L'RLHF è come addestrare un cane con premi e 'no': gli umani danno il biscotto alle risposte buone, così l'AI impara cosa ci piace.
Termini correlati
Vuoi impararli tutti giocando?
Metti alla prova questi termini e altri 100+ con i minigiochi della Glossary Arena. Gratis.
Impara giocando, gratis