← Alle begreper
Hva er
RLHF
Reinforcement Learning from Human Feedback: trening der mennesker rangerer modellsvar, og modellen læres opp til å foretrekke svarene folk likte. Grunnen til at chatboter oppfører seg.
Reinforcement Learning from Human Feedback: trening der mennesker rangerer modellsvar, og modellen læres opp til å foretrekke svarene folk likte. Grunnen til at chatboter oppfører seg.