11. SEPTEMBER 2026

← Alle begreper
Hva er

RLHF

Reinforcement Learning from Human Feedback: trening der mennesker rangerer modellsvar, og modellen læres opp til å foretrekke svarene folk likte. Grunnen til at chatboter oppfører seg.