RLHF (Reinforcement Learning from Human Feedback)
Forsterkningslæring fra menneskelig tilbakemelding
En treningsmetode der mennesker vurderer svar fra en KI-modell, og modellen lærer å gi flere av de svarene folk liker best. Det er en viktig grunn til at chatboter svarer høflig og hjelpsomt. Ulempen er at modellen også kan lære å si det folk vil høre, i stedet for det som er riktig.
En modell lager to mulige svar på samme spørsmål, og en person velger det beste. Etter tusenvis av slike valg har modellen lært hva folk foretrekker.