En standardisert test for å sammenligne hvor gode AI-modeller er på bestemte oppgaver. Den er som en eksamen for AI.

MMLU tester generell kunnskap og HumanEval tester koding, og modellene rangeres etter score.

Kilde: Stanford HELM →

Relaterte begreper