En læringsmetode der AI-en lærer gjennom prøving og feiling, med belønning for gode handlinger og straff for dårlige. Det er som å trene en valp med godbiter.
En AI kan lære å spille sjakk ved å spille millioner av partier mot seg selv og lære av seire og tap.