Hvorfor klarer ikke KI å telle bokstaver i et ord? Tokenisering forklart
Sist faktasjekket:

Kort oppsummert
KI-modeller leser ikke tekst bokstav for bokstav, men deler den opp i biter kalt tokens og jobber med dem som tall. Derfor tar de ofte feil når de skal telle r-ene i “strawberry”. Mekanismen heter tokenisering, og den forklarer også hvorfor KI av og til bommer på enkel matte.
Hvorfor “strawberry” ble et kjent eksempel
Be en KI-chatbot telle hvor mange ganger bokstaven “r” forekommer i ordet “strawberry”, så får du overraskende ofte feil svar, selv fra svært avanserte modeller. Svaret på spørsmålet “hvor mange r-er er det i strawberry?” er tre, men flere store og populære modeller har svart to. Eksempelet er blitt så kjent at det har fått sitt eget navn i nettmiljøer, “strawberry-problemet”, og folk bruker det gjerne når de vil avsløre svakheter i KI-chatboter.
Det virker underlig at en modell som kan forklare kvantefysikk eller skrive et dikt, snubler på noe et barn klarer. Årsaken er ikke at modellen er “dum”. Den leser bare tekst på en annen måte enn deg, og derfor “teller” den også på en helt annen måte enn du gjør når du ser på ordet bokstav for bokstav.
Men fenomenet er mer enn et morsomt internett-triks. Det sier noe grunnleggende om hvordan modellene fungerer under overflaten, og det er nyttig å forstå hvis du bruker KI til noe som helst som har med tekst å gjøre.
Hvordan en KI faktisk “ser” et ord
Når du skriver en tekst til en KI-modell, blir den ikke lest bokstav for bokstav slik du selv leser. I stedet deler modellen teksten opp i biter som kalles tokens. En token er enten en del av et ord, et helt ord eller et enkelt tegn, alt etter hvor vanlig biten er i språket modellen er trent på. I OpenAIs mye brukte GPT-4-tokenisering blir for eksempel ordet “strawberry” delt i tre biter, “str”, “aw” og “berry”, og ikke i ti enkeltbokstaver.
Hver token blir så gjort om til et tall, en unik ID-kode, før den sendes videre inn i selve modellen. Internt jobber modellen altså med rekker av tall og ikke med bokstaver på et ark. Tallet for “str” forteller modellen noe om betydningen og sammenhengen biten inngår i. Men det sier ingenting direkte om at biten består av bokstavene s-t-r i akkurat den rekkefølgen.
De tre bokstavene “r” i “strawberry” er derfor spredt over ulike tokens. Én ligger i “str”, mens to ligger låst sammen i “berry”, og den biten bryter ikke modellen automatisk ned til enkelttegn igjen. Det forklarer hvorfor svaret “to” er en så vanlig feil.
Begge R-ene i “berry” ligger låst sammen inni samme token, modellen ser dem ikke som to separate bokstaver den kan telle.
Dette er hovedgrunnen til at en modell som ellers virker svært flink, synes det er så vanskelig å telle bestemte bokstaver. For å klare oppgaven må modellen se forbi sin egen måte å representere tekst på. I praksis må den etterligne en analyse bokstav for bokstav, noe den ikke gjør av seg selv.
Slik fordeler bokstavene i “strawberry” seg over de tre tokenene:
| Token | Bokstaver | Antall “r” i denne biten |
|---|---|---|
| “str” | s-t-r | 1 |
| “aw” | a-w | 0 |
| “berry” | b-e-r-r-y | 2 |
Modellen ser altså tre separate tall og ikke ti bokstaver på rad. Da er det lett å miste oversikten over at det til sammen blir tre r-er.
Hvorfor deles tekst opp sånn i utgangspunktet?
Det kan virke som en unødvendig komplikasjon, men tokenisering løser et reelt problem. Hvis modellen skulle behandle hver eneste bokstav som en egen enhet, ville selv korte tekster krevd enormt mye mer regnekraft. Det ville også blitt vanskeligere for modellen å fange opp betydningen av hele ord og fraser. Når vanlige bokstavkombinasjoner i stedet grupperes som én enhet, blir både treningen og bruken av modellen langt mer effektiv. Modellen fanger da også lettere opp mønstre i hvordan ordene brukes i sammenheng, ikke bare hvordan de staves.
Kort sagt er tokenisering laget for å forstå og skrive flytende språk raskt, og ikke for å telle enkelttegn presist. De to målene trekker i litt ulik retning, og bransjen har historisk sett prioritert det første.
Samme grunn til at KI av og til bommer på enkel matte
Den samme mekanismen forklarer et annet fenomen som mange har lagt merke til. En KI-modell kan løse avansert matematikk riktig, men samtidig bomme på enkel, “mekanisk” regning, som å gange store tall for hånd. Også tall blir nemlig tokenisert, og ofte i grupper på flere sifre i stedet for ett siffer om gangen. Dermed “ser” modellen et tall mer som ett samlet mønster enn som en rekke sifre den kan regne systematisk på, akkurat som med bokstavene i strawberry-eksempelet. Nyere modeller har delvis forbedret dette. De tokeniserer tall bedre og bruker eksterne verktøy, som en ekte kalkulator, i stedet for å stole på egen hoderegning.
Er dette fikset i nyere modeller?
Delvis. Flere AI-selskaper har justert hvordan tall og enkelte ord tokeniseres, for å redusere denne typen feil. Nyere reasoning-modeller er dessuten ofte flinkere til å “tenke seg om”. De bryter ordet ned bokstav for bokstav før de svarer, i stedet for å svare direkte ut fra en rask gjetning. Mange chatboter lar også modellen bruke et eksternt verktøy, for eksempel ved å skrive og kjøre litt kode. Da kan den telle presist i stedet for å stole på sin egen indre representasjon. Problemet er altså ikke borte, men det blir stadig lettere å komme rundt, så lenge modellen faktisk bruker riktig strategi.
Vanlige spørsmål
Hvorfor bruker ikke KI-modeller bare bokstaver direkte, i stedet for tokens?
Fordi selv korte tekster da ville krevd langt mer regnekraft, og fordi det ville blitt vanskeligere for modellen å fange opp betydningen av hele ord og fraser. Tokenisering er et kompromiss som prioriterer flytende språkforståelse foran presis telling bokstav for bokstav.
Har dette noe med hallusinasjon å gjøre?
Ikke direkte, men utenfra kan de to fenomenene minne om hverandre. Hallusinasjon betyr at modellen gjetter selvsikkert når den er usikker på fakta. Problemet med bokstavtelling er mer mekanisk, for det handler om hvordan teksten er representert inne i modellen, uansett om modellen er “sikker” eller ikke. Begge kan gi feil svar som overrasker et menneske, men grunnene er forskjellige.
Sliter KI med matte av samme grunn som med bokstaver?
Delvis ja. Også tall blir ofte tokenisert i grupper på flere sifre i stedet for ett og ett. Det kan gjøre presis, mekanisk regning vanskeligere for modellen enn det den egentlig er bygget for, nemlig å kjenne igjen mønstre i språk.
Er dette et problem hos alle KI-chatboter?
Hvor stort problemet er, varierer mellom modellene og med hvordan de tokeniserer tekst. Det har også blitt gradvis bedre, både fordi tokeniseringen er justert og fordi modellene bruker eksterne verktøy. Men selve mekanismen gjelder de aller fleste store språkmodeller i dag, ikke bare én bestemt modell. De deler alle tekst opp i tokens i stedet for enkeltbokstaver.
Oppsummering og kilder
Det viktigste å huske:
- KI-modeller deler tekst opp i “tokens” (ordbiter), ikke enkeltbokstaver
- Dette gjør språkbehandling effektiv, men gjør bokstavtelling og presis regning vanskeligere
- “Strawberry-problemet” er et kjent, konkret eksempel på dette fenomenet
- Nyere modeller kan delvis omgå problemet ved å bruke eksterne verktøy eller resonnere seg gjennom oppgaven steg for steg
Kilder brukt i denne artikkelen:
- The Argument: Why AI can solve hard math problems but can’t count
- uintent: Why AI Sometimes Can’t Count to 3, And What That Has to Do With Tokens
- Arbisoft: Why LLMs Can’t Count the R’s in ‘Strawberry’ & What It Teaches Us
- 16x Prompt: Why ChatGPT Can’t Count How Many Rs in Strawberry (viser faktisk GPT-4-tokenisering: str/aw/berry)
Sist oppdatert: August 2026
Les også

Hvem forsker egentlig på KI? Laboratoriene bak OpenAI, DeepMind og Anthropic forklart
Hver gang en ny AI-modell lanseres, er det gjerne ett av tre-fire navn bak. Men det finnes langt flere aktører enn det, med helt ulike mål, eierstruktur og finansiering, fra amerikanske Big Tech-laboratorier til kinesiske selskaper som gir bort modellene sine gratis, til et norsk forskningskonsortium du kanskje aldri har hørt om.

Hvorfor blir AI-modeller stadig større, og hvorfor stopper det ikke der?
GPT-1 hadde 117 millioner parametere. GPT-3 hadde 175 milliarder, altså nesten 1500 ganger så mange. Hvorfor blir AI-modeller stadig større, hvem bestemmer hvor grensen går, og har utviklingen faktisk begynt å endre retning i 2026?

Sykofanti: Hvorfor er KI-chatboter så enige med deg, og hvorfor er det et problem?
I 2025 måtte OpenAI rulle tilbake en ChatGPT-oppdatering fordi den ble påfallende smigrende, selv i alvorlige situasjoner. Forskning viser at vi stoler mer på smigrende KI-svar, selv når de er feil. Her er hvorfor chatboter har en innebygd tendens til å være enige med deg, og hvorfor det er farligere enn det høres ut.