Slik fungerer AI-bildegenerering, forklart uten fagspråk
Sist faktasjekket:

Kort oppsummert
En KI som lager bilder, starter ikke med et blankt lerret, men med ren, tilfeldig støy. Den fjerner støyen steg for steg, til det står igjen et bilde som passer beskrivelsen din. Teknikken kalles en diffusjonsmodell, og modellen lærte den ved å gjøre det motsatte under treningen: Den ødela ekte bilder med støy og lærte å reversere prosessen.
Det korte svaret: fra støy til bilde
Tenk deg et gammelt TV-apparat uten signal, der skjermen bare viser grå “snø”. Tenk deg så at noen langsomt justerer støyen over noen titalls små steg, slik at et gjenkjennelig motiv gradvis dukker opp. Det ligner litt på et bilde som fremkalles i et mørkerom. I grove trekk er det dette en diffusjonsmodell gjør når den lager et bilde fra teksten din.
Prosessen har to hovedaktører:
- Teksten din (prompten) er kompasset. Modellen har lært å knytte ord til visuelle mønstre, så når du skriver “En rødhåret hund på en strand i solnedgang”, styrer det hvilken retning støyen skal renskes i for hvert steg.
- Selve rensingen skjer i mange små runder, ofte 20 til 50 steg. I hvert steg gjetter modellen bort litt av støyen og sammenligner resultatet med det teksten beskriver. Deretter tar den et nytt og litt bedre steg, og etter det siste steget sitter du igjen med et ferdig bilde.
Modellen “husker” altså ikke et bestemt bilde fra treningen og limer det inn. Den har lært et generelt mønster for hvordan støy henger sammen med motiver, og bruker det til å bygge noe helt nytt hver gang. Derfor er resultatet ikke en kopi av noe den har “sett” før.
Hvordan lærte modellen dette i utgangspunktet?
Det høres kanskje bakvendt ut, men modellen lærte å lage bilder ved å bli trent på å ødelegge dem.

Under treningen tar utviklerne millioner av ekte fotografier og illustrasjoner og legger støy over dem, litt etter litt, helt til bildet bare er snø. Så trenes modellen på å gjette akkurat hvor mye støy som ble lagt til i hvert lille steg. Når den har gjort dette presist nok millioner av ganger, på millioner av ulike bilder, har den lært det generelle mønsteret. Den vet da hvordan prosessen kan reverseres, fra støy tilbake til et sammenhengende bilde. Slik forklarer IBM det i sin tekniske gjennomgang av diffusjonsmodeller.
Når modellen først kan dette, snur man prosessen når den skal brukes. Da starter den med bare støy, uten noe ekte bilde i bunnen. Så bruker den det lærte mønsteret til å bygge et helt nytt bilde fra grunnen av, styrt av teksten din.
Teksten kobles inn gjennom en egen språkmodell, som er trent til å forstå hva ord som “akvarell”, “close-up” eller “cyberpunk” betyr visuelt. Jo bedre denne koblingen mellom tekst og bilde er trent, desto bedre forstår bildegeneratorene stilbeskrivelser, komposisjon og spesifikke detaljer i prompten din.
Hvorfor akkurat denne metoden, og ikke noe enklere?
Før diffusjonsmodellene ble vanlige, brukte de fleste bildegeneratorer en annen teknikk, som kalles generative motstandsnettverk (GAN). Der “konkurrerte” to modeller mot hverandre. Den ene prøvde å lage falske bilder, og den andre prøvde å avsløre dem. GAN-er kunne lage overbevisende bilder raskt, men de slet med mangfold og stabilitet, og ved kompliserte motiver ble resultatene ofte ensartede eller forvrengte.
Diffusjonsmodellene viste seg å være mer stabile å trene, og de ga et bredere spekter av resultater, ifølge en grundig teknisk gjennomgang fra AI Summer. Ulempen er hastigheten. Fordi bildet bygges opp i mange små steg i stedet for ett, tar det som regel lenger tid å lage et bilde med en diffusjonsmodell enn med en GAN. Nyere versjoner har blitt betydelig raskere fordi de trenger færre steg, men den grunnleggende “steg for steg”-ideen er fortsatt kjernen i teknologien.
| GAN | Diffusjonsmodell | |
|---|---|---|
| Metode | To modeller konkurrerer: én lager, én avslører falske bilder | Fjerner støy steg for steg over mange runder |
| Stabilitet i trening | Kan slite med mangfold og stabilitet | Mer stabil å trene |
| Hastighet | Raskere å generere | Historisk tregere, men nyere versjoner har redusert stegene kraftig |

Blant de mest kjente verktøyene som bruker teknikken i dag, er OpenAIs GPT Image, Midjourney, Googles Imagen og Stable Diffusion. Stable Diffusion er en modell med åpen kildekode som mange andre verktøy bygger videre på. Alle bruker det samme grunnprinsippet, men de skiller seg i hvordan de er trent og hvilke data de har lært av.
Vanlige spørsmål
Kopierer AI-en et ekte bilde når den lager et nytt?
Nei, ikke i vanlig forstand. Modellen lagrer ikke enkeltbilder fra treningsdataene og limer dem sammen. I stedet har den lært et statistisk mønster for hvordan motiver henger sammen med beskrivelser, og ut fra det mønsteret bygger den et nytt bilde fra ren støy. Likevel er det omstridt hvor grensen går mellom “å lære et mønster” og “å gjenbruke opphavsrettsbeskyttet materiale”. AIFokus har en egen, grundigere artikkel om treningsdata og opphavsrett. Du finner den under Se også nederst.
Hvorfor bommer AI-bilder fortsatt på ting som hender og tekst?
Hender kan stå i svært mange ulike stillinger, og derfor er de vanskelige å fange likt i treningsdataene. Tekst i bilder krever i tillegg at modellen forstår bokstaver som eksakte symboler, og det har diffusjonsprosessen historisk vært svak på. Nyere modeller har blitt merkbart bedre på begge deler. Men feilene kommer fra den samme grunnleggende mekanikken, ikke fra en enkeltstående “bug”.
Er diffusjonsmodeller det samme som ChatGPT-teknologi?
Nei. ChatGPT og lignende tekstmodeller bygger på en annen arkitektur. De er såkalte transformer-modeller, som forutsier neste ord i en tekst. Diffusjonsmodeller er bygget for å forutsi og fjerne støy i bilder, og etter hvert også i video og lyd. Noen nyere systemer kombinerer begge teknikkene i samme produkt, men de løser to ulike grunnleggende problemer.
Oppsummering og kilder
Det viktigste å huske:
- Bildegenerering starter med ren støy, ikke et blankt lerret, og bygges opp i mange små steg
- Modellen er trent ved å lære å reversere en prosess der ekte bilder gradvis ble ødelagt med støy
- Teksten din styrer hvilken retning støyen “renskes” i, gjennom en egen tekst-til-bilde-kobling
- Diffusjonsmodeller har i stor grad erstattet den eldre teknikken GAN, fordi de gir mer stabile og varierte resultater
- Stable Diffusion, GPT Image og Midjourney bruker alle samme grunnprinsipp, med ulike treningsdata og finjusteringer
Kilder brukt i denne artikkelen:
- IBM: What are diffusion models?
- AI Summer: How diffusion models work, the math from scratch
- Scale AI: Diffusion Models, A Practical Guide
- SuperAnnotate: Introduction to Diffusion Models for Machine Learning
Sist oppdatert: August 2026
Se også: Hva er generativ AI? Slik fungerer modellene for det bredere bildet, Hva er treningsdata, og hvorfor er det omstridt hvor KI-modeller henter den fra? for opphavsrettspørsmålet rundt hva modeller faktisk har lært av, og Klarer du fortsatt å se forskjell på ekte bilder og AI-bilder? Dette sier forskningen for hvorfor bildene denne teknologien lager blir stadig vanskeligere å avsløre.
Les også

AI-agenter som jobber for deg mens du sover: Hva er faktisk mulig for en liten bedrift i dag?
Ideen om at AI kan jobbe for bedriften mens du sover høres ut som markedsføring. Noe av det er det også. Men noe av det er faktisk mulig i dag, for en liten bedrift, uten et eget teknisk team. Her er hva som faktisk skjer om natten, og hva som fortsatt bare er en visjon.

Claude Code for ikke-utviklere: Hva kan en bedriftseier faktisk bruke det til?
Claude Code ble laget for utviklere, i en terminal fylt med kommandoer. Men ideen bak, en KI som faktisk gjør en oppgave i stedet for bare å beskrive den, er nå på vei ut av utviklerverktøyet og inn i verktøy vanlige bedriftseiere kan bruke. Her er hva det faktisk kan hjelpe deg med.

Hva er en AI-arbeidsflyt, og hvordan begynner du i det små?
Ordet "AI-arbeidsflyt" dukker stadig oftere opp, uten at noen tar seg tid til å forklare hva det egentlig betyr. Her er begrepet forklart fra bunnen av og et konkret, lite eksempel du kan sette opp selv på under en time.