← Oversigt

Modul 9, Lektion 1: Fra tekst til medier

Åbn i Teachable-admin ↗

Produktionstrin

TrinStatusDetaljerOpdateret
Intake done 2026-08-09 22:16:01
Intro-speak done 2026-08-09 22:16:02
HeyGen-video failed Mangler API-credits i HeyGen-kontoen. Skabelon med name card (X=315, Y=175) + speed 1,2 skal oprettes af Claus. 2026-08-09 22:16:02
Gamma-PDF done Gamma-PDF genereret (85 credits), gamma.app/docs/n0ywahms9dy8kv4 2026-08-09 22:16:02
Banner pending 2026-08-09 22:16:01
NotebookLM pending 2026-08-09 22:16:01
Resumé done 2026-08-09 22:16:02
Teachable pending 2026-08-09 22:16:01
Afsluttet pending 2026-08-09 22:16:01

Materialer

TypeFilStørrelseRegistreret
gamma_pdf AI-Uddannelsen - Modul 9 - Lektion 1.pdf 1.8 MB 2026-08-09 22:16:03

Lektionstekst (opdateret 2026-08-09 22:16:01)

# Modul 9: Medier
## Lektion 1: Fra tekst til medier

Velkommen til den første lektion i Modul 9. I Modul 7 byggede du AI-automatiseringer i Make, blandt andet den automatiserede indbakke hos Acme A/S, og i Modul 8 byggede du AI-agenter, der selv lægger en plan og vælger deres værktøjer undervejs. Fælles for alt det, du har bygget siden Modul 5, er råstoffet: tekst. Prompterne var tekst, chatbottens svar var tekst, og agenternes planer var tekst.

Tænk nu over, hvordan dine kunder møder din virksomhed. De læser sjældent rå tekst. De ser billeder på hjemmesiden og film på sociale medier, de hører musik under filmene, og de lytter til stemmer i telefonen og i podcasten. Din virksomhed har med andre ord fået en skribent, der aldrig sover, men den mangler stadig fotografen, filmholdet, komponisten og speakeren.

Lektionen her handler om springet fra tekst til medier: om det, der sker, når kunstig intelligens ikke længere kun skriver det næste ord, men skaber billeder, video, musik og tale. Lektionen tegner landkortet over de generative medier, før modulet går i dybden med hver enkelt medietype.

Vi gennemgår seks emner. For det første gennemgår jeg princippet, der er fælles for alle generative modeller: De har set enorme mængder eksempler og gætter det næste stykke af noget, hvad enten stykket er et ord, en klump pixels eller en bid lyd. For det andet gennemgår jeg de fire medietyper og deres modenhed, for billeder, video, musik og tale er ikke lige langt fremme. For det tredje viser jeg, hvor tekst og billede mødes, og hvorfor embeddings fra Modul 3, Lektion 2 er broen mellem dine ord og det færdige billede. For det fjerde lægger jeg landkortet over udbyderne, fra mediefunktionerne i de abonnementer, du allerede har, til specialisterne, der kun laver en ting. For det femtegennemgår jeg, hvad medierne betyder for din virksomheds produktion af indhold, og hvor grænsen for teknologien går. Og for det sjette introducerer jeg modulets gennemgående case, produktlanceringen hos Acme A/S, og viser, hvordan kampagnen vokser gennem modulet.

Når du er færdig med lektionen, kan du forklare, hvad der er fælles for alle generative mediemodeller, og hvor de adskiller sig fra sprogmodellen. Du kender de fire medietypers modenhed og de vigtigste udbydere i hver kategori. Og du kan pege på de opgaver i din egen virksomheds medieproduktion, hvor generative medier kan gøre en forskel.

### Fra ord til sanser

I Modul 3 skilte vi sprogmodellen ad og fulgte, hvordan den beregner det mest sandsynlige næste ord ud fra alt det foregående. Spørgsmålet, der åbner modulet her, er derfor enkelt: Hvad sker der, når det næste ikke er et ord, men en klump pixels eller en bid lyd?

Svaret er, at grundidéen holder, mens råstoffet skifter. Fællesbetegnelsen er generativ AI: modeller, der skaber nyt indhold ud fra mønstre i deres træningsdata. Sprogmodellen har set enorme mængder tekst og gætter det næste ord. Billedmodellen har set enorme mængder billeder og gætter, hvordan pixels hænger sammen, når motivet er en kaffekop, et ansigt eller en cykellygte. Musikmodellen har hørt enorme mængder lyd og gætter, hvordan det næste stykke af et nummer lyder. Ingen af dem slår op i et arkiv og henter et færdigt billede eller en færdig melodi frem; de skaber indholdet forfra, gæt for gæt, ligesom sprogmodellen skriver sine svar ord for ord.

Parallellen er mere end et pædagogisk billede. Billedgenereringen i ChatGPT er bygget efter sprogmodellens princip og bygger billedet op stykke for stykke, som sprogmodellen bygger en sætning op ord for ord (OpenAI, 2025). Andre billedmodeller arbejder anderledes i maskinrummet, og forskellen gennemgår jeg i Lektion 2. Fælles for dem alle er, at de har lært mønstre af millioner af eksempler, og at de bruger mønstrene til at skabe noget, der ikke fandtes før.

En ting skal du holde fast i fra starten: Mediemodellerne ved ikke, hvad de laver. De beregner, hvad der ligner det, de har set. Et billede kan derfor se rigtigt ud og alligevel være beregnet forkert, med en skygge, der falder til den forkerte side, eller en hånd med seks fingre. Blikket for beregnede fejl får du brug for gennem hele modulet, når du kvalitetssikrer det, modellerne leverer.

Promptdisciplinen fra Modul 5 følger til gengæld med over i medierne: Du bestiller et billede, en film og en jingle med ord, og kvaliteten af ordene afgør kvaliteten af resultatet.

### De fire medietyper og deres modenhed

Skal din virksomhed så i gang med alle fire medietyper på en gang? Nej. De fire er ikke lige modne, og modenheden afgør, hvad det giver mening at begynde med.

Billederne er længst fremme. Billedgenereringen ligger allerede i de assistenter, mange virksomheder betaler for, og billedet er derfor typisk det første AI-medie, en virksomhed tager i brug: illustrationer til nyhedsbrevet, opslag til sociale medier og produktbilleder til webshoppen.

Video udvikler sig hurtigt netop nu. De tidlige AI-klip var mest kendt for deres fejl; i dag genererer Googles videomodel Veo lyden sammen med billedet, så et klip kommer med lyd frem for som stumfilm (Google DeepMind, n.d.).

Musikken følger godt med. Hos musikværktøjet Suno bliver en stilbeskrivelse og en sangtekst til et helt nummer med vokal (Suno, n.d.), og numrene lyder ofte som producerede indspilninger frem for som computerlyd.

Og talen? En genereret stemme er i korte klip ofte svær at skelne fra en menneskestemme. Taleværktøjet ElevenLabs leverer talesyntese, stemmekloning og eftersynkronisering til andre sprog (ElevenLabs, n.d.), og netop kloningen viser, hvor langt feltet er nået: En kort optagelse kan i dag være nok til en genkendelig kopi af en stemme.

Modenheden bestemmer rækkefølgen i modulet: billederne først, video oven på billederne og til sidst lydens to former, musik og tale.

### Det fælles betydningsrum

Der er et spørgsmål, som hele modulet hviler på: Hvordan kan en billedmodel, der arbejder med pixels, overhovedet bruge en sætning på dansk? Du skriver ord ind, og der kommer et billede ud. Et eller andet sted må sprog og billede mødes.

Mødestedet gennemgik vi i Modul 3, Lektion 2: embeddings. En embedding omsætter et ord til en lang række tal, et punkt i et betydningsrum, hvor ord med beslægtet betydning ligger tæt på hinanden. Ordet konge ligger tæt på ordet dronning, og ordet cykel ligger tæt på ordet cykelhjelm.

Du kender forbindelsen fra dig selv. Hører du ordene "solnedgang over Vesterhavet", dukker billedet op for dit indre blik, uden at nogen viser dig et fotografi. Ord og billeder hænger sammen i din forståelse, og embeddings er maskinens udgave af forbindelsen. Gennembruddet for medierne kom, da tekst og billeder flyttede ind i samme rum. I 2021 fremlagde forskere fra OpenAI modellen CLIP. De trænede den på 400 millioner billede-tekst-par fra internettet, billeder sammen med de tekster, der hører til dem, og lærte den at placere et billede og en beskrivelse af billedet tæt på hinanden i samme rum (Radford et al., 2021). Efter træningen ligger fotografiet af en hund og sætningen et foto af en hund som naboer i rummet.

Følg nu, hvad der sker, når du bestiller kampagnens første billede med sætningen en rød cykellygte på et morgenvådt fortov. Billedmodellen omsætter ordene til et punkt i betydningsrummet. "Cykellygte" placerer punktet blandt alle de lygter, billedmodellen har set under træningen. "Rød" trækker punktet mod de røde af dem. Og "morgenvådt fortov" trækker det derhen, hvor våde fliser spejler lavt morgenlys. Billedet dannes derefter ud fra punktet, og derfor rammer det genstanden, farven og stemningen i din bestilling.

Koblingen mellem sprog og medie er nøglen til, at du kan bestille et billede med en sætning. Og den forklarer, hvorfor ordvalget betyder så meget: To forskellige beskrivelser er to forskellige punkter i rummet, og to forskellige punkter bliver til to forskellige billeder. Prompten er ikke pynt uden på billedmodellen; den er de koordinater, billedmodellen arbejder ud fra.

### Landkortet over udbyderne

Hvor skal du hen, når kampagnen skal i gang? Mediefunktionerne bor to steder, og modulet bruger begge.

Det første sted er de assistenter, du allerede betaler for: ChatGPT, Gemini og Copilot. De har alle billedgenerering indbygget, og hos flere af dem følger video og tale med i abonnementet. Billedgenereringen i ChatGPT er for eksempel god til at følge lange instruktioner og til at gengive læselig tekst i billedet (OpenAI, 2025). Styrken ved det indbyggede er samtalen: Du beder om et billede i almindeligt sprog, ser resultatet og beder om ændringer, og assistenten husker konteksten undervejs. Til hverdagsbrug rækker det indbyggede ofte.

Det andet sted er specialisterne, der har bygget hele deres værktøj omkring en enkelt medietype: Midjourney til billeder, Runway til video, Suno til musik og ElevenLabs til tale. Specialisterne kræver mere af dig, typisk et abonnement mere og en brugerflade med flere håndtag, og de giver mere tilbage i kontrol og kvalitet, når opgaven stiller krav.

Hvornår rækker det indbyggede så, og hvornår er specialisten pengene værd? Svaret afhænger af opgaven, og modulet giver dig det blok for blok: I både billedblokken og videoblokken kører vi den samme opgave gennem flere værktøjer og sammenligner resultaterne, før kampagnen vælger sit værktøj.

### Hvad det betyder for din medieproduktion

Tænk på, hvad Acmes kampagne ville have krævet for få år siden. Produktbillederne krævede en fotograf, et studie og en lysopsætning, og lanceringsfilmen krævede et filmhold og en klipper. Jinglen krævede en komponist og et lydstudie, og speaken krævede en speaker og en tekniker. Hver leverance havde sin egen leverandør, sin egen kalender og sin egen faktura.

Opgaver af den type kan du nu ofte løse ved skrivebordet på minutter. Det gælder ikke alle opgaver, og kvaliteten rækker ikke altid til formålet; grænserne gennemgår jeg blok for blok. Men regnestykket skifter karakter: Hvor udgiften før gik til eksterne leverandører, går den nu typisk til abonnementer og til dine egne arbejdstimer. Og fordi et udkast typisk koster minutter frem for en produktionsdag, kan du afprøve ti retninger og vælge den bedste i stedet for at satse alt på en enkelt retning på forhånd.

Grænsen hører med i regnestykket. AI-medierne erstatter ikke den kreative beslutning om, hvad kampagnen skal sige, til hvem og hvorfor. Billedmodellen kan levere 40 bud på et kampagnebillede; den kan ikke beslutte, at kampagnens historie skal være tryghed i morgentrafikken frem for tekniske specifikationer. Beslutningen om budskabet, udvælgelsen blandt forslagene og ansvaret for det, du sender ud, bliver hos dig. Mediemodellerne overtager dele af det håndværk, der udfører beslutningen; de overtager ikke dømmekraften.

### Casen: en cykellygte skal på markedet

Gennem de næste 14 lektioner arbejder du med en gennemgående opgave, og den er konkret. Acme A/S skal lancere et nyt produkt. Virksomheden kender du fra den automatiserede indbakke i Modul 7; nu ligger der en ny cykellygte på bordet i marketingafdelingen, en lygte til pendlere, der cykler året rundt. Lanceringen skal ramme efteråret, hvor mørket falder tidligt, og hvor en lygte afgør, om cyklisten bliver set.

Marketingafdelingen har skrevet listen over det materiale, kampagnen skal bruge, og listen er samtidig din vej gennem modulet. Kampagnen skal bruge en billedpakke med produktfotos og kampagnebilleder til webshoppen, nyhedsbrevet og de sociale medier; billedpakken producerer du i billedblokken, lektionerne 2 til 5. Kampagnen skal også bruge en lanceringsfilm på omkring 30 sekunder; filmen bygger du i videoblokken, lektionerne 6 til 8, fra manuskript over storyboard til færdige scener. Jinglen og baggrundsmusikken skriver du i musikblokken, lektionerne 9 og 10, og speaken og den oplæste produkttekst producerer du i taleblokken, lektionerne 11 og 12.

Derefter samler de sidste tre lektioner trådene. I Lektion 13 mødes video og tale i en avatarpræsentation, hvor et digitalt menneske præsenterer lygten på hjemmesiden og til salgsmøderne. I Lektion 14 tager jeg fat i de juridiske og etiske spørgsmål, AI-medierne rejser, fra rettigheder over mærkning til brugen af virkelige menneskers stemmer og ansigter, inden kampagnen går i luften. Og i Lektion 15 sætter vi alle delene sammen til den færdige kampagne og kobler medieproduktionen på automatiseringerne fra Modul 7 og 8, så den kan gå fra engangsforestilling til rutine.

Rækkefølgen af blokkene er ikke tilfældig. Billederne kommer først, fordi billedmodellerne er de mest modne, og fordi de er fundamentet under videomodellerne. Video bygger oven på billederne og tilføjer tiden som dimension. Musik og tale er lydens to former, og de lukker de fire blokke. Hver blok begynder i maskinrummet, hvor jeg viser, hvordan medietypen bliver til, og slutter i praksis, hvor kampagnen får sin næste leverance.

### Landkortet er tegnet

Du står nu med overblikket: princippet om at gætte det næste stykke, de fire medietypers modenhed, udbyderlandkortet med assistenter og specialister og betydningsrummet, der forbinder dine ord med det færdige medie. Hos Acme venter en kampagne på sin første leverance, og den første leverance er billedpakken.

Billedpakken begynder i maskinrummet. I Lektion 2 skiller vi billedmodellen ad, ligesom vi i Modul 3 skilte sprogmodellen ad. Hovedpersonen er diffusionsmodellen (på engelsk: diffusion model), som lærer at skabe billeder på en måde, der lyder bagvendt: Den lærer først at ødelægge dem. Hvordan et fotografi kan træde frem af ren støj, styret af din prompt, er emnet for næste lektion.

### Referencer

ElevenLabs. (n.d.). ElevenLabs. https://elevenlabs.io/

Google DeepMind. (n.d.). Veo. Google DeepMind. https://deepmind.google/models/veo/

OpenAI. (2025). Introducing 4o image generation. OpenAI. https://openai.com/index/introducing-4o-image-generation/

Radford, A., Kim, J. W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., Krueger, G., & Sutskever, I. (2021). Learning transferable visual models from natural language supervision. arXiv. https://arxiv.org/abs/2103.00020

Suno. (n.d.). Suno. https://suno.com/

Intro-speak (90 sek.) (opdateret 2026-08-09 22:16:01)

Velkommen til Modul 9. Indtil nu har alt det, du har bygget på AI-Uddannelsen, haft det samme råstof: tekst. Prompterne var tekst, chatbottens svar var tekst, og dine agenters planer var tekst. Men tænk over, hvordan dine kunder møder din virksomhed. De læser sjældent rå tekst. De ser billeder på hjemmesiden og film på sociale medier, de hører musik under filmene, og de lytter til stemmer i telefonen og i podcasten. Din virksomhed har fået en skribent, der aldrig sover, men den mangler stadig fotografen, filmholdet, komponisten og speakeren. I lektionen her tegner jeg landkortet over de generative medier. Jeg gennemgår princippet, der er fælles for alle generative modeller: De har set enorme mængder eksempler, og de gætter det næste stykke, hvad enten stykket er et ord, en klump pixels eller en bid lyd. Jeg gennemgår de fire medietyper, billeder, video, musik og tale, og deres modenhed, for de er ikke lige langt fremme. Jeg viser dig, hvor dine ord og det færdige billede mødes, og jeg lægger landkortet over udbyderne, fra assistenterne, du allerede betaler for, til specialisterne, der kun laver en ting. Til sidst introducerer jeg modulets gennemgående case: Acme A/S skal lancere en ny cykellygte, og du producerer kampagnens materiale gennem hele modulet. Vi begynder med billederne. God fornøjelse med lektionen.

Lesson Summary (opdateret 2026-08-09 22:16:01)

# Lesson Summary

**Modul 9, Lektion 1: Fra tekst til medier – landkortet over de generative medier**

I denne lektion lærer du, hvad der sker, når kunstig intelligens ikke længere kun skriver det næste ord, men skaber billeder, video, musik og tale. Lektionen tegner landkortet over de generative medier, før modulet går i dybden med hver enkelt medietype.

**Kernen i princippet:**

- Alle generative modeller bygger på det samme princip: De har set enorme mængder eksempler og gætter det næste stykke, hvad enten stykket er et ord, en klump pixels eller en bid lyd.
- Mediemodellerne ved ikke, hvad de laver; de beregner, hvad der ligner det, de har set. Et billede kan se rigtigt ud og alligevel være beregnet forkert.
- Promptdisciplinen fra Modul 5 følger med over i medierne: Kvaliteten af dine ord afgør kvaliteten af resultatet.

**De fire medietyper og deres modenhed:**

- Billeder er længst fremme og ligger allerede i de assistenter, mange virksomheder betaler for.
- Video udvikler sig hurtigt; Googles videomodel Veo genererer i dag lyden sammen med billedet.
- Musik følger godt med; hos Suno bliver en stilbeskrivelse og en sangtekst til et helt nummer med vokal.
- Tale er i korte klip ofte svær at skelne fra en menneskestemme; ElevenLabs leverer talesyntese, stemmekloning og eftersynkronisering.

**Det fælles betydningsrum:**

- Embeddings omsætter ord til punkter i et betydningsrum, hvor beslægtede betydninger ligger tæt på hinanden.
- OpenAI's model CLIP (2021) blev trænet på 400 millioner billede-tekst-par, så billeder og deres beskrivelser ligger i samme rum.
- Prompten er de koordinater, billedmodellen arbejder ud fra: To forskellige beskrivelser er to forskellige punkter og bliver til to forskellige billeder.

**Landkortet over udbyderne:**

- Mediefunktionerne bor to steder: i de assistenter, du allerede betaler for (ChatGPT, Gemini og Copilot), og hos specialisterne (Midjourney til billeder, Runway til video, Suno til musik og ElevenLabs til tale).
- Det indbyggede rækker ofte til hverdagsbrug; specialisterne giver mere kontrol og kvalitet, når opgaven stiller krav.

**Hvad det betyder for din medieproduktion:**

- Opgaver, der før krævede fotograf, filmhold, komponist og speaker, kan du nu ofte løse ved skrivebordet på minutter.
- Fordi et udkast koster minutter frem for en produktionsdag, kan du afprøve ti retninger og vælge den bedste.
- AI-medierne erstatter ikke dømmekraften: Beslutningen om budskabet, udvælgelsen blandt forslagene og ansvaret for det, du sender ud, bliver hos dig.

**Modulets gennemgående case:**

- Acme A/S skal lancere en ny cykellygte til pendlere, og kampagnens materialeliste er din vej gennem modulet: billedpakke (lektionerne 2 til 5), lanceringsfilm (lektionerne 6 til 8), jingle og baggrundsmusik (lektionerne 9 og 10) samt speak og oplæst produkttekst (lektionerne 11 og 12).
- De sidste tre lektioner samler trådene: avatarpræsentation, juridiske og etiske spørgsmål og den færdige kampagne koblet på automatiseringerne fra Modul 7 og 8.

Log