AI woordenboek

Wat is text to video?

Text to video is generatieve AI die op basis van een tekstuele beschrijving een compleet nieuwe video maakt.

Denk aan beweging, personages en decor, en soms zelfs geluid, allemaal automatisch gegenereerd op basis van jouw tekst, in slechts enkele minuten tijd.

Hoe werkt text-to-video?

Text to video werkt in de kern zoals text to image, maar dan met een extra uitdaging: het model moet niet één enkel beeld maken, maar een hele reeks beelden die logisch op elkaar aansluiten. Een personage moet er in elk frame hetzelfde uitzien, en bewegingen moeten er natuurlijk uitzien. Dat maakt video’s technisch een stuk lastiger te genereren dan losse afbeeldingen, en het kost ook aanzienlijk meer rekenkracht.

Een bekend voorbeeld

Sora, ontwikkeld door OpenAI, is een van de bekendste text-to-video tools. Gebruikers kunnen er met een simpele tekstbeschrijving korte, realistisch ogende video’s mee maken.

Waar gebruik je het voor?

Ondernemers en creators gebruiken text-to-video vooral voor social media-content, korte productdemo’s, en snelle visuele concepten voordat er een duurdere, echte opname wordt gemaakt. Het scheelt aanzienlijk in tijd en budget ten opzichte van traditionele videoproductie, al is de kwaliteit nog niet voor elke toepassing geschikt.

Nog niet perfect

Ondanks de snelle vooruitgang maken text-to-video-modellen nog regelmatig fouten. Denk aan vingers die er vreemd uitzien, objecten die plotseling van vorm veranderen, of bewegingen die niet helemaal logisch zijn. Ook zijn gegenereerde video’s vaak nog relatief kort, van een paar seconden tot hooguit een minuut. Dit verbetert wel met elke nieuwe versie van de technologie.

Grote impact, grote risico’s

Doordat text to video steeds realistischer wordt, is dit precies het soort content waar de EU-regels voor deepfakes op gericht zijn. Maak je een video die op een echt persoon, plek of gebeurtenis lijkt, dan moet je duidelijk aangeven dat die door AI is gemaakt of bewerkt, ook als je geen kwade bedoelingen had.