IndustryModellen en inzichten12 min lezen

Realtime AI-video en wereldmodellen uitgelegd voor makers

Wat realtime AI-video en wereldmodellen werkelijk betekenen, hoe interactieve videogeneratie verschilt van tekst naar video in batch, en wat er voor makers verandert.

OmniArt-team
Realtime AI-video en wereldmodellen uitgelegd voor makers

Realtime AI-video is op dit moment het meest besproken front in generatieve media, en tegelijk het slechtst gedefinieerde. Afhankelijk van wie er praat betekent het een model dat sneller rendert dan het afspeelt, een model dat je met een toetsenbord bijstuurt terwijl het draait, of een model dat een hele gesimuleerde omgeving in zijn hoofd houdt. Dat zijn drie verschillende technische problemen met drie verschillende tijdlijnen, en ze onder één kop samenvegen is precies hoe makers gaan plannen rond mogelijkheden die nog niet bestaan.

Dit stuk haalt de termen uit elkaar. Wat “realtime genereren” eigenlijk beschrijft, wat een “wereldmodel” wel en niet is, wie er in deze hoek bouwt, waar de harde grenzen liggen en — het deel dat telt voor iedereen met een deadline deze maand — wat dit wel en niet verandert aan werk dat vandaag de deur uit gaat. Kort samengevat: productievideo draait nog steeds op modellen in batch, en dat blijft voorlopig zo.

Wat “realtime” in AI-video eigenlijk betekent

De modellen die de meeste makers gebruiken zijn batchmodellen. Je schrijft een briefing, je dient hem in, het model plant en rendert de hele clip als één geheel, en enkele seconden of minuten later heb je een afgerond bestand. Niets aan het resultaat wordt beslist terwijl je kijkt. De generatie is een taak.

Realtime genereren keert die lus om. In plaats van een afgeronde clip produceert het model continu frames, snel genoeg om de stroom te bekijken terwijl hij ontstaat — en, cruciaal, snel genoeg dat invoer die halverwege binnenkomt de volgende frames kan beïnvloeden. Die laatste eigenschap is wat mensen meestal bedoelen met realtime, en die heet beter interactieve videogeneratie.

Er schuilen eigenlijk drie verschillende claims onder één etiket:

ClaimWat het betekentWaarom het moeilijk is
Sneller renderen dan afspelenEen clip rendert in minder tijd dan het kost om hem te bekijkenVooral een kwestie van efficiëntie en infrastructuur
Streamend genererenFrames komen geleidelijk binnen in plaats van allemaal tegelijkVraagt om causale architecturen die frame voor frame werken
Interactief genererenJouw invoer tijdens het draaien verandert wat er daarna gebeurtVraagt dat het model een toestand bijhoudt en bijwerkt

Het eerste is een optimalisatie. Het derde is een ander soort systeem.

Wat een wereldmodel is (en niet is)

Een wereldmodel is niet simpelweg een videomodel dat langer doorloopt. Het onderscheid zit in de toestand. Een model voor tekst naar video vertaalt een prompt naar een reeks frames; de prompt is de hele instructie en de reeks is het hele antwoord. Een wereldmodel houdt een interne voorstelling van een scène bij — wat erin zit, waar de dingen staan, hoe ze zich gedragen — en genereert frames als een blik op die voorstelling, die het bijwerkt als reactie op acties.

Daarom worden wereldmodellen in één adem met game-engines genoemd en niet met videogereedschap. De vergelijking klopt niet helemaal, maar ze helpt:

EigenschapTekst naar video in batchWereldmodel
Eenheid van uitvoerEen afgeronde clipEen doorlopend gegenereerde blik
InstructieEen prompt, vooraf gegevenEen prompt plus lopende acties
Interne toestandImpliciet, weggegooid na de renderExpliciet en blijvend tijdens een sessie
Voorwaarde voor succesDe clip komt overeen met de briefingDe omgeving blijft kloppen terwijl je erdoorheen beweegt
Manier van falenVerkeerd shot, drift binnen de clipObjecten verdwijnen, geometrie spreekt zichzelf tegen, natuurkunde breekt

De interessante onderzoeksvraag is bestendigheid: als je je van een object afwendt en terugkijkt, staat het er dan nog, op dezelfde plek, met hetzelfde uiterlijk? Batchmodellen hoeven die vraag nooit te beantwoorden. Wereldmodellen slagen of zakken erop.

De opvallende deelnemers

Drie losse groepen duwen hieraan, en ze willen verschillende dingen.

De wereldmodellen van Google in de Genie-lijn

De Genie-lijn van Google DeepMind is het ijkpunt dat de meeste mensen aanhalen. De belofte is generatie van doorwandelbare omgevingen op basis van acties, vanuit een prompt of een afbeelding — je beschrijft een plek en beweegt er vervolgens doorheen, waarbij het model elke volgende blik genereert in plaats van een vooraf gerenderde af te spelen. Publieke demonstraties benadrukten interactie bij framerates die responsief aanvoelen en samenhang die een tijdje aaneengesloten verkennen volhoudt, en het kader was uitdrukkelijk onderzoeksgericht, met agenttraining en belichaamde AI als motieven die minstens zo zwaar wogen als het maken van content.

PixVerse R1

PixVerse heeft R1 neergezet als een realtime wereldmodel in plaats van als weer een release voor tekst naar video, en zet het in de markt als alternatief voor systemen in de Genie-klasse, met makers en een game-nabij publiek voor ogen. Dat kader valt op omdat het van een bedrijf in videogeneratie komt en niet van een onderzoekslab, wat suggereert dat de categorie serieus wordt genomen als product en niet alleen als paper. Behandel de details als positionering van de aanbieder totdat er onafhankelijke praktijkvergelijkingen zijn — dit is een hoek waar de kwaliteit van de aankondiging en de kwaliteit van het geleverde eerder uiteen zijn gelopen.

Het game-nabije middenveld

De derde groep levert de minst pakkende koppen en misschien wel de grootste gevolgen: werk dat generatieve modellen ín of náást conventionele engines zet. Neurale renderpasses boven op de uitvoer van een engine, gegenereerde bestanden en omgevingen die een gewone productiepijplijn voeden, generatief gedrag van NPC’s, stijloverdracht per frame. Niets daarvan is een volwaardig wereldmodel. Het komt allemaal eerder op de markt, omdat het de voorspelbaarheid en de controle van een engine erft en generatie alleen inzet waar generatie echt beter is.

Let op

Let op deze taal in aankondigingen: “realtime” zonder een beschreven interactielus betekent meestal snel renderen, niet stuurbaar genereren. “Wereldmodel” geplakt op een generator van clips met vaste lengte betekent meestal dat de marketingafdeling er eerder was dan de architectuur.

De grenzen die de tijdlijn bepalen

Vier problemen staan tussen demo’s en betrouwbaar creatief gereedschap in. Geen ervan is bijna opgelost, en vooruitgang op het ene kost je meestal het andere.

Vertraging tegenover kwaliteit. Interactiviteit legt een hard rekenbudget per frame op: wat het model kan produceren voordat het volgende frame moet vallen, is alles wat je krijgt. Batchmodellen mogen zo lang over een frame doen als ze willen. Elke eenheid kwaliteit in een interactief systeem moet binnen dat budget worden betaald, en daarom loopt interactieve uitvoer een generatie achter op uitvoer in batch — en daarom blijft dat zo, ook als beide beter worden.

Resolutie en detail. Hetzelfde budget, nu toegepast op pixels. Pijplijnen in batch kunnen zich verfijningspasses en opschaalstappen veroorloven; een systeem dat frames op aanvraag genereert kan dat doorgaans niet, in elk geval niet zonder precies de vertraging toe te voegen die het wilde vermijden.

Samenhang over tijd. Dit is de diepe. Consistentie over een lange horizon vraagt om geheugen van wat al is gegenereerd, en geheugen kost rekenkracht die concurreert met het framebudget. Objecten die wegdrijven, geometrie die zichzelf stilletjes tegenspreekt en licht dat verandert tussen twee bezoeken aan dezelfde plek zijn allemaal symptomen van dezelfde beperking. De vooruitgang hier is echt maar stapsgewijs, en het eerlijke kader is dat sessies een tijdje kloppen en daarna niet meer.

Precisie van de besturing. Interactie is alleen nuttig als het model op je invoer reageert zoals je het bedoelde. Bewegen in een richting is relatief goed te doen. Precieze, herhaalbare regie tot op het frame — wat een filmmaker of gameontwerper echt nodig heeft — is veel lastiger, en er zit een onopgeloste spanning tussen een systeem dat improviseert en een systeem dat exact doet wat het krijgt opgedragen.

Er speelt ook een economische grens die minder aandacht krijgt. Een render in batch is een afgebakende, factureerbare taak. Een interactieve sessie is een open rekenstroom, en iemand betaalt voor elke seconde ervan. Dat bepaalt hoe producten in deze categorie eruit kunnen zien, lang voordat het onderzoek af is.

Wat dit voor makers verandert — en wat niet

Wat er voorlopig niet verandert

Lever je video voor klanten, campagnes of een publiek, dan zijn realtime wereldmodellen geen onderdeel van je pijplijn, en doen alsof het anders is kost je een deadline. Kwaliteit van de afgeronde clip, resolutie, geluid, controle over het shot en trouw aan de referentieafbeelding zitten allemaal nog in batchmodellen — de generaties van Seedance, Veo, Kling, Sora, PixVerse en Grok Imagine die vandaag op OmniArt staan. Elk daarvan is geoptimaliseerd op precies datgene wat interactieve systemen inleveren: echte rekenkracht besteden om één clip zo goed mogelijk te maken.

Het is ook geen vervangingsroute. Interactief genereren en genereren in batch optimaliseren tegenovergestelde uiteinden van dezelfde afweging. Een toekomst waarin wereldmodellen uitstekend zijn, impliceert geen toekomst waarin batchmodellen achterhaald zijn — net zomin als realtime game-engines het offline renderen van film achterhaald maakten.

Wat er wel verandert

Op drie dingen loont het om je nu al in te stellen.

  • Previsualisatie wordt als eerste goedkoper. De eerste echt bruikbare toepassing van stuurbaar genereren is een ruimte of een blokkering verkennen voordat je je aan een afgeronde render vastlegt. Ruw, interactief en meteen aanpasbaar wint van gepolijst en traag zolang je nog aan het beslissen bent.
  • De prompt is niet langer de enige interface. Naarmate modellen doorlopende invoer aannemen, gaan briefings minder op alinea’s lijken en meer op regie — een begintoestand plus een reeks intenties. Makers die al in shots en beats denken in plaats van in zinnen, passen zich sneller aan.
  • Game-nabij werk gaat eerder open dan film-nabij werk. Interactieve media accepteren lagere kwaliteit in ruil voor responsiviteit, omdat het publiek meedoet in plaats van kijkt. Daar is deze techniek als eerste echt concurrerend.

De vaardigheden die meeverhuizen

Niets van wat je op de huidige modellen leert, is verspild. Een scène precies beschrijven, camera en licht vastleggen, een personage of een look over verschillende shots heen vasthouden en een herhaalbare beoordelingsgewoonte opbouwen — dezelfde briefing, dezelfde referenties, hetzelfde beoordelingsschema, losgelaten op wat er nieuw is — het verhuist allemaal rechtstreeks mee. De interface verandert; het vak om precies te zijn over wat je wilt, niet.

Waarschuwing

Wees voorzichtig met benchmarkclaims in deze categorie. Interactieve systemen zijn moeilijk eerlijk te vergelijken, en een demo die is uitgekiend op een korte, gunstige route door een omgeving zegt bijna niets over het gedrag over een langere sessie. Wacht op praktijktests voordat je een pijplijn herschrijft.

Wat je vandaag op OmniArt kunt doen

OmniArt biedt geen generatie met realtime wereldmodellen, en dat zeggen we liever gewoon dan dat we de grens vervagen. Wat de videowerkruimte wel biedt, is de huidige line-up in batch op één plek — Seedance 2.0, Veo 3.1, Kling, Sora 2, PixVerse V6 en C1, Google Gemini Omni, Happy Horse en Grok Imagine — met één tegoed en één promptgrammatica over alles heen.

Dat is nuttiger voor de interactieve toekomst dan het klinkt. De manier om er klaar voor te zijn, is snel worden in de onderdelen die meegaan:

  1. Itereer op de goedkope niveaus. Schets een shot op een snelle of mini-variant, leg de compositie en de beweging vast en draai dezelfde briefing daarna op een hoger niveau. Dat is het equivalent in batch van een interactieve lus, en zo leer je wat een briefing eigenlijk vraagt.
  2. Werk in vervolgen, niet in losse schoten. OmniArt heeft aparte modellen Grok Imagine Extend en Modify die op een afgeronde clip werken — hem verlengen of aanpassen in plaats van opnieuw genereren vanaf nul — en Extend werkt op beeld uit elk model in de videowerkruimte. Je kunt ook handmatig aaneenrijgen: gebruik de overgangsmodus, of geef het laatste frame van de ene clip terug als beginbeeld van de volgende. Hoe dan ook bouwt denken in vervolgen precies de opeenvolgende, toestandsbewuste gewoonten op die interactief genereren zal vragen.
  3. Vergelijk modellen op dezelfde briefing. Eén prompt, meerdere modellen, naast elkaar. Het is de enige eerlijke manier om in dit veld iets te beoordelen, en het is de gewoonte waarmee je een werkelijk nieuwe mogelijkheid in een middag inschat in plaats van in een kwartaal.

Een volledige rondleiding langs de modellen in de werkruimte staat in alle AI-videomodellen in één werkruimte. Wil je nu een shot starten, ga dan naar de aanmaakpagina.

FAQ

Is realtime AI-video vandaag beschikbaar voor makers?

Snel renderen wel. Echt interactief, stuurbaar genereren is nog een opkomende mogelijkheid met demo’s en vroege producten, geen betrouwbaar productiegereedschap. Afgerond videowerk draait op batchmodellen.

Wat is het verschil tussen een wereldmodel en een model voor tekst naar video?

Een model voor tekst naar video maakt van een prompt een afgeronde clip. Een wereldmodel houdt een blijvende interne toestand van een scène bij en genereert daar blikken op als reactie op lopende acties, en daarom telt samenhang bij terugkeer naar een plek zwaarder dan de kwaliteit van de clip.

Gaan wereldmodellen batchvideomodellen vervangen?

Onwaarschijnlijk, in elk geval niet als categorie. De twee optimaliseren tegenovergestelde uiteinden van dezelfde afweging tussen vertraging en kwaliteit, dus je kunt ze beter zien als aanvullend gereedschap dan als opeenvolgende generaties.

Wat kan ik nu leren om er klaar voor te zijn?

Precies een scène beschrijven, camera en licht regisseren, consistentie over shots bewaken en een herhaalbare vergelijkingsgewoonte. Het verhuist allemaal mee, hoe de interface er uiteindelijk ook uitziet.

Klaar om te maken?

Ga aan de slag en genereer content met AI

Gratis aan de slag