IndustryModellen en inzichten7 min lezen

DeepSeek V4 multimodaal: wat makers moeten weten

DeepSeek V4 multimodaal — context van 1 miljoen tokens, prijzen van V4-Flash en V4-Pro, de architectuur met CSA en HCA, en wat dat betekent voor makers binnen de stack van OmniArt.

OmniArt-team
DeepSeek V4 multimodaal: wat makers moeten weten

DeepSeek V4 ging op 24 april 2026 live met twee niveaus, een context van 1 miljoen tokens en een maximale uitvoerlengte van 384K. Het is geen videomodel en het probeert er ook geen te vervangen. Wat V4 werkelijk verandert, is de laag boven de visuele stack — de briefing, het storyboard, het merkboek, en het ophalen uit lange context dat “maak een campagne” verandert in “maak een campagne die elke opname van dit jaar respecteert”. Dit stuk behandelt wat DeepSeek V4 is, wat het oplevert voor makers die OmniArt gebruiken, en waar het past naast de rest van het modelaanbod.

Wat DeepSeek V4 is

DeepSeek V4 is een model voor redeneren met lange context en het gebruik van tools, met twee productieniveaus — V4-Flash en V4-Pro — die allebei beschikbaar zijn via een OpenAI-compatibele API op api.deepseek.com. De context van 1M tokens plus gestructureerde toolaanroepen zijn de kop; de architectuur eronder gebruikt compressed sparse attention (CSA) plus heavy compressed attention (HCA), en dat is wat voorkomt dat de kosten lineair meegroeien met de contextlengte.

NiveauTotaal aantal parametersActieve parametersPretraintokensUitvoerprijsInvoerprijs (cache miss)
V4-Flash284B13B32T¥ 2 per 1M tokens (~$ 0,28)¥ 1 per 1M tokens
V4-Pro1,6T49B33T¥ 24 per 1M tokens (~$ 3,48)¥ 12 per 1M tokens

Beide niveaus begrenzen de uitvoer op 384K tokens. Beide bedienen vanuit hetzelfde model een “thinking”- en een “non-thinking”-modus — V4 verenigt wat V3 en R1 vroeger apart afhandelden.

De architectuur in één alinea

Het interessante deel is CSA plus HCA. Compressed sparse attention beperkt de aandacht per laag tot een klein aantal tokens met veel informatie; heavy compressed attention legt daar dichte compressie bovenop. Die combinatie maakt de context van 1M betaalbaar in plaats van een benchmarktrofee. DeepSeek trainde en bedient V4 op infrastructuur van het Huawei Ascend-type in plaats van een stack die alleen op CUDA draait, waarbij de vLLM-aanpassing van Cambricon de inferentieoptimalisatie doet.

Benchmarks die het citeren waard zijn

BenchmarkResultaat
Arena.ai open-source code arenaV4-Pro nummer 3
Arena.ai algemeenV4-Pro nummer 14
Vals AI Vibe Code BenchmarkV4 nummer 1 onder modellen met open gewichten
Vibe Code ten opzichte van V3.2sprong van ongeveer 10× in prestaties
Vergelijkingsgroep van gesloten modellenVerslaat Gemini 3.1 Pro in bepaalde scenario’s

DeepSeek is in de eigen communicatie eerlijk over het gat: V4 “loopt bij complexe kennis en redeneervermogen nog ongeveer drie tot zes maanden achter op de allerbeste gesloten systemen”. Voor de meeste workflows van makers knelt dat gat niet — maar het is goed om te weten dat het bestaat.

Wat er tussen V3, R1 en V4 is veranderd

V3 was een sterk model voor tekst en code. R1 was een redeneermodel met een gedachteketen. V4 verenigt beide modi in één model met te kiezen inferentiepaden mét en zonder redeneerstap. De context groeide van 128K (V3) naar 1M (V4). Toolgebruik en ophalen uit lange context zijn nu eersteklas onderdelen in plaats van een aangeplakte oplossing.

MogelijkheidV3R1V4
Context128K128K1M
RedeneermodusNeeJa (standaard)In te schakelen
ToolgebruikBeperktBeperktEersteklas
MultimodaalNeeNeeOp de roadmap (in ontwikkeling)

Wat multimodaal hier betekent — en wat (nog) niet

DeepSeek hield het multimodale deel bij de lancering van V4 bewust klein. De release beschreef de multimodale functiematrix als “continuing to evolve” — er zijn vandaag op API-niveau geen gepubliceerde ingangen voor beeld, video of audio. Dat is geen verwijt; het is een signaal over de roadmap. De huidige waarde van V4 voor makers zit in tekst met lange context en in workflows met tools die de visuele stack omsluiten, niet erin.

Zodra de multimodale ingangen er zijn, vouwen ze zich in de modelkiezer van OmniArt op dezelfde manier als GPT Image 2 en de rest dat deden. Behandel V4 tot die tijd als het brein dat de briefing aanstuurt.

Wat makers vandaag echt met V4 doen

Drie patronen verdienen op OmniArt nu al hun plek.

1. Merkboeken als context van 1M tokens

De context van 1M houdt moeiteloos een volledig merkboek vast, elke gepubliceerde campagne, de gids voor tone of voice, het personageblad, de lijst met woorden die niet mogen, en twaalf maanden aan postteksten. Zet dat allemaal vast als systeemcontext en vraag V4 daarna om een lanceringsbriefing te schrijven. Het resultaat respecteert de hele documentenset zonder een omweg via embeddings.

2. Gestructureerde generatie in lange vorm

De uitvoer is begrensd op 384K tokens. Dat is genoeg om in één keer een volledige verhaalbijbel, een storyboard van zes afleveringen met shotlijsten of een lokalisatiespecificatie van 50 pagina’s te schrijven. Voor korter werk maakt V4-Flash op ongeveer $ 0,28 per 1M uitvoertokens dit tot de goedkoopste betrouwbare manier om gestructureerde lange teksten op te zetten.

3. Agents die eerst naar tools grijpen en de visuele stack aansturen

De discipline van V4 bij toolaanroepen is het onderdeel dat telt zodra je het aan beeld- en videogeneratoren koppelt. Geef het de API van OmniArt en een briefing, en het stelt shot voor shot het model, de prompt en de referenties voor. Dat is het patroon waar OmniArt zijn integratie omheen bouwt.

Kiezen tussen V4-Flash en V4-Pro

De prijsverhouding is ongeveer 12× — Flash voor ideeën in grote hoeveelheden, Pro voor de sessies waarin diepgang zwaarder weegt dan tokenkosten.

KlusKeuze
Brainstormen, schrijven, koppen itererenV4-Flash
Redeneren over het merkboek, verhaalopbouwV4-Pro
Ophalen uit lange context over de campagnehistorieV4-Pro
Agentlussen met tools die beeld en video aansturenV4-Pro om te plannen, V4-Flash om uit te voeren

Hoe V4 past naast de rest van de OmniArt-stack

V4 vervangt de beeld- en videomodellen in OmniArt niet. Het is de planlaag erboven. Het patroon dat zich aftekent:

LaagKlusModel
PlannenBriefing, storyboard, shotlijst, redeneren over het merkDeepSeek V4-Pro
BeeldStills, referentieframes, indelingNano Banana Pro, GPT Image 2, Seedream 5.0 Lite
VideoBewegende shots, multi-shot-reeksenV6 / BACH, Sora 2, Veo 3, Seedance 2.0, HappyHorse 1.0
ItererenHerstijlen, verlengen, aanpassenGrok Imagine, Runway Gen-4.5

Let op

De multimodale ingangen voor V4 staan op de gepubliceerde roadmap van DeepSeek, maar zitten nog niet in de modelkiezer van OmniArt. We publiceren een vervolg op de dag dat ze er zijn — credits, aanbevolen prompts en waar ze in de stack passen.

Wat je hierna in de gaten houdt

Drie signalen die de komende twee maanden het volgen waard zijn.

  • Multimodale API-ingangen. Zodra DeepSeek die publiceert, gaat het gesprek over de modelkiezer weer open.
  • Gedistilleerde varianten van V4. Eerdere berichtgeving noemde V4 Lite en een kleinere V4-variant. Beide kunnen het kostenplaatje voor agents met veel toolaanroepen veranderen.
  • Het hardwareverhaal. Het inferentiepad van het Huawei Ascend-type doet ertoe in regio’s waar modellen die alleen op CUDA draaien lastiger uit te rollen zijn.

Beginnen op OmniArt

DeepSeek V4 is nog geen model dat je met één klik in de kiezer van OmniArt aanzet — het woont op dit moment in de API. Wil je het vandaag als planlaag boven OmniArt gebruiken, stuur het dan aan via het OpenAI-compatibele eindpunt op api.deepseek.com en richt de toolaanroepen op de API van OmniArt voor beeld- en videogeneratie.

Als achtergrond bij de visuele kant van de stack behandelt de vergelijking van GPT Image 2 en Nano Banana 2 de keuze tussen de vlaggenschipmodellen voor beeld, en dekt de shortlist voor beeld naar video de videokant die V4 uiteindelijk gaat aansturen.

Klaar om te maken?

Ga aan de slag en genereer content met AI

Gratis aan de slag