DeepSeek V4 multimodal: lo que los creadores necesitan saber
DeepSeek V4 multimodal: contexto de 1M de tokens, precios de V4-Flash y V4-Pro, la arquitectura CSA + HCA y qué significa para los creadores dentro del stack de OmniArt.

DeepSeek V4 salió el 24 de abril de 2026 con dos niveles, un contexto de 1 millón de tokens y una longitud máxima de salida de 384K. No es un modelo de video y tampoco intenta reemplazar a uno. Lo que V4 sí cambia es la capa que está encima del stack visual: el brief, el storyboard, el manual de marca, la recuperación de contexto largo que convierte “haz una campaña” en “haz una campaña que respete cada rodaje que hicimos este año”. Este artículo cubre qué es DeepSeek V4, qué le aporta a quien crea con OmniArt y dónde encaja junto al resto del catálogo de modelos.
Qué es DeepSeek V4
DeepSeek V4 es un modelo de razonamiento con contexto largo y uso de herramientas, con dos niveles de producción —V4-Flash y V4-Pro— disponibles mediante una API compatible con OpenAI en api.deepseek.com. El contexto de 1M de tokens más las llamadas estructuradas a herramientas son el titular; debajo, la arquitectura usa atención dispersa comprimida (CSA) más atención comprimida pesada (HCA), que es lo que evita que el costo escale de forma lineal con la longitud del contexto.
| Nivel | Parámetros totales | Parámetros activos | Tokens de preentrenamiento | Precio de salida | Precio de entrada (sin caché) |
|---|---|---|---|---|---|
| V4-Flash | 284B | 13B | 32T | ¥2 / 1M tokens (~USD 0.28) | ¥1 / 1M tokens |
| V4-Pro | 1.6T | 49B | 33T | ¥24 / 1M tokens (~USD 3.48) | ¥12 / 1M tokens |
Los dos niveles topan la salida en 384K tokens. Los dos sirven los modos “con razonamiento” y “sin razonamiento” desde el mismo modelo: V4 unifica lo que antes atendían V3 y R1 por separado.
La arquitectura en un párrafo
Lo interesante es CSA + HCA. La atención dispersa comprimida acota la atención a un número pequeño de tokens con mucha información en cada capa; la atención comprimida pesada suma encima una compresión densa. La combinación es lo que vuelve costeable el contexto de 1M, en lugar de un trofeo de benchmark. DeepSeek entrenó y sirve V4 sobre infraestructura de clase Huawei Ascend, y no sobre un stack exclusivamente CUDA, con la adaptación de vLLM de Cambricon encargándose de la optimización de inferencia.
Benchmarks que vale la pena citar
| Benchmark | Resultado |
|---|---|
| Arena.ai, arena de código open source | V4-Pro n.º 3 |
| Arena.ai, general | V4-Pro n.º 14 |
| Vals AI Vibe Code Benchmark | V4 n.º 1 entre modelos de pesos abiertos |
| Vibe Code contra V3.2 | Salto de rendimiento de ~10× |
| Conjunto competitivo de modelos cerrados | Le gana a Gemini 3.1 Pro en escenarios puntuales |
El propio mensaje de DeepSeek es honesto sobre la brecha: V4 “sigue quedando entre tres y seis meses detrás de los mejores sistemas cerrados en conocimiento complejo y capacidad de razonamiento”. Para la mayoría de los flujos creativos esa brecha no aprieta, pero conviene saber que existe.
Qué cambió entre V3, R1 y V4
V3 era un modelo fuerte de texto y código. R1 era un modelo de razonamiento con cadena de pensamiento. V4 unifica ambos modos en un solo modelo con rutas de inferencia seleccionables, con y sin razonamiento. El contexto pasó de 128K (V3) a 1M (V4). El uso de herramientas y la recuperación de contexto largo ahora son ciudadanos de primera clase, y no un parche.
| Capacidad | V3 | R1 | V4 |
|---|---|---|---|
| Contexto | 128K | 128K | 1M |
| Modo de razonamiento | No | Sí (por defecto) | Conmutable |
| Uso de herramientas | Limitado | Limitado | De primera clase |
| Multimodal | No | No | En hoja de ruta (en curso) |
Qué significa multimodal acá, y qué todavía no
El lanzamiento de V4 vendió a propósito por lo bajo la parte multimodal. El comunicado describió la matriz de funciones multimodales como “en evolución continua”: hoy no hay puntos de entrada publicados de imagen, video ni audio a nivel de API. Eso no es un reproche, es una señal de hoja de ruta. El valor actual de V4 para creadores está en el texto de contexto largo y en los flujos con herramientas que envuelven al stack visual, no adentro de él.
Cuando aterricen los puntos de entrada multimodales, se integrarán al selector de modelos de OmniArt igual que lo hicieron GPT Image 2 y el resto. Hasta entonces, trata a V4 como el cerebro que conduce el brief.
Qué hacen hoy los creadores con V4
Tres patrones se ganan su lugar en OmniArt ahora mismo.
1. Manuales de marca como contexto de 1M de tokens
El contexto de 1M sostiene con holgura un manual de marca completo, cada campaña publicada, la guía de tono de voz, la ficha de personaje, la lista de lo que no se dice y los últimos doce meses de textos de publicaciones. Fija todo eso como contexto de sistema y después pídele a V4 que redacte un brief de lanzamiento. El resultado respeta el conjunto documental entero sin una ida y vuelta por embeddings.
2. Generación estructurada de formato largo
La salida topa en 384K tokens. Alcanza para redactar una biblia narrativa completa, un storyboard de seis episodios con listas de planos o una especificación de localización de 50 páginas en una sola pasada. Para trabajos más cortos, V4-Flash a ~USD 0.28 por 1M de tokens de salida lo convierte en la forma confiable más barata de redactar contenido estructurado de formato largo.
3. Agentes con herramientas al frente que conducen el stack visual
La disciplina de V4 en las llamadas a herramientas es la parte que importa cuando lo conectas a generadores de imagen y video. Dale la superficie de API de OmniArt y un brief, y te propondrá el modelo, el prompt y las referencias plano por plano. Ese es el patrón alrededor del cual OmniArt está construyendo la integración.
Elegir entre V4-Flash y V4-Pro
La relación de precio es de aproximadamente 12×: Flash para ideación de alto volumen, Pro para las sesiones donde la profundidad importa más que el costo por token.
| Trabajo | Elige |
|---|---|
| Lluvia de ideas, borradores, iteración de titulares | V4-Flash |
| Razonamiento sobre el manual de marca, construcción narrativa | V4-Pro |
| Recuperación de contexto largo sobre el historial de campañas | V4-Pro |
| Ciclos de agente con herramientas que conducen imagen y video | V4-Pro para planear, V4-Flash para ejecutar |
Cómo encaja V4 junto al resto del stack de OmniArt
V4 no reemplaza a los modelos de imagen y video de OmniArt. Es la capa de planeación por encima de ellos. El patrón que está apareciendo:
| Capa | Trabajo | Modelo |
|---|---|---|
| Planear | Brief, storyboard, lista de planos, razonamiento de marca | DeepSeek V4-Pro |
| Imagen | Fijas, fotogramas de referencia, layout | Nano Banana Pro, GPT Image 2, Seedream 5.0 Lite |
| Video | Planos animados, secuencias multi-shot | V6 / BACH, Sora 2, Veo 3, Seedance 2.0, HappyHorse 1.0 |
| Iterar | Reestilizar, extender, modificar | Grok Imagine, Runway Gen-4.5 |
Nota
Los puntos de entrada multimodales de V4 están en la hoja de ruta publicada por DeepSeek, pero todavía no en el selector de modelos de OmniArt. Publicaremos un seguimiento el día que lleguen: créditos, prompts recomendados y su lugar en el stack.
Qué mirar a continuación
Tres señales que vale la pena seguir en los próximos dos meses.
- Puntos de entrada multimodales en la API. Cuando DeepSeek los publique, se reabre la conversación sobre el selector de modelos.
- Variantes destiladas de V4. Reportes previos mencionaron un V4 Lite y una variante más chica. Cualquiera de las dos podría cambiar el panorama de costos para agentes de alto volumen con llamadas a herramientas.
- La historia del hardware. La ruta de inferencia de clase Huawei Ascend importa en regiones donde los modelos solo CUDA son más difíciles de desplegar.
Empezar en OmniArt
DeepSeek V4 todavía no es un modelo de un clic en el selector de OmniArt: su casa actual es la API. Si hoy quieres usarlo como capa de planeación sobre OmniArt, condúcelo desde el endpoint compatible con OpenAI en api.deepseek.com y apunta su superficie de llamadas a herramientas a la API de OmniArt para generar imagen y video.
Como lectura de fondo sobre el lado visual del stack, la comparativa entre GPT Image 2 y Nano Banana 2 cubre la decisión del selector de imagen insignia, y la lista corta de imagen a video cubre las opciones de video que V4 terminará conduciendo.
¿Todo listo para crear?
Empieza a generar contenido increíble con IA