IndustryModelos e insights8 min de lectura

DeepSeek V4 multimodal: lo que los creadores deben saber

DeepSeek V4 multimodal: contexto de 1M de tokens, precios de V4-Flash y V4-Pro, la arquitectura CSA + HCA y qué significa para los creadores en el stack de OmniArt.

Equipo OmniArt
DeepSeek V4 multimodal: lo que los creadores deben saber

DeepSeek V4 se lanzó el 24 de abril de 2026 con dos modos de producción, un contexto de un millón de tokens y una longitud máxima de salida de 384K. No es un modelo de vídeo y tampoco pretende sustituir a ninguno. Lo que V4 cambia de verdad es la capa que hay por encima del stack visual: el briefing, el storyboard, la biblia de marca y la recuperación de contexto largo que convierte «haz una campaña» en «haz una campaña que respete cada rodaje que hemos hecho este año». Este artículo cubre qué es DeepSeek V4, qué aporta a los creadores que usan OmniArt y dónde encaja junto al resto del catálogo de modelos.

¿Qué es DeepSeek V4?

DeepSeek V4 es un modelo de razonamiento de contexto largo y uso de herramientas con dos modos de producción — V4-Flash y V4-Pro — disponibles ambos a través de una API compatible con OpenAI en api.deepseek.com. El titular es el contexto de 1M de tokens sumado a las llamadas a herramientas estructuradas; por debajo, la arquitectura usa atención dispersa comprimida (CSA) más atención comprimida densa (HCA), que es lo que evita que el coste escale linealmente con la longitud del contexto.

ModoParámetros totalesParámetros activosTokens de preentrenamientoPrecio de salidaPrecio de entrada (sin caché)
V4-Flash284B13B32T¥2 / 1M de tokens (~$0.28)¥1 / 1M de tokens
V4-Pro1.6T49B33T¥24 / 1M de tokens (~$3.48)¥12 / 1M de tokens

Los dos modos limitan la salida a 384K tokens. Los dos sirven «thinking» y «non-thinking» desde el mismo modelo: V4 unifica lo que V3 y R1 gestionaban por separado.

La arquitectura en un párrafo

Lo interesante es la combinación de CSA y HCA. La atención dispersa comprimida reduce la atención a un número pequeño de tokens de alta información en cada capa; la atención comprimida densa añade encima una compresión densa. Esa combinación es lo que hace que el contexto de 1M sea asequible en lugar de un trofeo de benchmark. DeepSeek entrena y sirve V4 sobre infraestructura de clase Huawei Ascend en vez de un stack exclusivo de CUDA, con la adaptación de vLLM de Cambricon encargándose de la optimización de la inferencia.

Benchmarks que merece la pena citar

BenchmarkResultado
Arena.ai, arena de código open sourceV4-Pro #3
Arena.ai, clasificación generalV4-Pro #14
Vals AI Vibe Code BenchmarkV4 #1 entre los modelos open-weight
Vibe Code frente a V3.2Salto de rendimiento de ~10×
Conjunto competitivo de modelos cerradosSupera a Gemini 3.1 Pro en escenarios seleccionados

El propio mensaje de DeepSeek es honesto sobre la brecha: V4 «sigue por detrás de los sistemas cerrados punteros en unos tres a seis meses en conocimiento complejo y capacidad de razonamiento». Para la mayoría de flujos de trabajo de creadores esa brecha no ata en corto, pero conviene saber que existe.

Qué cambió entre V3, R1 y V4

V3 era un modelo sólido de texto y código. R1 era un modelo de razonamiento con cadena de pensamiento. V4 unifica los dos modos bajo un único modelo con rutas de inferencia thinking y non-thinking seleccionables. El contexto pasó de 128K (V3) a 1M (V4). El uso de herramientas y la recuperación de contexto largo son ahora de primera clase en lugar de un parche añadido.

CapacidadV3R1V4
Contexto128K128K1M
Modo de razonamientoNoSí (por defecto)Conmutable
Uso de herramientasLimitadoLimitadoDe primera clase
MultimodalNoNoEn hoja de ruta (en curso)

Qué significa multimodal aquí — y qué no significa (todavía)

El lanzamiento de V4 vendió a la baja la parte multimodal de forma deliberada. La nota describía la matriz de funciones multimodales como «en continua evolución»: hoy no hay puntos de entrada publicados de imagen, vídeo ni audio a nivel de API. No es un reproche, es una señal de hoja de ruta. El valor actual de V4 para creadores está en el texto de contexto largo y en los flujos guiados por herramientas que envuelven el stack visual, no dentro de él.

Cuando aterricen los puntos de entrada multimodales, se integrarán en el selector de modelos de OmniArt igual que hicieron GPT Image 2 y el resto. Hasta entonces, trata V4 como el cerebro que dirige el briefing.

Qué hacen realmente los creadores con V4 hoy

Hay tres patrones que se ganan su sitio en OmniArt ahora mismo.

1. Biblias de marca como contexto de 1M de tokens

El contexto de 1M alberga cómodamente un libro de marca completo, todas las campañas publicadas, la guía de tono de voz, la ficha de personaje, la lista de lo que no se dice y los doce últimos meses de copy de publicaciones. Fija todo eso como contexto de sistema y pídele a V4 que redacte un briefing de lanzamiento. La salida respeta el conjunto documental entero sin una ida y vuelta a los embeddings.

2. Generación estructurada de formato largo

La salida está limitada a 384K tokens. Es suficiente para redactar una biblia narrativa entera, un storyboard de seis episodios con sus listas de planos o una especificación de localización de 50 páginas en una sola pasada. Para trabajos más cortos, V4-Flash a unos $0.28 por cada 1M de tokens de salida convierte esto en la forma más barata y fiable de redactar contenido estructurado de formato largo.

3. Agentes tool-first que dirigen el stack visual

La disciplina de llamada a herramientas de V4 es la parte que importa cuando lo conectas a generadores de imagen y vídeo. Dale la superficie de la API de OmniArt, entrégale un briefing y te propondrá el modelo, el prompt y las referencias plano a plano. Ese es el patrón alrededor del cual OmniArt está construyendo la integración.

Cómo elegir entre V4-Flash y V4-Pro

La proporción de precio es de aproximadamente 12×: Flash para ideación de alto volumen, Pro para las sesiones en las que la profundidad importa más que el coste por token.

TrabajoElección
Lluvia de ideas, redacción, iteración de titularesV4-Flash
Razonamiento sobre la biblia de marca, construcción narrativaV4-Pro
Recuperación de contexto largo sobre el histórico de campañasV4-Pro
Bucles de agente que dirigen imagen y vídeoV4-Pro para planificar, V4-Flash para ejecutar

Cómo encaja V4 junto al resto del stack de OmniArt

V4 no sustituye a los modelos de imagen y vídeo de OmniArt. Es la capa de planificación que está por encima de ellos. El patrón que va emergiendo:

CapaTrabajoModelo
PlanificaciónBriefing, storyboard, lista de planos, razonamiento de marcaDeepSeek V4-Pro
ImagenFotogramas fijos, fotogramas de referencia, maquetaciónNano Banana Pro, GPT Image 2, Seedream 5.0 Lite
VídeoPlanos animados, secuencias de varios planosV6 / BACH, Sora 2, Veo 3, Seedance 2.0, HappyHorse 1.0
IteraciónReestilizar, extender, modificarGrok Imagine, Runway Gen-4.5

Nota

Los puntos de entrada multimodales de V4 están en la hoja de ruta publicada de DeepSeek, pero todavía no en el selector de modelos de OmniArt. Publicaremos un artículo de seguimiento el mismo día en que aterricen: créditos, prompts recomendados y su lugar dentro del stack.

Qué vigilar a continuación

Hay tres señales que merece la pena seguir en los próximos dos meses.

  • Puntos de entrada de la API multimodal. Cuando DeepSeek los publique, se reabre la conversación sobre el selector de modelos.
  • Variantes destiladas de V4. Informaciones anteriores apuntaban a V4 Lite y a una variante más pequeña de V4. Ambas podrían cambiar la estructura de coste de los agentes de llamada a herramientas de alto volumen.
  • El relato del hardware. La vía de inferencia de clase Huawei Ascend importa en regiones donde desplegar modelos exclusivos de CUDA resulta más difícil.

Cómo empezar en OmniArt

DeepSeek V4 todavía no es un modelo de un solo clic en el selector de OmniArt: su casa actual es la API. Si hoy quieres usarlo como capa de planificación por encima de OmniArt, gobiérnalo a través del endpoint compatible con OpenAI en api.deepseek.com y apunta su superficie de llamada a herramientas a la API de OmniArt para la generación de imagen y vídeo.

Como lectura de fondo sobre el lado visual del stack, la comparativa entre GPT Image 2 y Nano Banana 2 cubre la decisión del selector de imagen insignia, y la lista breve de los mejores modelos de imagen a vídeo cubre las opciones del lado de vídeo que V4 acabará dirigiendo.

¿Listo para crear?

Empieza a generar contenido increíble con IA

Empezar gratis